端侧训练(On-Device Training)

本专题整理 端侧训练(on-device training):在手机、平板与边缘设备上对 LLM 做 fine-tuning——主流载体是 LoRA [1] 级别的参数高效微调,硬件上覆盖 CPU / GPU / NPU 三条路线;算法上则正从"用户手动准备数据集、点一次 Fine-Tune",走向 模型在用户设备上根据自己的交互结果持续训练自己。 本专题按论文逐篇成页(见 §4 收录条目),本页负责纵览与综合。

💭 总判断(截至 2026 年 9)

端侧 LoRA 的"训练系统"已基本可行;真正刚起步的,是"模型在用户设备上 根据自己的交互结果持续训练自己"。 三条硬件路线的现状:

  • GPU 路线最成熟:精确 backpropagation(BP)已经能塞进手机(MeBP、MeSP), 讨论焦点已从"手机能不能 BP"转向"怎么优化 mobile GPU 的 training kernel/layout"(FBLayout);
  • CPU 最通用但慢:免反传(MeZO)与原生 C++ 训练框架都先在 CPU 上跑通, 但它的长期角色是控制逻辑、optimizer 与 fallback,而不是承担 1B–3B 模型的 dense matmul;
  • NPU 最有长期潜力,训练软件栈最不成熟:推理加速器做训练, 要么绕开 backward(MobiZO 的 zeroth-order 路线), 要么用私有 API 原生编译 forward + backward(Orion 与 ANE 社区路线)。

1. Road Tree:硬件路线纵览

端侧训练 On-Device Training2023 → 2026 · 硬件路线 × 代表工作
CPU最通用 · 慢 · 适合控制与兜底
PocketLLM [3]2024 · PrivateNLP ↗
免反传 MeZO真机可行性验证
OPPO Reno 6 训 OPT-1.3B:约 6.5 GB,一步约 1800 秒——证明"能训",不证明"实用"
MobileFineTuner [7]2025 · arXiv ↗
精确 BP原生 C++LoRA / Full-FT开源
Android 端到端训练栈:activation checkpointing、梯度累积、参数分片、能耗感知调度
GPU当前最成熟 · 精确 BP 塞进手机
PockEngine [2]2023 · MICRO ↗
稀疏 BP训练图编译CPU/GPU/DSP
端侧训练起点:Jetson AGX Orin 上 550 tokens/s 微调 LLaMA-2-7B(7.9× vs PyTorch)
MeBP [6]2025 · EMNLP Industry ↗
精确 BP重算换内存LoRA开源
iPhone 15 Pro Max:0.5B–4B 训练内存压进 1 GB(INT4 量化,QLoRA 风格)
MeSP [9]2026 · ACL Industry ↗
精确 BPLoRA 结构化梯度无损
iPhone 17 Pro:连 LoRA 中间结果也不存,Qwen2.5-0.5B 峰值 361→136 MB(平均 -49%)
FBLayout [8]2026 · MobiSys ↗
训练 kernellayout 优化2.2–5.7× 加速
Adreno / Mali GPU:R-Tile 统一 forward/backward 数据布局,消除转置与搬运
NPU潜力最大 · 软件栈最不成熟
MobiZO [5]2024 · arXiv ↗
ZO 免反传推理引擎复用MP-LoRA真机 NPU
路线 A:OnePlus 12 Hexagon NPU,TinyLlama-1.1B 5.76 s/step,不改 runtime
maderix/ANE2026 · GitHub ↗
逆向私有 API原生 BP社区原型
路线 B:Stories110M 91 ms/step、Qwen3-0.6B 412 ms/step(M4),dx 在 ANE / dW 在 CPU
Orion [10]2026 · arXiv ↗
原生 BP⚠️ 私有 APILoRA 热插拔
首个开放端到端 ANE 训练系统:110M 模型 1000 步 22 分钟零 NaN(实验在 M4 Max)
学习信号与长期积累从训练系统走向自我递归闭环 ↺
Online-SDFT [12]2026 · 项目页 ↗
hindsight 自蒸馏闭环LoRA rank-4开源
Android 真机 PoC:teacher 是知道结果之后的自己,模型边用边学
TMEM [13]2026 · arXiv ↗
Agentparametric memory服务端
经验写进 fast LoRA weights,单个 episode 内改变后续行为
K-Merge [11]2026 · ACL ↗
持续学习data-free 合并防遗忘
设备只存 K 个 adapter:新 LoRA 到达时的在线选择与合并

第四列就是模型自我递归训练(见 Online-SDFT)的入口: 模型的行为产生经验,经验又变成训练信号改写模型自身——"边用边学", 而不是人工喂一个数据集再点一次微调。与硬件三条路线正交的联邦方向 (HetLoRA [4],异构设备联邦 LoRA)不在本图展开。

2. 三条硬件路线

2.1 CPU 路线

早期最可行的一步:干脆不做 backward,用 MeZO(zeroth-order) 只做 forward 估计梯度(PocketLLM 在 OPPO Reno 6 上训了 RoBERTa-large 与 OPT-1.3B,一步约 1800 秒);后继 MobileFineTuner 换成原生 C++ 精确 BP 框架。

💡 CPU 的长期定位

控制逻辑 + optimizer + 小 LoRA update + fallback —— 而不是让 CPU 单独承担 1B–3B 模型的 dense matmul。

2.2 GPU 路线(当前最成熟)

LoRA [1] 省参数,但不省 backbone activation——精确 BP 仍然内存爆炸。 四个节点:PockEngine 确立训练图编译 + 稀疏更新范式; MeBP逐层重算把 0.5B–4B 模型的训练内存压到 1 GB 以下; MeSP 进一步发现 LoRA 中间结果 h=xAh = xA 可以在 backward 里 廉价重算(rdr \ll d),连 LoRA activation 也不用存; FBLayout 解决 memory 之后的下一个瓶颈——mobile GPU 上 forward/backward 的 layout 转换开销

💡 关键结论

端侧 LoRA 不一定需要 ZO:重新设计 backward 之后, 一阶精确训练已经可以塞进手机。

2.3 NPU 路线(最有意思)

NPU(Hexagon / ANE)本质是 inference accelerator:静态图编译、无 autograd。两条对策完全相反:

  • 路线 A:不要 backward——MobiZO 用推理引擎 + zeroth-order + MP-LoRA,NPU 只做最擅长的 forward,已跑通 OnePlus 12 Hexagon NPU;
  • 路线 B:真的让 NPU backward——maderix/ANEOrion 逆向 Apple 私有 API,直接给 ANE 编译 forward + backward 图,证明 NPU 硬件本身能训 Transformer, 缺的只是软件栈。
路线 A:ZO 复用推理引擎 路线 B:原生 NPU 训练
backward 无(两次 forward 差分) 真正的 forward + backward 图
梯度 近似(噪声大,收敛慢) 精确
软件栈 ExecuTorch,零 runtime 改动,现在就能跑 私有 API + 自研编译器,研究原型
适配代价 依平台后端而定 每代 NPU 需重新逆向/刻画

3. 终局形态:异构训练与训练时机

最终端侧架构很可能不是 CPU/GPU/NPU 三选一,而是分工协作:

💡 异构训练设想

NPU forward + GPU backward/LoRA + CPU optimizer/control; 更激进的版本:NPU forward + ZO LoRA update + CPU optimizer

而且训练不应每次交互都立即发生——更像手机后台的 photo indexing / backup:先攒样本,再在空闲时段批量训练。

flowchart TD A["Agent / VLM 交互"] --> B["NPU / GPU 推理"] B --> C["用户反馈 / 事后观察 z_t"] C --> D{"生成训练信号"} D -->|自蒸馏| E["训练样本"] D -->|奖励 / 纠错| E E --> F["积累 ~100 条 → replay buffer"] F --> G{"空闲时段:充电 / 息屏 / 低温 / 夜间"} G --> H["GPU:精确 BP (MeSP)"] G --> I["NPU:ZO forward (MobiZO)"] H --> J["rank-4/8 LoRA"] I --> J J --> K["验证 / 门控"] K --> L["部署 adapter"] L --> M["第二天继续交互"]

一个直观的例子(视觉 Agent 学会用户的世界):

模型:"这是用户的钥匙。"
用户:"不,这是车钥匙,另一个才是家门钥匙。"
        ↓ 产生 correction pair
        ↓ 端侧 LoRA update

此后它不必靠 RAG 每次检索"用户说过这是车钥匙",而是真的学会用户的 视觉世界。Engram / RAG 是 memory(记住发生过什么),LoRA 是 learning(根据经历改变以后怎么做)——两者互补 (参见 Engram:条件记忆)。

把"端侧自我进化 agent"拆开,三件工作各补一角:

Online-SDFT   →  训练信号从哪里来(hindsight → teacher target)
TMEM          →  LoRA 怎么成为长期 parametric memory(agent 视角)
MeSP / MobiZO →  手机硬件上到底怎么训练(GPU 精确 BP / NPU ZO)

三者拼起来,已经非常接近一个真正的 on-device self-evolving multimodal agent

4. 收录条目

CPU 路线

GPU 路线

NPU 路线

学习信号与长期积累

5. 相关专题

参考文献

[1] HU E J, SHEN Y, WALLIS P, et al. LoRA: low-rank adaptation of large language models[C]//International Conference on Learning Representations (ICLR). 2022. https://arxiv.org/abs/2106.09685

[2] ZHU L, HU L, LIN J, et al. PockEngine: sparse and efficient fine-tuning in a pocket[C]//Proceedings of the 56th IEEE/ACM International Symposium on Microarchitecture (MICRO). 2023. https://arxiv.org/abs/2310.17752

[3] PENG D, FU Z, WANG J. PocketLLM: enabling on-device fine-tuning for personalized LLMs[C]//Proceedings of the Fifth Workshop on Privacy in Natural Language Processing (PrivateNLP). 2024. https://aclanthology.org/2024.privatenlp-1.10/

[4] CHO Y J, LIU L, XU Z, et al. Heterogeneous LoRA for federated fine-tuning of on-device foundation models[J/OL]. arXiv preprint arXiv:2401.06432, 2024. https://arxiv.org/abs/2401.06432

[5] GAO L, ZIASHAHIBI A, NIU Y, et al. MobiZO: enabling efficient LLM fine-tuning at the edge via inference engines[J/OL]. arXiv preprint arXiv:2409.15520, 2024. https://arxiv.org/abs/2409.15520

[6] SONG C, TANG X. Memory-efficient backpropagation for fine-tuning LLMs on resource-constrained mobile devices[C]//Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track (EMNLP). 2025. https://aclanthology.org/2025.emnlp-industry.52/

[7] GENG J, ZHAO L, LU Y, et al. MobileFineTuner: a mobile-native framework for on-device LLM fine-tuning in real-world embedded AI applications[J/OL]. arXiv preprint arXiv:2512.08211, 2025. https://arxiv.org/abs/2512.08211

[8] TAM K, NIU W, BAO Y, et al. FBLayout: optimizing memory layout for efficient LLM finetuning on mobile GPUs[C]//Proceedings of the ACM International Conference on Mobile Systems, Applications, and Services (MobiSys). 2026. https://arxiv.org/abs/2607.21624

[9] PARK J, HONG Y, KIM S, et al. Memory-efficient structured backpropagation for on-device LLM fine-tuning[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: Industry Track (ACL). 2026. https://aclanthology.org/2026.acl-industry.62/

[10] KUMARESAN R. Orion: characterizing and programming Apple's Neural Engine for LLM training and inference[J/OL]. arXiv preprint arXiv:2603.06728, 2026. https://arxiv.org/abs/2603.06728

[11] SHENAJ D, BOHDAL O, CERITLI T, et al. K-Merge: online continual merging of adapters for on-device large language models[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (ACL). 2026. https://aclanthology.org/2026.acl-long.137/

[12] LIN I J, HONG Z W. Fine-tuning small language models for continual learning on-device with self-distillation[EB/OL]. 2026. https://lin826.github.io/SLM-Online-SDFT/

[13] REN T, LUO W, YANG H, et al. Scaling self-evolving agents via parametric memory[J/OL]. arXiv preprint arXiv:2606.04536, 2026. https://arxiv.org/abs/2606.04536


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""