端侧训练(On-Device Training)
本专题整理 端侧训练(on-device training):在手机、平板与边缘设备上对 LLM 做 fine-tuning——主流载体是 LoRA [1] 级别的参数高效微调,硬件上覆盖 CPU / GPU / NPU 三条路线;算法上则正从"用户手动准备数据集、点一次 Fine-Tune",走向 模型在用户设备上根据自己的交互结果持续训练自己。 本专题按论文逐篇成页(见 §4 收录条目),本页负责纵览与综合。
端侧 LoRA 的"训练系统"已基本可行;真正刚起步的,是"模型在用户设备上 根据自己的交互结果持续训练自己"。 三条硬件路线的现状:
- GPU 路线最成熟:精确 backpropagation(BP)已经能塞进手机(MeBP、MeSP), 讨论焦点已从"手机能不能 BP"转向"怎么优化 mobile GPU 的 training kernel/layout"(FBLayout);
- CPU 最通用但慢:免反传(MeZO)与原生 C++ 训练框架都先在 CPU 上跑通, 但它的长期角色是控制逻辑、optimizer 与 fallback,而不是承担 1B–3B 模型的 dense matmul;
- NPU 最有长期潜力,训练软件栈最不成熟:推理加速器做训练, 要么绕开 backward(MobiZO 的 zeroth-order 路线), 要么用私有 API 原生编译 forward + backward(Orion 与 ANE 社区路线)。
1. Road Tree:硬件路线纵览
第四列就是模型自我递归训练(见 Online-SDFT)的入口: 模型的行为产生经验,经验又变成训练信号改写模型自身——"边用边学", 而不是人工喂一个数据集再点一次微调。与硬件三条路线正交的联邦方向 (HetLoRA [4],异构设备联邦 LoRA)不在本图展开。
2. 三条硬件路线
2.1 CPU 路线
早期最可行的一步:干脆不做 backward,用 MeZO(zeroth-order) 只做 forward 估计梯度(PocketLLM 在 OPPO Reno 6 上训了 RoBERTa-large 与 OPT-1.3B,一步约 1800 秒);后继 MobileFineTuner 换成原生 C++ 精确 BP 框架。
控制逻辑 + optimizer + 小 LoRA update + fallback —— 而不是让 CPU 单独承担 1B–3B 模型的 dense matmul。
2.2 GPU 路线(当前最成熟)
LoRA [1] 省参数,但不省 backbone activation——精确 BP 仍然内存爆炸。 四个节点:PockEngine 确立训练图编译 + 稀疏更新范式; MeBP 用逐层重算把 0.5B–4B 模型的训练内存压到 1 GB 以下; MeSP 进一步发现 LoRA 中间结果 可以在 backward 里 廉价重算(),连 LoRA activation 也不用存; FBLayout 解决 memory 之后的下一个瓶颈——mobile GPU 上 forward/backward 的 layout 转换开销。
端侧 LoRA 不一定需要 ZO:重新设计 backward 之后, 一阶精确训练已经可以塞进手机。
2.3 NPU 路线(最有意思)
NPU(Hexagon / ANE)本质是 inference accelerator:静态图编译、无 autograd。两条对策完全相反:
- 路线 A:不要 backward——MobiZO 用推理引擎 + zeroth-order + MP-LoRA,NPU 只做最擅长的 forward,已跑通 OnePlus 12 Hexagon NPU;
- 路线 B:真的让 NPU backward——maderix/ANE 与 Orion 逆向 Apple 私有 API,直接给 ANE 编译 forward + backward 图,证明 NPU 硬件本身能训 Transformer, 缺的只是软件栈。
| 路线 A:ZO 复用推理引擎 | 路线 B:原生 NPU 训练 | |
|---|---|---|
| backward | 无(两次 forward 差分) | 真正的 forward + backward 图 |
| 梯度 | 近似(噪声大,收敛慢) | 精确 |
| 软件栈 | ExecuTorch,零 runtime 改动,现在就能跑 | 私有 API + 自研编译器,研究原型 |
| 适配代价 | 依平台后端而定 | 每代 NPU 需重新逆向/刻画 |
3. 终局形态:异构训练与训练时机
最终端侧架构很可能不是 CPU/GPU/NPU 三选一,而是分工协作:
NPU forward + GPU backward/LoRA + CPU optimizer/control; 更激进的版本:NPU forward + ZO LoRA update + CPU optimizer。
而且训练不应每次交互都立即发生——更像手机后台的 photo indexing / backup:先攒样本,再在空闲时段批量训练。
一个直观的例子(视觉 Agent 学会用户的世界):
模型:"这是用户的钥匙。"
用户:"不,这是车钥匙,另一个才是家门钥匙。"
↓ 产生 correction pair
↓ 端侧 LoRA update
此后它不必靠 RAG 每次检索"用户说过这是车钥匙",而是真的学会用户的 视觉世界。Engram / RAG 是 memory(记住发生过什么),LoRA 是 learning(根据经历改变以后怎么做)——两者互补 (参见 Engram:条件记忆)。
把"端侧自我进化 agent"拆开,三件工作各补一角:
Online-SDFT → 训练信号从哪里来(hindsight → teacher target)
TMEM → LoRA 怎么成为长期 parametric memory(agent 视角)
MeSP / MobiZO → 手机硬件上到底怎么训练(GPU 精确 BP / NPU ZO)
三者拼起来,已经非常接近一个真正的 on-device self-evolving multimodal agent。
4. 收录条目
CPU 路线
GPU 路线
NPU 路线
- MobiZO:用推理 NPU 训练(ZO 路线)
- maderix/ANE:在 Apple Neural Engine 上逆向出训练
- Orion:Apple Neural Engine 的端到端训练系统
学习信号与长期积累
5. 相关专题
- RSI:递归自我进化 — 端侧自我递归训练可视为 RSI 闭环的 设备端微型版。
参考文献
[1] HU E J, SHEN Y, WALLIS P, et al. LoRA: low-rank adaptation of large language models[C]//International Conference on Learning Representations (ICLR). 2022. https://arxiv.org/abs/2106.09685
[2] ZHU L, HU L, LIN J, et al. PockEngine: sparse and efficient fine-tuning in a pocket[C]//Proceedings of the 56th IEEE/ACM International Symposium on Microarchitecture (MICRO). 2023. https://arxiv.org/abs/2310.17752
[3] PENG D, FU Z, WANG J. PocketLLM: enabling on-device fine-tuning for personalized LLMs[C]//Proceedings of the Fifth Workshop on Privacy in Natural Language Processing (PrivateNLP). 2024. https://aclanthology.org/2024.privatenlp-1.10/
[4] CHO Y J, LIU L, XU Z, et al. Heterogeneous LoRA for federated fine-tuning of on-device foundation models[J/OL]. arXiv preprint arXiv:2401.06432, 2024. https://arxiv.org/abs/2401.06432
[5] GAO L, ZIASHAHIBI A, NIU Y, et al. MobiZO: enabling efficient LLM fine-tuning at the edge via inference engines[J/OL]. arXiv preprint arXiv:2409.15520, 2024. https://arxiv.org/abs/2409.15520
[6] SONG C, TANG X. Memory-efficient backpropagation for fine-tuning LLMs on resource-constrained mobile devices[C]//Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track (EMNLP). 2025. https://aclanthology.org/2025.emnlp-industry.52/
[7] GENG J, ZHAO L, LU Y, et al. MobileFineTuner: a mobile-native framework for on-device LLM fine-tuning in real-world embedded AI applications[J/OL]. arXiv preprint arXiv:2512.08211, 2025. https://arxiv.org/abs/2512.08211
[8] TAM K, NIU W, BAO Y, et al. FBLayout: optimizing memory layout for efficient LLM finetuning on mobile GPUs[C]//Proceedings of the ACM International Conference on Mobile Systems, Applications, and Services (MobiSys). 2026. https://arxiv.org/abs/2607.21624
[9] PARK J, HONG Y, KIM S, et al. Memory-efficient structured backpropagation for on-device LLM fine-tuning[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: Industry Track (ACL). 2026. https://aclanthology.org/2026.acl-industry.62/
[10] KUMARESAN R. Orion: characterizing and programming Apple's Neural Engine for LLM training and inference[J/OL]. arXiv preprint arXiv:2603.06728, 2026. https://arxiv.org/abs/2603.06728
[11] SHENAJ D, BOHDAL O, CERITLI T, et al. K-Merge: online continual merging of adapters for on-device large language models[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (ACL). 2026. https://aclanthology.org/2026.acl-long.137/
[12] LIN I J, HONG Z W. Fine-tuning small language models for continual learning on-device with self-distillation[EB/OL]. 2026. https://lin826.github.io/SLM-Online-SDFT/
[13] REN T, LUO W, YANG H, et al. Scaling self-evolving agents via parametric memory[J/OL]. arXiv preprint arXiv:2606.04536, 2026. https://arxiv.org/abs/2606.04536
© 2026 Yang Huan · yanghuan9812@qq.com