PocketLLM:手机上的 MeZO 免反传微调
本页是 CPU 路线的可行性起点(见 端侧训练):PocketLLM [2] (PrivateNLP 2024)用 MeZO(zeroth-order) [1] 在 OPPO Reno 6 上完成了 十亿参数 LLM 的本地微调——它证明的是 "手机能训练",而不是 "手机训练已经实用"。
1. 前置:MeZO 把训练降级成"只做 forward"
一阶训练贵在 backward 要保存 activation 与 gradient。MeZO [1] 干脆绕开 反向传播,用随机梯度估计只做两次 forward:
式 1|MeZO 的 zeroth-order 梯度估计: 是随机方向, 用两个扰动点的 loss 差近似梯度。
- 不需要 backward,就不需要保存 activation/gradient,训练内存接近推理;
- 扰动向量靠随机种子重生成,额外内存 [1];
- 内存不随 batch size 显著增长(对比 Adam 微调的内存随 batch 线性涨)。
代价是收敛极慢:需要比 BP 多 10–100× 的步数;MeSP [3] 的分析显示其 梯度估计与真实梯度的余弦相似度只有约 0.001——信噪比极低。
2. 手机实验:OPPO Reno 6
| 模型 | 内存 | 单步训练时间 |
|---|---|---|
| RoBERTa-large | 约 4 GB | 约 97 s(batch 8) |
| OPT-1.3B | 约 6.5 GB | 约 1800 s |
对比:OPT-1.3B 在 RTX 3090 上一步约 1.99 s——手机慢了近 1000×, 差距完全在算力而非内存。
个性化数据不出设备即可完成微调(隐私动机),免反传方法让内存不再是 第一瓶颈——但它同时暴露了 CPU 吞吐的天花板:一天也训不了几步。 这条路线的结论直接引出了两个后续方向:换硬件(GPU/NPU 路线) 与换工程(MobileFineTuner 的原生训练框架)。
参考文献
[1] MALLADI S, LYU K, PANIGRAHI A, et al. Fine-tuning language models with just forward passes[C]//Advances in Neural Information Processing Systems (NeurIPS). 2023. https://arxiv.org/abs/2305.17333
[2] PENG D, FU Z, WANG J. PocketLLM: enabling on-device fine-tuning for personalized LLMs[C]//Proceedings of the Fifth Workshop on Privacy in Natural Language Processing (PrivateNLP). 2024. https://aclanthology.org/2024.privatenlp-1.10/
[3] PARK J, HONG Y, KIM S, et al. Memory-efficient structured backpropagation for on-device LLM fine-tuning[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: Industry Track (ACL). 2026. https://aclanthology.org/2026.acl-industry.62/
© 2026 Yang Huan · yanghuan9812@qq.com