PocketLLM:手机上的 MeZO 免反传微调

本页是 CPU 路线的可行性起点(见 端侧训练):PocketLLM [2] (PrivateNLP 2024)用 MeZO(zeroth-order) [1] 在 OPPO Reno 6 上完成了 十亿参数 LLM 的本地微调——它证明的是 "手机能训练",而不是 "手机训练已经实用"。

1. 前置:MeZO 把训练降级成"只做 forward"

一阶训练贵在 backward 要保存 activation 与 gradient。MeZO [1] 干脆绕开 反向传播,用随机梯度估计只做两次 forward:

^L=L(θ+ϵz)L(θϵz)2ϵz \hat{\nabla}L = \frac{L(\theta+\epsilon z)-L(\theta-\epsilon z)}{2\epsilon}\,z

式 1|MeZO 的 zeroth-order 梯度估计:zz 是随机方向, 用两个扰动点的 loss 差近似梯度。

  • 不需要 backward,就不需要保存 activation/gradient,训练内存接近推理;
  • 扰动向量靠随机种子重生成,额外内存 O(1)O(1) [1]
  • 内存不随 batch size 显著增长(对比 Adam 微调的内存随 batch 线性涨)。

代价是收敛极慢:需要比 BP 多 10–100× 的步数;MeSP [3] 的分析显示其 梯度估计与真实梯度的余弦相似度只有约 0.001——信噪比极低。

2. 手机实验:OPPO Reno 6

模型 内存 单步训练时间
RoBERTa-large 约 4 GB 约 97 s(batch 8)
OPT-1.3B 约 6.5 GB 约 1800 s

对比:OPT-1.3B 在 RTX 3090 上一步约 1.99 s——手机慢了近 1000×, 差距完全在算力而非内存。

💭 PocketLLM 的定位

个性化数据不出设备即可完成微调(隐私动机),免反传方法让内存不再是 第一瓶颈——但它同时暴露了 CPU 吞吐的天花板:一天也训不了几步。 这条路线的结论直接引出了两个后续方向:换硬件(GPU/NPU 路线) 与换工程MobileFineTuner 的原生训练框架)。

参考文献

[1] MALLADI S, LYU K, PANIGRAHI A, et al. Fine-tuning language models with just forward passes[C]//Advances in Neural Information Processing Systems (NeurIPS). 2023. https://arxiv.org/abs/2305.17333

[2] PENG D, FU Z, WANG J. PocketLLM: enabling on-device fine-tuning for personalized LLMs[C]//Proceedings of the Fifth Workshop on Privacy in Natural Language Processing (PrivateNLP). 2024. https://aclanthology.org/2024.privatenlp-1.10/

[3] PARK J, HONG Y, KIM S, et al. Memory-efficient structured backpropagation for on-device LLM fine-tuning[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: Industry Track (ACL). 2026. https://aclanthology.org/2026.acl-industry.62/


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""