MeSP:连 LoRA 的中间结果也不存
本页是 GPU 路线的第二个里程碑(见 端侧训练):MeSP [1] (ACL 2026 Industry)发现 LoRA 微调里一个被忽视的内存浪费——LoRA 自身的 中间结果其实根本不用保存。它在 MeBP [2] 之上把峰值内存再砍一半, 且梯度与精确 BP 数学上完全一致。
1. 关键洞察: 可以廉价重算
MeBP 逐层重算 backbone 激活后,剩下的内存大头是各层的输出 ()——其中就包括 LoRA 层 forward 时为 backward 保存的
MeSP 注意到:既然 ,backward 时重算 只是一次很窄的矩阵乘,成本可以忽略。于是 根本不用跨层保存, LoRA activation 的内存几乎归零,总内存进一步降到 ( 为序列相关的小项)。
2. 实验设置
- 设备:iPhone 17 Pro(8 GB RAM,A19 Pro),MLX 实现;
- 模型:Qwen2.5-0.5B / 1.5B / 3B(24/28/36 层),4-bit 量化;
- LoRA:rank 8,作用于 Q/K/V/O/gate/up/down 投影;
- 序列长度 256;内存用 iOS/macOS 的
phys_footprint口径测量。
3. 结果
| 指标 | 数值 |
|---|---|
| 相比 MeBP 平均峰值内存 | -49%(0.5B–3B 平均) |
| Qwen2.5-0.5B | 361 MB → 136 MB(-62%) |
| 梯度 | 与精确 BP 数学上相同 |
顺带解释了 MeZO [3] 慢的原因:其梯度估计与真实梯度的 余弦相似度只有 ≈ 0.001,信噪比极低,只能靠 10–100× 步数换收敛。
端侧 LoRA 不一定需要 zeroth-order:针对低秩结构重设 backward, 一阶精确训练已经可以塞进手机——内存不再是借口, 剩下的问题是速度(见 FBLayout)。
参考文献
[1] PARK J, HONG Y, KIM S, et al. Memory-efficient structured backpropagation for on-device LLM fine-tuning[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: Industry Track (ACL). 2026. https://aclanthology.org/2026.acl-industry.62/
[2] SONG C, TANG X. Memory-efficient backpropagation for fine-tuning LLMs on resource-constrained mobile devices[C]//Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track (EMNLP). 2025. https://aclanthology.org/2025.emnlp-industry.52/
[3] MALLADI S, LYU K, PANIGRAHI A, et al. Fine-tuning language models with just forward passes[C]//Advances in Neural Information Processing Systems (NeurIPS). 2023. https://arxiv.org/abs/2305.17333
© 2026 Yang Huan · yanghuan9812@qq.com