MeSP:连 LoRA 的中间结果也不存

本页是 GPU 路线的第二个里程碑(见 端侧训练):MeSP [1] (ACL 2026 Industry)发现 LoRA 微调里一个被忽视的内存浪费——LoRA 自身的 中间结果其实根本不用保存。它在 MeBP [2] 之上把峰值内存再砍一半, 且梯度与精确 BP 数学上完全一致

1. 关键洞察:h=xAh = xA 可以廉价重算

MeBP 逐层重算 backbone 激活后,剩下的内存大头是各层的输出O(L×O)O(L \times O))——其中就包括 LoRA 层 forward 时为 backward 保存的

h=xA h = xA

MeSP 注意到:既然 rdinr \ll d_{\text{in}}backward 时重算 h=xAh = xA 只是一次很窄的矩阵乘,成本可以忽略。于是 hh 根本不用跨层保存, LoRA activation 的内存几乎归零,总内存进一步降到 O(L×O+T)O(L \times O + T)TT 为序列相关的小项)。

2. 实验设置

  • 设备:iPhone 17 Pro(8 GB RAM,A19 Pro),MLX 实现;
  • 模型:Qwen2.5-0.5B / 1.5B / 3B(24/28/36 层),4-bit 量化;
  • LoRA:rank 8,作用于 Q/K/V/O/gate/up/down 投影;
  • 序列长度 256;内存用 iOS/macOS 的 phys_footprint 口径测量。

3. 结果

指标 数值
相比 MeBP 平均峰值内存 -49%(0.5B–3B 平均)
Qwen2.5-0.5B 361 MB → 136 MB(-62%)
梯度 与精确 BP 数学上相同

顺带解释了 MeZO [3] 慢的原因:其梯度估计与真实梯度的 余弦相似度只有 ≈ 0.001,信噪比极低,只能靠 10–100× 步数换收敛。

💡 这条路线的关键结论

端侧 LoRA 不一定需要 zeroth-order:针对低秩结构重设 backward, 一阶精确训练已经可以塞进手机——内存不再是借口, 剩下的问题是速度(见 FBLayout)。

参考文献

[1] PARK J, HONG Y, KIM S, et al. Memory-efficient structured backpropagation for on-device LLM fine-tuning[C]//Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics: Industry Track (ACL). 2026. https://aclanthology.org/2026.acl-industry.62/

[2] SONG C, TANG X. Memory-efficient backpropagation for fine-tuning LLMs on resource-constrained mobile devices[C]//Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track (EMNLP). 2025. https://aclanthology.org/2025.emnlp-industry.52/

[3] MALLADI S, LYU K, PANIGRAHI A, et al. Fine-tuning language models with just forward passes[C]//Advances in Neural Information Processing Systems (NeurIPS). 2023. https://arxiv.org/abs/2305.17333


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""