FBLayout:mobile GPU 训练的内存布局优化
本页是 GPU 路线的速度篇(见 端侧训练):FBLayout [1] (MobiSys 2026)回答内存被 MeBP/MeSP 解决之后的 下一个问题——mobile GPU 上训练为什么还是慢?
1. 发现:瓶颈不是 FLOPs,是 layout
forward 与 backward 对数据布局的要求不一样。现有移动训练框架只有两种选择:
- 统一 layout:forward/backward 共用一套张量组织——backward 时访存 碎片化,GPU 利用率差;
- 显式转换:在 forward/backward 之间做 layout 转换——引入大量 transpose / re-layout / 内存搬运,attention 训练里尤其频繁。
两者都让 GPU 的时间花在"搬数据"而不是"算数"上。
2. 设计:layout 与 mobile GPU 协同设计
FBLayout 提出三点:
- R-Tile 统一布局:为跨 forward/backward 的多维 reduction 设计统一 的张量组织,让两个方向的计算都不需要物理转置;
- tile 级索引变换:用索引计算替代数据搬移——"重排视图"而非 "重排数据",彻底消除物理数据移动;
- activation-guided layout selection:识别算子里最高效的布局, 让它自动向全局传播(而不是逐算子局部最优)。
3. 结果
在 Adreno(Qualcomm)与 Mali(ARM) 两类 mobile GPU、多款手机、 7 个 Transformer 模型上:
| 对比基线 | 加速比 |
|---|---|
| MNN | 2.2–5.7× |
| TFLite | 2.2–5.7× |
| TVM | 2.2–5.7× |
同时显著改善缓存效率、降低内存占用。
💡 成熟度信号
这篇工作的存在本身就是路线成熟的标志:讨论焦点已经从 "手机能不能 BP" 转向 "怎么优化 mobile GPU 的 training kernel/layout"——这是服务器侧训练系统多年前的演化路径, 端侧正在重演。
参考文献
[1] TAM K, NIU W, BAO Y, et al. FBLayout: optimizing memory layout for efficient LLM finetuning on mobile GPUs[C]//Proceedings of the ACM International Conference on Mobile Systems, Applications, and Services (MobiSys). 2026. https://arxiv.org/abs/2607.21624
© 2026 Yang Huan · yanghuan9812@qq.com