FBLayout:mobile GPU 训练的内存布局优化

本页是 GPU 路线的速度篇(见 端侧训练):FBLayout [1] (MobiSys 2026)回答内存被 MeBP/MeSP 解决之后的 下一个问题——mobile GPU 上训练为什么还是慢?

1. 发现:瓶颈不是 FLOPs,是 layout

forward 与 backward 对数据布局的要求不一样。现有移动训练框架只有两种选择:

  • 统一 layout:forward/backward 共用一套张量组织——backward 时访存 碎片化,GPU 利用率差;
  • 显式转换:在 forward/backward 之间做 layout 转换——引入大量 transpose / re-layout / 内存搬运,attention 训练里尤其频繁。

两者都让 GPU 的时间花在"搬数据"而不是"算数"上。

2. 设计:layout 与 mobile GPU 协同设计

FBLayout 提出三点:

  1. R-Tile 统一布局:为跨 forward/backward 的多维 reduction 设计统一 的张量组织,让两个方向的计算都不需要物理转置;
  2. tile 级索引变换:用索引计算替代数据搬移——"重排视图"而非 "重排数据",彻底消除物理数据移动;
  3. activation-guided layout selection:识别算子里最高效的布局, 让它自动向全局传播(而不是逐算子局部最优)。

3. 结果

Adreno(Qualcomm)与 Mali(ARM) 两类 mobile GPU、多款手机、 7 个 Transformer 模型上:

对比基线 加速比
MNN 2.2–5.7×
TFLite 2.2–5.7×
TVM 2.2–5.7×

同时显著改善缓存效率、降低内存占用。

💡 成熟度信号

这篇工作的存在本身就是路线成熟的标志:讨论焦点已经从 "手机能不能 BP" 转向 "怎么优化 mobile GPU 的 training kernel/layout"——这是服务器侧训练系统多年前的演化路径, 端侧正在重演。

参考文献

[1] TAM K, NIU W, BAO Y, et al. FBLayout: optimizing memory layout for efficient LLM finetuning on mobile GPUs[C]//Proceedings of the ACM International Conference on Mobile Systems, Applications, and Services (MobiSys). 2026. https://arxiv.org/abs/2607.21624


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""