MobileFineTuner:原生 C++ 端侧训练框架

本页是 CPU 路线的工程化一步(见 端侧训练):MobileFineTuner [1] 不依赖 Python/PyTorch,从零实现 mobile-native 训练栈,在 Android 上 真正跑通 forward → loss → backward → update,并开源为可复用的训练框架。

1. 动机:Python 训练栈进不了 App

  • 现有微调框架以 Python + 服务器为中心,难以嵌入移动 App 的发布流程;
  • 嵌入式 AI 的数据是私有、纵向、持续的信号(用户与物理环境的传感记录), 天然应该留在手机上训练;
  • 手机随身携带、连接可穿戴传感器、深度集成日常应用——是这类应用的自然平台。

2. 原生训练栈

MobileFineTuner 用 C++ 从零实现:tensor 库、autograd、LoRA、optimizer 全部原生,不需要 Python 解释器,可作为库直接集成进移动应用。

围绕移动资源约束的训练 runtime 组件:

  • memory-efficient attention
  • activation checkpointing(重算换内存);
  • gradient accumulation(小内存凑大有效 batch);
  • parameter sharding(参数分片);
  • energy-aware scheduling(能耗感知调度)。

3. 实验与演示

  • 真机上评测 GPT-2、Gemma 3、Qwen2.5,复现了标准 Full-FT 与 LoRA 微调行为,显著降低内存压力、提升低内存手机上的可执行性;
  • 演示应用:校园健康 Agent——本地 LLM 在手机上用用户专属的 可穿戴传感记录做个性化微调,原始数据全程不出设备。
💡 定位

它补齐了端侧训练的基础设施层:不追求单点极致(那是 MeSP/FBLayout 的事),而是让"在真机 App 里训练"这件事有完整的开源工程路径—— 这正是 Online-SDFT 这类闭环自我学习应用所需要的底座。

参考文献

[1] GENG J, ZHAO L, LU Y, et al. MobileFineTuner: a mobile-native framework for on-device LLM fine-tuning in real-world embedded AI applications[J/OL]. arXiv preprint arXiv:2512.08211, 2025. https://arxiv.org/abs/2512.08211


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""