TMEM:把经验写进参数的自我进化 Agent
本页把"自我递归训练"的思想搬到 LLM Agent(见 端侧训练): TMEM [1](Scaling Self-Evolving Agents via Parametric Memory)指出 prompt 型记忆的根本缺陷,并把 LoRA [2] 用作 fast parametric memory。
1. 问题:记忆型 Agent 不会"学"
现有记忆增强 Agent 把历史经验全部存在 prompt 空间(文本摘要或检索 段落),rollout 全程参数冻结。后果:
- Agent 只能查到见过的东西,不能从中学到东西;
- 策略不因经验而改变;
- 任何掉出上下文的信息永久丢失。
普通记忆型 Agent:
experience → RAG / 文本记忆 → 下次塞进 prompt(参数始终冻结)
TMEM:
experience → 提取监督信号 → online LoRA 更新 Δt → 参数真的变了
2. 方法:fast-weight rollout 的决策过程
TMEM 把 Agent 的运行形式化为带 fast-weight rollout dynamics 的 agentic decision process:
- 任务动作从 采样——当前行为由已吸收的经验决定;
- extraction 动作从历史中提取监督信号,在线更新 fast LoRA 权重 ,影响后续决策;
- 这个视角让 extraction policy 可以直接用 RL 优化:训练 同时提升(a)任务动作质量、(b)在线适配所用数据的质量;
- SVD 初始化 LoRA 子空间,加速在线收敛。
关键性质:经验不只是被"查得回来",而是被吸收进参数—— 在单个 episode 内就能改变后续行为:
3. 实验
在 LoCoMo、LongMemEval-S、multi-objective search、CL-Bench 四类 长程 Agent 基准上,TMEM 一致超过 summary-based 与 retrieval-based 基线,且在不同模型规模下均成立。
4. 定位
TMEM 的重点是 agent 算法而非手机系统(实验在研究环境/服务端), 但它给出了"LoRA 作为参数化长期记忆"的框架。与另外两块拼图合看:
- 训练信号从哪里来 → Online-SDFT;
- 手机硬件上怎么训 → MeSP / MobiZO;
- LoRA 怎么成为长期 parametric memory → 本页。
参考文献
[1] REN T, LUO W, YANG H, et al. Scaling self-evolving agents via parametric memory[J/OL]. arXiv preprint arXiv:2606.04536, 2026. https://arxiv.org/abs/2606.04536
[2] HU E J, SHEN Y, WALLIS P, et al. LoRA: low-rank adaptation of large language models[C]//International Conference on Learning Representations (ICLR). 2022. https://arxiv.org/abs/2106.09685
© 2026 Yang Huan · yanghuan9812@qq.com