TMEM:把经验写进参数的自我进化 Agent

本页把"自我递归训练"的思想搬到 LLM Agent(见 端侧训练): TMEM [1](Scaling Self-Evolving Agents via Parametric Memory)指出 prompt 型记忆的根本缺陷,并把 LoRA [2] 用作 fast parametric memory

1. 问题:记忆型 Agent 不会"学"

现有记忆增强 Agent 把历史经验全部存在 prompt 空间(文本摘要或检索 段落),rollout 全程参数冻结。后果:

  • Agent 只能查到见过的东西,不能从中学到东西;
  • 策略不因经验而改变;
  • 任何掉出上下文的信息永久丢失
普通记忆型 Agent:
  experience → RAG / 文本记忆 → 下次塞进 prompt(参数始终冻结)

TMEM:
  experience → 提取监督信号 → online LoRA 更新 Δt → 参数真的变了

2. 方法:fast-weight rollout 的决策过程

TMEM 把 Agent 的运行形式化为带 fast-weight rollout dynamics 的 agentic decision process:

  • 任务动作从 πθ0+Δt\pi_{\theta_0+\Delta_t} 采样——当前行为由已吸收的经验决定
  • extraction 动作从历史中提取监督信号,在线更新 fast LoRA 权重 Δt\Delta_t,影响后续决策;
  • 这个视角让 extraction policy 可以直接用 RL 优化:训练 θ0\theta_0 同时提升(a)任务动作质量、(b)在线适配所用数据的质量;
  • SVD 初始化 LoRA 子空间,加速在线收敛。

关键性质:经验不只是被"查得回来",而是被吸收进参数—— 在单个 episode 内就能改变后续行为:

πθ0πθ0+Δ1πθ0+Δ2 \pi_{\theta_0} \rightarrow \pi_{\theta_0+\Delta_1} \rightarrow \pi_{\theta_0+\Delta_2} \rightarrow \cdots

3. 实验

在 LoCoMo、LongMemEval-S、multi-objective search、CL-Bench 四类 长程 Agent 基准上,TMEM 一致超过 summary-based 与 retrieval-based 基线,且在不同模型规模下均成立。

4. 定位

TMEM 的重点是 agent 算法而非手机系统(实验在研究环境/服务端), 但它给出了"LoRA 作为参数化长期记忆"的框架。与另外两块拼图合看:

  • 训练信号从哪里来 → Online-SDFT
  • 手机硬件上怎么训 → MeSP / MobiZO
  • LoRA 怎么成为长期 parametric memory → 本页。

参考文献

[1] REN T, LUO W, YANG H, et al. Scaling self-evolving agents via parametric memory[J/OL]. arXiv preprint arXiv:2606.04536, 2026. https://arxiv.org/abs/2606.04536

[2] HU E J, SHEN Y, WALLIS P, et al. LoRA: low-rank adaptation of large language models[C]//International Conference on Learning Representations (ICLR). 2022. https://arxiv.org/abs/2106.09685


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""