ThinkAct:强化视觉 latent 规划
本页是 VLM 自我改进 演化轴第⑤阶段的一篇: ThinkAct(Vision-Language-Action Reasoning via Reinforced Visual Latent Planning)[1](NeurIPS 2025)——验证 "reasoning → latent plan → execution"这条压缩链。
1. 方法
- 用 task completion + trajectory consistency 的 visual reward RL 训练 multimodal LLM 的 reasoning;
- reasoning plan 被压缩成 visual latent 交给 action model 执行—— 下游不吃全文推理,吃压缩后的计划表示。
2. 对本方向的定位
与 Fast-ThinkAct 是同一作者系的前后两步: ThinkAct 证明 latent 压缩可行且带失败恢复; Fast-ThinkAct 解决它的推理延迟问题。 对端侧的启示:consolidation 的产物可以是 latent plan 级别的能力,而不是完整文本 lesson—— 更小的 LoRA、更快的执行。
参考文献
[1] HUANG C P, WU Y H, CHEN M H, et al. ThinkAct: vision-language-action reasoning via reinforced visual latent planning[C]//Advances in Neural Information Processing Systems 38 (NeurIPS). 2025. https://papers.neurips.cc/paper_files/paper/2025/hash/7749f9c0d5ff109231be21e910a3ced2-Abstract-Conference.html
© 2026 Yang Huan · yanghuan9812@qq.com