ThinkAct:强化视觉 latent 规划

本页是 VLM 自我改进 演化轴第⑤阶段的一篇: ThinkAct(Vision-Language-Action Reasoning via Reinforced Visual Latent Planning)[1](NeurIPS 2025)——验证 "reasoning → latent plan → execution"这条压缩链。

1. 方法

observation+instructionreasoning planvisual plan latentaction \text{observation} + \text{instruction} \rightarrow \text{reasoning plan} \rightarrow \underline{\text{visual plan latent}} \rightarrow \text{action}

  • task completion + trajectory consistency 的 visual reward RL 训练 multimodal LLM 的 reasoning;
  • reasoning plan 被压缩成 visual latent 交给 action model 执行—— 下游不吃全文推理,吃压缩后的计划表示。

2. 对本方向的定位

Fast-ThinkAct 是同一作者系的前后两步: ThinkAct 证明 latent 压缩可行且带失败恢复; Fast-ThinkAct 解决它的推理延迟问题。 对端侧的启示:consolidation 的产物可以是 latent plan 级别的能力,而不是完整文本 lesson—— 更小的 LoRA、更快的执行。

参考文献

[1] HUANG C P, WU Y H, CHEN M H, et al. ThinkAct: vision-language-action reasoning via reinforced visual latent planning[C]//Advances in Neural Information Processing Systems 38 (NeurIPS). 2025. https://papers.neurips.cc/paper_files/paper/2025/hash/7749f9c0d5ff109231be21e910a3ced2-Abstract-Conference.html


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""