LLaVA-CoT:多阶段系统化推理的 SFT 内化
本页是 VLM 自我改进 演化轴第①阶段的起点: LLaVA-CoT [1](ICCV 2025)——用约 10 万条 多阶段结构化 reasoning 数据直接 fine-tune VLM, 让系统化推理成为模型自己的输出模式(而非依赖外部推理模型)。
1. 方法
构造 LLaVA-CoT-100k,把每条答案的 reasoning 分成四个阶段:
模型被训练成按这个阶段结构输出——先概述问题、再解读视觉内容、 然后逐步推理、最后下结论。这种格式化推理让模型在 数学与科学类 VQA 上有明显提升。
2. 对本方向的定位
典型的"reasoning supervision → VLM weights":
但数据来自人工/教师整理,不是模型自己真实执行产生的—— 它教的是"怎么推理",回答不了"从自己的失败经验里学"。 演化轴上它提供的是第①阶段的基线: 后面所有 self-improvement 方法都在比较 "自己的 reasoning vs 老师的 reasoning 谁更有效"。
参考文献
[1] XU G W, JIN P, WU Z A, et al. LLaVA-CoT: let vision language models reason step-by-step[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 2025. https://arxiv.org/abs/2411.10440
© 2026 Yang Huan · yanghuan9812@qq.com