把一个多模态模型拆成七个可追问的设计决策:信号如何进入、表征留下什么、模态在哪里相遇、主干预测什么、状态如何输出、能力如何训练、以及——模型何时成为一个系统。点击任意模块,看它背后的范式与代表文献。
2022 年 Flamingo 用门控交叉注意力点亮视觉语言模型,2023 年 GPT-4 与 LLaVA 引爆指令微调范式,2024 年 GPT-4o / Chameleon / Emu3 把「理解与生成统一」推上主线,2025 年流式全模态与世界模型成为新前沿。按年份筛选,点击卡片查看定位。
PPT 的核心框架:任意一个统一多模态模型,都可以沿着「输入 → 表征 → 融合 → 预测 → 输出 → 训练 → 系统」七层拆解。点击层切换;左侧是该层的动态演示,右侧是拆分后的四个范式模块(来自原始范式图),点模块看代表工作与权衡。
架构决定上限,数据决定下限。PPT 将训练数据分为六类模态——每一类都为模型注入一种独特的「世界观」。下方环图复刻了 Cosmos 3 Reasoner 的数据配比(悬停查看每类占比),可见预训练以 OCR / Grounding 打底,SFT 则大幅转向视频推理。
图文不再是孤立的对,而是像电影剧本一样交错排列——帧与字幕、步骤与说明彼此锚定。这类数据直接支撑长程上下文、跨帧一致性与 any-to-any 生成。点击图片放大。
从理解型基准到生成型基准,再到指令遵循与文字渲染的定性对比——测评定义了社区对「好模型」的共识。以下示例取自原 PPT,点击图片放大查看。




MiniMind-O 用 0.1B 参数、22G 显存走通了完整全模态链路——它是「七层架构」框架的最小实例。点击左侧步骤,看它如何在每一层做减法;右侧为架构总览与同思路的 Show-o2(1.5B / 7B,2025-06-19)。


系统范式的终点是闭环:感知 → 预测 → 行动 → 新的观察。空间智能与物理规律的理解,是 MLLM 走向具身与世界模型的必经之路。



