Interactive Survey · 源自 MLLM.pptx

统一多模态大模型
交互式全景图谱

把一个多模态模型拆成七个可追问的设计决策:信号如何进入、表征留下什么、模态在哪里相遇、主干预测什么、状态如何输出、能力如何训练、以及——模型何时成为一个系统。点击任意模块,看它背后的范式与代表文献。

2022–2025发展时间线
7 × 4层范式 × 方案
6 类训练数据模态
0.1B最小可行全模态
SCROLL ↓
Chapter 1 · Timeline

发展时间线:从看图说话到统一世界模型

2022 年 Flamingo 用门控交叉注意力点亮视觉语言模型,2023 年 GPT-4 与 LLaVA 引爆指令微调范式,2024 年 GPT-4o / Chameleon / Emu3 把「理解与生成统一」推上主线,2025 年流式全模态与世界模型成为新前沿。按年份筛选,点击卡片查看定位。

MLLM 发展时间线原图
Chapter 2 · Architecture

七层架构:一台 MLLM 的七个设计决策

PPT 的核心框架:任意一个统一多模态模型,都可以沿着「输入 → 表征 → 融合 → 预测 → 输出 → 训练 → 系统」七层拆解。点击层切换;左侧是该层的动态演示,右侧是拆分后的四个范式模块(来自原始范式图),点模块看代表工作与权衡。

DATA FLOW → → → → → → →

Live Demo · 动态演示

Chapter 3 · Data

数据:六类模态,六种世界观

架构决定上限,数据决定下限。PPT 将训练数据分为六类模态——每一类都为模型注入一种独特的「世界观」。下方环图复刻了 Cosmos 3 Reasoner 的数据配比(悬停查看每类占比),可见预训练以 OCR / Grounding 打底,SFT 则大幅转向视频推理。

Pre-training 数据配比

Cosmos 3 Reasoner · 22.0M samples · 按能力类别

SFT 数据配比

Cosmos 3 Reasoner · 2.2M samples · 视频推理占比显著上升

交错数据(Interleaved):Emu3.5 的视频-文本交错预训练样本

图文不再是孤立的对,而是像电影剧本一样交错排列——帧与字幕、步骤与说明彼此锚定。这类数据直接支撑长程上下文、跨帧一致性与 any-to-any 生成。点击图片放大。

Emu3.5 video interleaved data
Chapter 4 · Evaluation

测评:如何度量「理想的效果」

从理解型基准到生成型基准,再到指令遵循与文字渲染的定性对比——测评定义了社区对「好模型」的共识。以下示例取自原 PPT,点击图片放大查看。

测评数据集示例 I理解 / 感知类基准(原 PPT 第 8 页)
测评数据集示例 II推理 / 生成类基准(原 PPT 第 8 页)
理想效果 · 基础:T2I 定性对比指令被正确执行的部分标红——文字渲染("LANCE" 瓶签)与属性绑定是统一模型的试金石
理想效果 · 基础(续)复杂 prompt 下的一致性与可控性(原 PPT 第 10 页)
Chapter 5 · Minimal Model

最小的模型:把七层决策各选一个最小解

MiniMind-O 用 0.1B 参数、22G 显存走通了完整全模态链路——它是「七层架构」框架的最小实例。点击左侧步骤,看它如何在每一层做减法;右侧为架构总览与同思路的 Show-o2(1.5B / 7B,2025-06-19)。

MiniMind-O 的七个选择

0.1B 参数22G 显存基础 DemoStreaming Omni
MiniMind-O 架构Thinker(语义)+ Talker(语音)双层 AR 结构,Hidden Bridge 中间层桥接
Show-o2(2025-06-19 · 1.5B / 7B)LM Head + Flow Head 双路径,3D Causal VAE,Causal & Full Attention
Chapter 6 · Outlook

展望:从多模态模型到世界模型

系统范式的终点是闭环:感知 → 预测 → 行动 → 新的观察。空间智能与物理规律的理解,是 MLLM 走向具身与世界模型的必经之路。

空间智能与物理规律第一视角探索、操作步骤推理、3D 打印式「草图→实物」任务链
理想效果 · 展望 I世界建模与交互式生成(原 PPT 第 12 页)
理想效果 · 展望 II闭环系统:state + action → future state(原 PPT 第 12 页)
复现路线图多模态输入编码 → 双模块架构 → 语音生成与音色控制 → 核心创新(原 PPT 第 14 页)