Interactive Survey Made by Jingnan

统一多模态大模型
交互式全景图谱

把一个多模态模型拆成七个可追问的设计决策:信号如何进入、表征留下什么、模态在哪里相遇、主干预测什么、状态如何输出、能力如何训练、以及——模型何时成为一个系统。点击任意模块,看它背后的范式与代表文献。

169 项完整研究索引
7 × 4层范式 × 方案
6 类训练数据模态
SCROLL ↓
Extended Index · 2024–2026

继续探索:169 项 MLLM / Omni-MLLM 研究

从全景框架进入逐月论文索引。按年份、研究类型或关键词筛选,查看机构、核心贡献与论文入口。

一扇通往完整研究时间线的窗口

这里展示子页面的实时预览。点击窗口将在新标签页打开完整时间线;子页面右上角可随时返回本页。

169 条记录31 个月份6 类研究路线
打开完整研究时间线  ↗
Video Guide · 理解与生成

How to train unified multi-modal model?

理解与生成,一体两面

06:30英语配音 · 中英字幕
Chapter 1 · Architecture

七层架构:一台 MLLM 的七个设计决策

任意一个统一多模态模型,都可以沿着「输入 → 表征 → 融合 → 预测 → 输出 → 训练 → 系统」七层拆解。点击层切换;上方用动态演示追踪真实数据流,下方是四个范式模块,点击模块可弹出完整大图,下方同步展示代表工作与权衡。

Manim · 01:09 · Core Principle
From pixels to output

先看清数据究竟如何流动

69 秒拆开三个关键瞬间:图片如何切成 patch tokens;early fusion 与 cross-attention 到底在哪里交互;hidden states 如何经过不同输出头变回文字或像素。

DATA FLOW → → → → → → →

Live Demo · 动态演示

Chapter 2 · Data

数据:六类模态,六种世界观

架构决定上限,数据决定下限。训练数据分为六类模态——每一类都为模型注入一种独特的「世界观」。下方环图展示了 Cosmos 3 Reasoner 的数据配比(悬停查看每类占比),可见预训练以 OCR / Grounding 打底,SFT 则大幅转向视频推理。

Pre-training 数据配比

Cosmos 3 Reasoner · 22.0M samples · 按能力类别

SFT 数据配比

Cosmos 3 Reasoner · 2.2M samples · 视频推理占比显著上升

交错数据(Interleaved):Emu3.5 的视频-文本交错预训练样本

图文不再是孤立的对,而是像电影剧本一样交错排列——帧与字幕、步骤与说明彼此锚定。这类数据直接支撑长程上下文、跨帧一致性与 any-to-any 生成。点击图片放大。

Emu3.5 video interleaved data
Chapter 3 · Evaluation

测评:如何度量「理想的效果」

从理解型基准到生成型基准,再到指令遵循与文字渲染的定性对比——测评定义了社区对「好模型」的共识。点击下方图片放大查看示例。

测评数据集示例 I理解 / 感知类基准
测评数据集示例 II推理 / 生成类基准
理想效果 · 基础:T2I 定性对比指令被正确执行的部分标红——文字渲染("LANCE" 瓶签)与属性绑定是统一模型的试金石
理想效果 · 基础(续)复杂 prompt 下的一致性与可控性
Chapter 4 · Outlook

展望:从多模态模型到世界模型

系统范式的终点是闭环:感知 → 预测 → 行动 → 新的观察。空间智能与物理规律的理解,是 MLLM 走向具身与世界模型的必经之路。

空间智能与物理规律第一视角探索、操作步骤推理、3D 打印式「草图→实物」任务链
理想效果 · 展望 I世界建模与交互式生成
理想效果 · 展望 II闭环系统:state + action → future state

图片预览