把一个多模态模型拆成七个可追问的设计决策:信号如何进入、表征留下什么、模态在哪里相遇、主干预测什么、状态如何输出、能力如何训练、以及——模型何时成为一个系统。点击任意模块,看它背后的范式与代表文献。
从全景框架进入逐月论文索引。按年份、研究类型或关键词筛选,查看机构、核心贡献与论文入口。
这里展示子页面的实时预览。点击窗口将在新标签页打开完整时间线;子页面右上角可随时返回本页。
理解与生成,一体两面
任意一个统一多模态模型,都可以沿着「输入 → 表征 → 融合 → 预测 → 输出 → 训练 → 系统」七层拆解。点击层切换;上方用动态演示追踪真实数据流,下方是四个范式模块,点击模块可弹出完整大图,下方同步展示代表工作与权衡。
69 秒拆开三个关键瞬间:图片如何切成 patch tokens;early fusion 与 cross-attention 到底在哪里交互;hidden states 如何经过不同输出头变回文字或像素。
架构决定上限,数据决定下限。训练数据分为六类模态——每一类都为模型注入一种独特的「世界观」。下方环图展示了 Cosmos 3 Reasoner 的数据配比(悬停查看每类占比),可见预训练以 OCR / Grounding 打底,SFT 则大幅转向视频推理。
图文不再是孤立的对,而是像电影剧本一样交错排列——帧与字幕、步骤与说明彼此锚定。这类数据直接支撑长程上下文、跨帧一致性与 any-to-any 生成。点击图片放大。
从理解型基准到生成型基准,再到指令遵循与文字渲染的定性对比——测评定义了社区对「好模型」的共识。点击下方图片放大查看示例。




系统范式的终点是闭环:感知 → 预测 → 行动 → 新的观察。空间智能与物理规律的理解,是 MLLM 走向具身与世界模型的必经之路。


