---
title: "Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs"
title_zh: "模态链：从静态融合到动态编排的全模态大模型"
arxiv_id: "2604.14520"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.14520.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 模态链：从静态融合到动态编排的全模态大模型

## 一句话定位

提出 Chain of Modality (CoM) 框架，通过动态编排模态拓扑结构和推理路径，解决全模态大模型中因静态融合导致的性能退化问题。

## 小学生也能听懂

这篇论文像给AI大脑装了个“智能导演”，能根据问题自动选择用眼睛、耳朵还是两者一起看，并决定先看哪个、后看哪个，让AI更聪明地理解图片、声音和视频，回答得更准、更稳。

## 为什么值得记录

- 揭示了当前全模态大模型中普遍存在的性能悖论：单模态基线常优于多模态联合推理
- 系统诊断出静态融合拓扑引发的两类结构病理：序列输入中的位置偏置与交错格式中的对齐陷阱
- 提出首个基于代理式动态推理的架构，实现任务感知的模态选择与拓扑自适应
- 在训练自由与轻量微调两种设定下均实现跨基准一致泛化，提升感知保真度与推理鲁棒性

## 核心方法

- 将单一 Omni-MLLM 主干重构为三个认知角色：Planner（规划器）、Reasoner（推理器）、Decider（决策器）
- Planner 根据查询语义动态构建最小充分模态集合并选择拓扑结构（并行/序列/交错）
- 针对直觉型任务启用 Plan-Decide 路径，直接映射结构化模态至响应以保留感知保真度
- 针对分析型任务启用 Plan-Reason-Decide 路径，先执行模态特异性证据审计，再合成逻辑依据生成最终答案
- 通过系统提示实现角色切换，保持统一参数空间内的逻辑一致性
- 支持训练自由部署与数据高效 SFT 微调两种应用模式

## 关键结果

- 在 Music-AVQA 上，Qwen-Omni-7B + CoM 准确率提升 +0.9%（77.9% → 78.8%）
- 在 AVHBench 幻觉检测任务中，Qwen-Omni-7B + CoM 的 A-Hal 指标提升 +2.9%（46.5% → 49.4%）
- 在 WorldSense 上，Qwen-Omni-7B + CoM 实现显著增益 +12.9%（66.8% → 79.7%）
- 仅用 5 帧视觉输入时，CoM 性能（54.97%）即超越固定拓扑基线使用 15 帧的结果（54.80%），视觉 token 减少 66%
- 在 Ola-7B 和 Qwen2.5-Omni-3B 等不同架构与规模模型上均验证了稳定增益，证明方法通用性

## 局限与风险

- Ola-7B 上增益有限，因其架构缺乏对交错模态 token 的原生支持，限制了 Planner 的优化空间
- 部分音频中心任务提升不明显，诊断发现 Ola-7B 存在听觉表征能力固有缺陷
- 3B 参数模型因指令遵循能力较弱，复杂编排失败时会回退至默认序列，影响增益幅度
- 当前实现依赖系统提示进行角色切换，未探索参数隔离或多专家混合等更细粒度机制

## 适合沉淀的概念

`全模态大模型`, `模态融合`, `位置偏置`, `对齐陷阱`, `动态推理`, `代理式架构`, `认知路径`, `拓扑自适应`

## 阅读注意

- 重点关注第 3 节对静态融合病理的实证分析，特别是表 2 和图 2 揭示的模态冲突与注意力偏差机制
- 理解图 3 中 CoM 的三阶段架构如何通过系统提示实现单一模型的多角色重构
- 注意表 4 中训练自由设定下 CoM 在多个基准上的稳定增益，尤其是 WorldSense 上的大幅提升
- 图 5 展示了帧采样密度实验，可深入理解 CoM 如何缓解对齐陷阱并提升计算效率
- 第 5.4 节推理效率分析表明 CoM 在预填充阶段具有更低延迟，因其能剪枝冗余模态

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.14520.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含问题定义、方法设计、实验验证与消融分析，数据详实，逻辑清晰，具备可复现性与理论深度。
