Paper: 2602.21900
论文导读
提出 EmoOmni 框架,通过显式建模 Perception-Reasoning-Expression 因果链和情感思维链(E-CoT),结合真实世界数据管道 EmoOmniPipe 与评估基准 EmoOmniEval,实现多模态情感对话中的精准理解与表达。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
EmoOmni:面向全模态大模型的情感理解与表达统一框架
一句话定位
提出 EmoOmni 框架,通过显式建模 Perception-Reasoning-Expression 因果链和情感思维链(E-CoT),结合真实世界数据管道 EmoOmniPipe 与评估基准 EmoOmniEval,实现多模态情感对话中的精准理解与表达。
小学生也能听懂
这篇论文像教机器人“察言观色”:先看懂人说话时的表情和语气(感知),再想清楚该怎么回应才贴心(推理),最后用合适的语调说出来(表达),还用真实影视片段训练它,让小小机器人也能像大人一样懂感情地聊天。
为什么值得记录
- 现有全模态大模型在复杂现实场景中情感理解浅层、响应情感错位,尤其在 Thinker-Talker 架构中因隐式状态传递导致情感细节丢失。
- 缺乏真实世界细粒度标注的多模态情感对话数据与系统性评估基准,制约模型发展。
- 提出 E-CoT 机制将情感推理显式化为高层指令,指导语音生成,实现语义与情感对齐。
- 7B 参数模型性能媲美 30B 模型,证明显式推理与高质量数据可弥补参数量差距。
核心方法
- 设计 Perception-Reasoning-Expression 三阶段因果链架构,显式解耦情感理解、策略决策与语音表达。
- 引入 Emotional Chain-of-Thought (E-CoT),包含多模态情感分析、用户意图识别、响应策略规划与文本响应生成四个组件,作为推理轨迹与 Talker 的显式指令。
- 构建 EmoOmniPipe 数据管道:从影视剧提取原始音视频,经降噪、语音识别、说话人分离、多模态标注(六维度)后,用 GPT-4o 过滤并构建 E-CoT。
- 采用两阶段训练:第一阶段专注感知 grounding(优化 P(z_p|M)),第二阶段联合优化完整因果链(P(Z|M))。
- EmoOmni-Talker 基于 VoiceSculptor,通过轻量语言模型将策略 z_s 映射为可执行声学指令 I_emo,实现指令引导的语音合成。
关键结果
- 在 EmoOmniEval 基准(MELD 与 ch-sims-v2)上,EmoOmni-7B 的 VS-RES(1.36/1.67)与 VS-RC(1.40/1.75)优于同规模模型,接近 Qwen3Omni-Thinking-30B。
- VT-EA(1.93/1.97)与 VT-RES(1.95/1.99)表现优异,表明其强情感理解与策略规划能力。
- IF 分数(1.26/1.57)显示 Talker 能较好遵循显式指令生成情感匹配语音。
局限与风险
- 7B 模型在 VT-RC(1.53/1.81)上仍弱于更大模型,受限于基座模型容量与预训练数据分布。
- IF 指标波动较大,受语义内容、指令设计及 LLM 评判主观性影响,需更严格控制变量验证。
- 依赖私有高质量 TTS 数据(3000 小时)训练 Talker,可能影响复现性。
适合沉淀的概念
emotional-chain-of-thought, perception-reasoning-expression, multimodal-emotional-dialogue, instruction-guided-tts, thinker-talker-architecture, emotionally-intelligent-hci, llm-as-a-judge-evaluation
阅读注意
- 关注 E-CoT 如何作为中间表示桥接感知与表达,并作为 Talker 的显式控制信号。
- 注意两阶段训练如何缓解因果链中感知误差的级联传播问题。
- EmoOmniEval 的三种评估设置(VS/VT/IF)提供了端到端、文本推理与语音合成的解耦分析视角。
- 数据管道中 Gemini2.5Pro 用于生成 E-CoT,需注意潜在幻觉风险(附录 G 有毒性过滤)。
质量说明
- 采用来源:
raw,raw/papers/2026/02/2602.21900.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、实验设置、数据构建流程与评估细节,包含关键公式、架构图与多维度结果,信息充分可支撑研究复现与理解。