---
title: "Paper: 2602.21900"
title_zh: "EmoOmni：面向全模态大模型的情感理解与表达统一框架"
arxiv_id: "2602.21900"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/02/2602.21900.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# EmoOmni：面向全模态大模型的情感理解与表达统一框架

## 一句话定位

提出 EmoOmni 框架，通过显式建模 Perception-Reasoning-Expression 因果链和情感思维链（E-CoT），结合真实世界数据管道 EmoOmniPipe 与评估基准 EmoOmniEval，实现多模态情感对话中的精准理解与表达。

## 小学生也能听懂

这篇论文像教机器人“察言观色”：先看懂人说话时的表情和语气（感知），再想清楚该怎么回应才贴心（推理），最后用合适的语调说出来（表达），还用真实影视片段训练它，让小小机器人也能像大人一样懂感情地聊天。

## 为什么值得记录

- 现有全模态大模型在复杂现实场景中情感理解浅层、响应情感错位，尤其在 Thinker-Talker 架构中因隐式状态传递导致情感细节丢失。
- 缺乏真实世界细粒度标注的多模态情感对话数据与系统性评估基准，制约模型发展。
- 提出 E-CoT 机制将情感推理显式化为高层指令，指导语音生成，实现语义与情感对齐。
- 7B 参数模型性能媲美 30B 模型，证明显式推理与高质量数据可弥补参数量差距。

## 核心方法

- 设计 Perception-Reasoning-Expression 三阶段因果链架构，显式解耦情感理解、策略决策与语音表达。
- 引入 Emotional Chain-of-Thought (E-CoT)，包含多模态情感分析、用户意图识别、响应策略规划与文本响应生成四个组件，作为推理轨迹与 Talker 的显式指令。
- 构建 EmoOmniPipe 数据管道：从影视剧提取原始音视频，经降噪、语音识别、说话人分离、多模态标注（六维度）后，用 GPT-4o 过滤并构建 E-CoT。
- 采用两阶段训练：第一阶段专注感知 grounding（优化 P(z_p|M)），第二阶段联合优化完整因果链（P(Z|M)）。
- EmoOmni-Talker 基于 VoiceSculptor，通过轻量语言模型将策略 z_s 映射为可执行声学指令 I_emo，实现指令引导的语音合成。

## 关键结果

- 在 EmoOmniEval 基准（MELD 与 ch-sims-v2）上，EmoOmni-7B 的 VS-RES（1.36/1.67）与 VS-RC（1.40/1.75）优于同规模模型，接近 Qwen3Omni-Thinking-30B。
- VT-EA（1.93/1.97）与 VT-RES（1.95/1.99）表现优异，表明其强情感理解与策略规划能力。
- IF 分数（1.26/1.57）显示 Talker 能较好遵循显式指令生成情感匹配语音。

## 局限与风险

- 7B 模型在 VT-RC（1.53/1.81）上仍弱于更大模型，受限于基座模型容量与预训练数据分布。
- IF 指标波动较大，受语义内容、指令设计及 LLM 评判主观性影响，需更严格控制变量验证。
- 依赖私有高质量 TTS 数据（3000 小时）训练 Talker，可能影响复现性。

## 适合沉淀的概念

`emotional-chain-of-thought`, `perception-reasoning-expression`, `multimodal-emotional-dialogue`, `instruction-guided-tts`, `thinker-talker-architecture`, `emotionally-intelligent-hci`, `llm-as-a-judge-evaluation`

## 阅读注意

- 关注 E-CoT 如何作为中间表示桥接感知与表达，并作为 Talker 的显式控制信号。
- 注意两阶段训练如何缓解因果链中感知误差的级联传播问题。
- EmoOmniEval 的三种评估设置（VS/VT/IF）提供了端到端、文本推理与语音合成的解耦分析视角。
- 数据管道中 Gemini2.5Pro 用于生成 E-CoT，需注意潜在幻觉风险（附录 G 有毒性过滤）。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/02/2602.21900.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、数据构建流程与评估细节，包含关键公式、架构图与多维度结果，信息充分可支撑研究复现与理解。
