---
title: "ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding"
title_zh: "ROMA：支持交互式流理解的全模态实时助手"
arxiv_id: "2601.10323"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/01/2601.10323.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# ROMA：支持交互式流理解的全模态实时助手

## 一句话定位

提出 ROMA 模型，通过轻量级 speak head 解耦响应时机与内容生成，结合两阶段训练策略，实现统一的实时音视频主动与被动交互能力。

## 小学生也能听懂

这篇论文做了一个能边看边听边说话的聪明助手，像个小老师一样，可以一边观察视频和声音，一边决定什么时候说话、说什么，既能主动提醒重要事情，也能回答问题，而且反应快、说得准。

## 为什么值得记录

- 首次实现开源全模态（文本+视觉+音频）统一流理解框架，同时支持主动监控（如事件告警、实时解说）和被动问答（QA）
- 提出标准化评估体系，整合碎片化基准为统一的主动/被动双模式评测协议，推动领域可比性
- 在 12 个基准测试中，ROMA 在主动任务上达到 SOTA，在被动任务上具备竞争力，验证其鲁棒性
- 设计 chunked TMRoPE 和 multimodal units 解决音视频粒度不匹配问题，确保跨模态对齐

## 核心方法

- 将连续音视频输入划分为 1 秒对齐的 multimodal units，每个 unit 包含同步的视频帧和音频片段，保留 Qwen2.5-Omni 原生格式
- 采用 chunked Time-aligned Multimodal RoPE (TMRoPE)，为每个 unit 分配累积的 3D 位置 ID（时间、高、宽），维持全局时间线连续性
- 引入 lightweight speak head（两层 MLP），并行于 LM head，基于最后 K=4 层隐藏状态的加权组合预测响应概率，实现响应时机与内容生成的解耦
- 构建三任务流数据集：Online Proactive (27K 事件告警)、Online Narration (109K 实时解说)、Reactive QA (540K 问答)，并合成语音查询以支持音频指令
- 采用两阶段微调：Stage 1 使用 Reactive QA 数据适配流输入格式；Stage 2 联合优化 speak head 的二元交叉熵损失（加权 BCE，w_pos=3）与少量 LM 损失（λ 平衡）
- 推理时采用流水线近似：处理第 t 个 unit 的同时获取第 t+1 个 unit，限制每段生成 ≤25 token（约 1 秒），支持跨 unit 延续响应

## 关键结果

- 在 QVHighlights 上静态时序定位达 53.7 mAP / 53.0 HIT@1，Charades-STA 上达 44.3/19.9 R@0.5/0.7，优于 MMDuet 等基线
- 在动态告警任务（PA/PO/CRR/REC）上全面领先：PA (37.50)、PO (53.60)、CRR (35.42)、REC (33.81)，尤其在重复事件检测（REC）上优势显著
- 实时解说任务中，YouCook2 上 F1 达 35.21，OVO-Bench (SSR) 达 14.54，GPT-4o 综合评分最高（0.39/0.42），表明更精确的时序触发与内容对齐
- 被动 QA 在 OVO-Bench 的 Real-time Visual Perception 和 Backward Tracing 子任务中领先，StreamingBench 的 Omni-Source Understanding 准确率最高（40.40）
- 全模态 QA（Video-MME 无字幕）达 33.30，优于 Qwen2.5-Omni (20.50)、VITA-1.5 (28.56)、MiniCPM-o (19.37)

## 局限与风险

- 依赖预训练 backbone（Qwen2.5-Omni），未从零训练，计算成本仍较高（32 H20 GPUs）
- speak head 的阈值需手动设定（如 YouCook2 用 0.975），虽敏感性分析显示鲁棒，但缺乏自适应机制
- 当前仅支持 2fps 视频采样，可能丢失快速运动细节；音频以 40ms 分辨率处理，但未探索更高频特征
- 未在真实部署环境中测试端到端延迟，仅报告单 unit 编码耗时（0.3697s）

## 适合沉淀的概念

`streaming-multimodal-understanding`, `proactive-vs-reactive-interaction`, `speak-head-mechanism`, `chunked-tmrope`, `multimodal-units`, `two-stage-fine-tuning`, `event-driven-alert`, `real-time-narration`, `temporal-grounding`

## 阅读注意

- 关注 speak head 如何缓解生成偏差对时机决策的干扰（对比 w/o speak head 的消融结果）
- 注意两阶段训练的必要性：混合训练会损害动态决策性能（见 Table 3 和 4 的 Mixed Training 行）
- 理解 multimodal units 的设计如何平衡兼容性与对齐精度（沿用 Qwen2.5-Omni 格式但强制 1s 同步）
- 查看附录 A.6 的案例研究，直观对比 ROMA 与基线在告警、解说、QA 中的行为差异
- 留意评估细节（A.3）：动态任务使用滑动窗口和严格因果约束，确保在线决策真实性

## 质量说明

- 采用来源：`clean`，`papers/2026/01/2601.10323.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法、实验、消融、敏感性分析及详细附录，数据与代码结构清晰，结果可复现性强。
