---
title: "PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models"
title_zh: "PersonaPlex：全双工对话语音模型的角色与音色控制"
arxiv_id: "2602.06053"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/02/2602.06053.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# PersonaPlex：全双工对话语音模型的角色与音色控制

## 一句话定位

提出 PersonaPlex，一种基于混合系统提示（文本角色+音频音色）的全双工语音对话模型，支持零样本音色克隆与细粒度角色控制，在真实场景客服任务中实现高自然度与强指令遵循能力。

## 小学生也能听懂

这篇论文发明了一个会“变声”和“演戏”的语音助手，像演员一样能模仿不同人的声音（音色克隆），还能按剧本（角色描述）说话，边听边回，像真人客服一样自然聊天。

## 为什么值得记录

- 首次将角色条件化与音色克隆集成到全双工语音模型中，突破现有系统仅支持固定角色与音色的限制
- 提出 Service-Duplex-Bench 基准，扩展 Full-Duplex-Bench 至多角色客服场景，填补真实世界角色评估空白
- 在保持低延迟与流畅交互的同时，实现与闭源商业系统（如 Gemini Live）相当的自然度与角色一致性
- 开源模型 checkpoint 在多个指标上超越同类开放模型，推动个性化对话代理研究

## 核心方法

- 采用 Moshi 架构作为基础，接收三路输入：用户音频、代理文本、代理音频
- 设计 Hybrid System Prompt：前部为语音样本（用于音色克隆），后部为文本角色描述（用于角色控制），两段通过自定义分隔符连接
- 训练时屏蔽系统提示部分的损失回传，并对非语义音频 token（权重 0.02）和填充文本 token（权重 0.3）进行降权处理
- 使用大规模合成数据训练：1840 小时客服对话 + 410 小时问答对话，由 Qwen-3-32B 和 GPT-OSS-120B 生成对话文本，Dia 和 Chatterbox TTS 生成语音
- 初始化权重来自 Moshi，采用 Adam 优化器（深度 transformer lr=4e-6，时序 transformer lr=2e-6），训练 24,576 步，batch size 32，最大序列长度 2048 token（约 164 秒）

## 关键结果

- 在 Full-Duplex-Bench 上 DMOS 达 3.90（95% CI ±0.15），显著高于 Moshi（3.11）和 Freeze-Omni（3.51）
- 音色相似度 SSIM 达 0.57，远超其他基线（Moshi: 0.10, Qwen-2.5-Omni: 0.07）
- 在 Service-Duplex-Bench 上 GPT-4o 评分均值为 4.48，仅次于 Gemini（4.73），远高于其他开放模型
- 数据量实验显示：25% 数据即可接近全量性能，表明合成数据高效；但角色一致性随数据量持续增长
- 发布版本进一步融合 Fisher 真实对话数据并使用 TortoiseTTS 合成语音，SSIM 提升至 0.65，回话频率提高

## 局限与风险

- 依赖大规模合成数据，虽避免隐私问题但可能引入分布偏差
- 角色控制仍基于静态文本提示，缺乏动态上下文适应能力
- 未进行强化学习对齐，可能存在指令误解或不当响应风险
- 评估中 Service-Duplex-Bench 为单轮探针，未充分测试多轮角色一致性

## 适合沉淀的概念

`full-duplex-speech-model`, `voice-cloning`, `role-conditioning`, `hybrid-system-prompt`, `synthetic-dialogue-generation`, `service-duplex-bench`, `dialogue-naturalness-mos`, `speaker-similarity-ssim`

## 阅读注意

- 注意 Hybrid System Prompt 的结构设计：语音在前可支持推理时预填充以降低延迟
- Table 2 中 TOR 指标含义需结合 Full-Duplex-Bench 原文理解（越低越好或越高越好因任务而异）
- Appendix A 说明发布版本与论文实验设置的差异：使用合成语音替代真实语音，并加入 Fisher 数据提升自然表达
- Service-Duplex-Bench 的 7 类问题（如 Proper Noun、Unfulfillable Request）用于细粒度评估角色行为
- 训练策略上采用 Moshi 权重初始化 + 微调，而非从头训练，体现迁移学习有效性

## 质量说明

- 采用来源：`clean`，`papers/2026/02/2602.06053.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、结果数据及发布版本说明，关键图表与表格均提供，可支撑复现与深入分析。
