Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
论文导读
基于 Qwen3-VL 构建统一多模态嵌入与重排序模型,支持文本、图像、文档图像和视频的联合表示学习,在 MMEB-V2 上达到 SOTA 性能(77.8 分)。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Qwen3-VL-Embedding 与 Qwen3-VL-Reranker:统一多模态检索与排序框架
一句话定位
基于 Qwen3-VL 构建统一多模态嵌入与重排序模型,支持文本、图像、文档图像和视频的联合表示学习,在 MMEB-V2 上达到 SOTA 性能(77.8 分)。
小学生也能听懂
这篇论文造了两个“超级眼睛”模型,一个负责把文字、图片、视频变成数字密码(嵌入),另一个负责判断哪个答案最相关(重排序),它们一起工作,让电脑能像人一样看懂各种内容并找到最匹配的答案,在测试中拿了第一名。
为什么值得记录
- 首次提出基于 VLM 的统一多模态检索与排序端到端框架,覆盖文本、图像、视频和视觉文档等多种模态
- Qwen3-VL-Embedding-8B 在 MMEB-V2 基准测试中以 77.8 分排名第一(截至 2025 年 1 月),超越所有开源与闭源模型
- 支持 Matryoshka 表示学习和量化感知训练,实现灵活维度嵌入与高效部署
- 采用多阶段训练策略(对比预训练 → 多任务微调 → 重排序器蒸馏),显著提升检索精度与泛化能力
- 支持超过 30 种语言,适用于全球化多语言检索场景
核心方法
- 模型架构:Qwen3-VL-Embedding 使用双编码器结构生成稠密向量,Qwen3-VL-Reranker 使用交叉编码器进行细粒度相关性打分
- 输入模板:嵌入模型采用 system-user 指令格式,重排序模型通过判断 'yes'/'no' 输出相关性概率
- 多阶段训练:第一阶段在大规模合成数据上进行对比预训练;第二阶段结合公开与内部数据做多任务对比学习;第三阶段通过重排序器蒸馏优化嵌入模型
- 数据合成:利用 Qwen3-VL-32B 对高质量图像/视频种子池进行多任务标注(分类、QA、检索、时刻检索),构建平衡训练集
- 硬负样本挖掘:基于嵌入相似度筛选高质量正样本与语义相近的硬负样本,提升对比学习效果
- 高效推理技术:集成 Matryoshka Representation Learning(MRL)支持可变维度嵌入;采用 Learned Step Size Quantization(LSQ)实现量化感知训练
- 训练优化:使用 LoRA 微调降低显存开销,动态分辨率与帧率控制输入 token 数(图像 ≤1,280 tokens,视频 ≤4,500 tokens)
关键结果
- Qwen3-VL-Embedding-8B 在 MMEB-V2 上取得 77.8 分,排名第一(截至 2025 年 1 月 8 日)
- 在纯文本 MTEB Multilingual 基准上,Qwen3-VL-Embedding-8B 平均任务得分达 67.9,表现竞争力强
- Qwen3-VL-Reranker-8B 相比 2B 版本在多个检索任务上平均提升 4.1 点
- 支持 32k 上下文长度,可处理长文档与长视频输入
- 提供 2B 和 8B 两种参数规模,适配不同部署需求
局限与风险
- 未公开完整训练数据集细节,仅描述合成流程,影响可复现性
- 蒸馏阶段依赖 Qwen3-VL-Reranker 的离线打分,可能引入误差传播
- 模型合并策略虽缓解任务退化,但未提供各任务性能权衡的具体数据
- 视频处理采用 1 FPS 采样,可能丢失高频时序信息
适合沉淀的概念
multimodal-retrieval, vision-language-models, contrastive-learning, matryoshka-representation-learning, quantization-aware-training, cross-encoder-reranking, data-synthesis-for-ml, multilingual-embedding-models
阅读注意
- 关注多阶段训练中各阶段的数据构成与目标函数差异,尤其是蒸馏阶段如何利用重排序器信号
- 注意 MRL 和 QAT 如何共同降低存储与计算成本,适合工业级检索系统部署
- 附录中的数据合成 prompt 设计对构建高质量多模态训练集具有参考价值
- 模型在视觉文档(如 arXiv 图表)上的表现展示了其在学术检索中的潜力
质量说明
- 采用来源:
raw,raw/papers/2026/01/2601.04720.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的架构设计、训练流程、实验结果与技术细节,包含消融分析与实际应用场景示例,信息充分且结构清晰。