---
title: "Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking"
title_zh: "Qwen3-VL-Embedding 与 Qwen3-VL-Reranker：统一多模态检索与排序框架"
arxiv_id: "2601.04720"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2026/01/2601.04720.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Qwen3-VL-Embedding 与 Qwen3-VL-Reranker：统一多模态检索与排序框架

## 一句话定位

基于 Qwen3-VL 构建统一多模态嵌入与重排序模型，支持文本、图像、文档图像和视频的联合表示学习，在 MMEB-V2 上达到 SOTA 性能（77.8 分）。

## 小学生也能听懂

这篇论文造了两个“超级眼睛”模型，一个负责把文字、图片、视频变成数字密码（嵌入），另一个负责判断哪个答案最相关（重排序），它们一起工作，让电脑能像人一样看懂各种内容并找到最匹配的答案，在测试中拿了第一名。

## 为什么值得记录

- 首次提出基于 VLM 的统一多模态检索与排序端到端框架，覆盖文本、图像、视频和视觉文档等多种模态
- Qwen3-VL-Embedding-8B 在 MMEB-V2 基准测试中以 77.8 分排名第一（截至 2025 年 1 月），超越所有开源与闭源模型
- 支持 Matryoshka 表示学习和量化感知训练，实现灵活维度嵌入与高效部署
- 采用多阶段训练策略（对比预训练 → 多任务微调 → 重排序器蒸馏），显著提升检索精度与泛化能力
- 支持超过 30 种语言，适用于全球化多语言检索场景

## 核心方法

- 模型架构：Qwen3-VL-Embedding 使用双编码器结构生成稠密向量，Qwen3-VL-Reranker 使用交叉编码器进行细粒度相关性打分
- 输入模板：嵌入模型采用 system-user 指令格式，重排序模型通过判断 'yes'/'no' 输出相关性概率
- 多阶段训练：第一阶段在大规模合成数据上进行对比预训练；第二阶段结合公开与内部数据做多任务对比学习；第三阶段通过重排序器蒸馏优化嵌入模型
- 数据合成：利用 Qwen3-VL-32B 对高质量图像/视频种子池进行多任务标注（分类、QA、检索、时刻检索），构建平衡训练集
- 硬负样本挖掘：基于嵌入相似度筛选高质量正样本与语义相近的硬负样本，提升对比学习效果
- 高效推理技术：集成 Matryoshka Representation Learning（MRL）支持可变维度嵌入；采用 Learned Step Size Quantization（LSQ）实现量化感知训练
- 训练优化：使用 LoRA 微调降低显存开销，动态分辨率与帧率控制输入 token 数（图像 ≤1,280 tokens，视频 ≤4,500 tokens）

## 关键结果

- Qwen3-VL-Embedding-8B 在 MMEB-V2 上取得 77.8 分，排名第一（截至 2025 年 1 月 8 日）
- 在纯文本 MTEB Multilingual 基准上，Qwen3-VL-Embedding-8B 平均任务得分达 67.9，表现竞争力强
- Qwen3-VL-Reranker-8B 相比 2B 版本在多个检索任务上平均提升 4.1 点
- 支持 32k 上下文长度，可处理长文档与长视频输入
- 提供 2B 和 8B 两种参数规模，适配不同部署需求

## 局限与风险

- 未公开完整训练数据集细节，仅描述合成流程，影响可复现性
- 蒸馏阶段依赖 Qwen3-VL-Reranker 的离线打分，可能引入误差传播
- 模型合并策略虽缓解任务退化，但未提供各任务性能权衡的具体数据
- 视频处理采用 1 FPS 采样，可能丢失高频时序信息

## 适合沉淀的概念

`multimodal-retrieval`, `vision-language-models`, `contrastive-learning`, `matryoshka-representation-learning`, `quantization-aware-training`, `cross-encoder-reranking`, `data-synthesis-for-ml`, `multilingual-embedding-models`

## 阅读注意

- 关注多阶段训练中各阶段的数据构成与目标函数差异，尤其是蒸馏阶段如何利用重排序器信号
- 注意 MRL 和 QAT 如何共同降低存储与计算成本，适合工业级检索系统部署
- 附录中的数据合成 prompt 设计对构建高质量多模态训练集具有参考价值
- 模型在视觉文档（如 arXiv 图表）上的表现展示了其在学术检索中的潜力

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/01/2601.04720.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的架构设计、训练流程、实验结果与技术细节，包含消融分析与实际应用场景示例，信息充分且结构清晰。
