---
title: "2604.09022"
title_zh: "BlendFusion：面向扩散模型训练的可扩展合成数据生成"
arxiv_id: "2604.09022"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.09022.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# BlendFusion：面向扩散模型训练的可扩展合成数据生成

## 一句话定位

提出 BlendFusion 框架，通过基于物理的路径追踪从 3D 场景生成高质量图像-文本对，避免纯扩散生成数据的视觉不一致性和模型自噬问题。

## 小学生也能听懂

这篇论文像用乐高搭出真实世界，用电脑3D模型照出清晰照片，再配上准确描述，做出高质量图片数据集，避免AI自己乱画导致“画错字”或“长歪了”。

## 为什么值得记录

- 解决了纯扩散模型生成图像中常见的几何失真、语义漂移和文本渲染失败等问题
- 提出对象中心相机放置策略，显著提升可用渲染帧的生成效率
- 构建了 FineBLEND 数据集（7,500 图像-文本对），其 CLIPScore 分布与 MS-COCO 等真实数据集相当
- 为合成数据生成提供了一种可控、可复现且避免模型崩溃（MAD）的替代方案
- 开源框架支持社区基于 3D 资产库（如 BlenderKit、Objaverse）扩展数据集

## 核心方法

- 使用 Blender 和 BlenderProc 实现基于路径追踪的物理渲染管线
- 对象中心相机放置：围绕每个网格对象的包围盒中心，在 8 个方位角（每 45°）上采样相机位置，固定仰角为 0°，并根据目标填充比例动态调整相机距离
- 启发式过滤：剔除零填充、低亮度、低像素方差及过暗图像（亮度 ≤5 的像素占比 >30%）
- VLM 过滤：使用 Qwen3-VL-8B-Instruct 判断图像是否适合可靠标注（对象或场景可识别），拒绝极端裁剪、不可识别或含渲染伪影的图像
- 自动标注：使用同一 VLM 生成简洁、客观、仅描述可见内容的单句标注
- 质量过滤：基于 CLIPScore（阈值 ≥20）和 LAION 美学评分（阈值 ≥3）进一步筛选
- 多样性感知采样：使用 DINOv2 嵌入进行最远点采样（FPS），确保训练/验证/测试集内部及之间均保持视觉多样性

## 关键结果

- FineBLEND 数据集包含 7,500 个高质量图像-文本对，划分为 4,500/1,500/1,500 的训练/验证/测试集
- FineBLEND 的 CLIPScore 均值为 25.91 ± 3.37，优于 COCO (25.43 ± 3.82) 和 Conceptual Captions (24.72 ± 4.84)，且标准差最低，表明标注一致性高
- 对象中心相机策略在 Barbershop、Emerald Square 和 Sun Temple 场景下，VLM 过滤通过率显著高于随机视角和锚点扫描等无对象感知基线（如 Barbershop 上 5.2% vs ≤1.4%）
- 与 SDXL 生成的同描述图像相比，BlendFusion 渲染图像在几何一致性、语义忠实度和文本可读性方面表现更优，避免了扩散模型常见的幻觉和结构混乱

## 局限与风险

- FineBLEND 规模较小（7.5K），受限于路径追踪和 VLM 过滤的计算开销，未进行大规模扩展
- 未在 FineBLEND 上直接训练扩散模型，其实际训练效果有待验证
- 渲染图像的光学真实感低于自然照片，LAION 美学评分偏低（4.52 vs COCO 的 5.79），可能影响对真实数据的泛化

## 适合沉淀的概念

`synthetic-data-generation`, `diffusion-models`, `model-autophagy-disorder-mad`, `physically-based-rendering`, `object-centric-camera-placement`, `vlm-filtering`, `clipscore`, `diversity-aware-sampling`, `fineblend-dataset`, `blenderproc`

## 阅读注意

- 重点关注对象中心相机放置算法（Algorithm 1）如何保证对象在图像中的合理占比和视角多样性
- 注意 VLM 过滤提示的设计细节（Appendix A），其对极端裁剪、不可识别性和渲染伪影的严格拒绝标准是质量控制的关键
- 比较 Table 3 中不同相机采样策略在困难场景（如 Barbershop）下的表现差异，理解对象感知的重要性
- 思考路径追踪合成数据与扩散生成数据在训练稳定性上的根本区别，以及 MAD 问题的规避机制
- 考虑未来工作如何通过 ControlNet 或扩散后处理提升渲染图像的光学真实感

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.09022.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、消融实验、数据集统计和定性比较，关键结果有量化指标支持，代码和数据集已开源，材料充分可信。
