---
title: "2604.00536"
title_zh: "OptimSyn：基于影响力引导的评分标准优化合成数据生成"
arxiv_id: "2604.00536"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.00536.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# OptimSyn：基于影响力引导的评分标准优化合成数据生成

## 一句话定位

提出一种基于目标模型梯度影响力估计的强化学习框架，自动优化合成数据生成中的评分标准（rubrics），提升合成数据对下游任务训练的有效性。

## 小学生也能听懂

这篇论文发明了一种聪明的方法，像给AI老师配了个“智能评分助手”，它能自动调整出题标准，让AI生成的练习题更管用，帮助其他AI学得更好，尤其在医学和文科这类难找好题目的领域效果特别棒。

## 为什么值得记录

- 解决了知识密集型领域（如医学、人文社科）高质量监督微调（SFT）数据稀缺的问题
- 突破了传统人工设计评分标准的局限，实现跨领域、跨模型的通用合成数据生成
- 首次将优化器感知的影响力估计用于指导合成数据生成，提供更可靠的训练效用信号
- 在多个基准测试中显著优于现有开源SFT数据集，且在不同目标模型和生成器上表现稳健

## 核心方法

- 采用Adam兼容的影响力估计器（Inf_Adam），基于梯度内积衡量每个合成样本对目标模型验证损失的影响
- 构建强化学习闭环：以rubric生成器为策略模型，以影响力得分为奖励信号，使用GRPO算法进行优化
- 奖励函数结合轻量级有效性检查（格式、安全性等）与影响力得分，避免无效样本干扰
- 通过组归一化优势函数和KL散度约束稳定训练过程，提升策略更新的鲁棒性
- 在种子文档基础上，由rubric生成器生成任务相关的评分标准，再由教师模型合成QA对
- 使用10%初始合成数据对目标模型进行预热，获取参考梯度用于影响力计算

## 关键结果

- 在人文社科和医学两个领域，OptimSyn在Qwen3-8B-Base上平均准确率分别提升+27.2%（HLE）和+11.0%（MMLU-pro）
- 在12个基准测试中，OptimSyn有9个指标超过Qwen3-8B-Instruct，6个超过所有基线SFT数据集
- 影响力得分与下游准确率呈强正相关（R²=0.54–0.57），验证其作为数据质量代理的有效性
- 方法在Qwen3-4B/8B/14B和Llama3-8B上均有效，且对Qwen3-235B、GPT-4.1、Gemini-2.5-Pro三种生成器鲁棒
- 仅需约2万样本即可达到最优性能，训练效率高于其他合成数据集

## 局限与风险

- 影响力估计依赖目标模型的梯度信息，需额外计算开销，可能限制其在资源受限场景的应用
- 验证集构建需谨慎避免数据泄露，小规模验证集虽有效但存在性能波动风险
- 当前框架假设教师模型固定，未探索联合优化生成器与rubric生成器的可能性
- 影响力估计基于一阶近似，在极端非线性优化动态下可能存在偏差

## 适合沉淀的概念

`influence-function`, `synthetic-data-generation`, `reinforcement-learning-for-data-synthesis`, `rubric-optimization`, `gradient-based-reward`, `adam-compatible-influence`, `training-utility-estimation`, `model-aware-data-selection`

## 阅读注意

- 重点关注影响力估计如何从经典理论适配到现代LLM优化器（如Adam）
- 注意验证集构造原则：必须与训练数据无重叠且分布一致，用于梯度计算但不参与SFT
- 分析图1中嵌入空间与梯度空间的分布差异，理解为何语义相近不代表训练效用高
- 比较不同反馈机制（QuRating、FineWeb-Edu、PRRC）与影响力信号的优劣，见附录E.2
- 观察图6中rubric文本的t-SNE可视化，理解RL如何提升评分标准的多样性与结构性

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.00536.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析、实现细节和附录材料，包括代码链接、数据构造流程、提示模板和案例分析，信息充分可复现。
