2602.03814
论文导读
提出一种基于分布无关风险控制的自适应推理早停框架,通过上下双阈值机制在保证用户指定错误率的前提下最小化计算开销。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Conformal Thinking:基于计算预算的推理风险控制
一句话定位
提出一种基于分布无关风险控制的自适应推理早停框架,通过上下双阈值机制在保证用户指定错误率的前提下最小化计算开销。
小学生也能听懂
这篇论文像给AI做题时加了个“聪明开关”:如果它很有把握就早点停,如果觉得题目太难也早点放弃,用两个关卡控制错误和计算量,让AI又快又准还不浪费力气。
为什么值得记录
- 将推理预算设定问题转化为可解释的风险控制问题,提升部署可控性
- 引入参数化下阈值机制,解决传统上阈值无法处理‘不可解实例’的问题
- 结合效率损失函数,在满足风险约束下自动选择最优信号与阈值组合
- 在多种模型和任务中验证了计算效率增益,尤其在高不可解样本比例场景下优势显著
核心方法
- 定义四类实例级损失函数:上阈值假阳性损失(错误自信停止)、下阈值假阴性损失(过早放弃可解问题)、上阈值效率损失(正确后继续推理)、下阈值效率损失(在不可解问题上浪费token)
- 提出双阈值早停机制:上阈值 λ⁺ 控制置信度达标时停止;下阈值 λ⁻(t;c) 为随token消耗递增的sigmoid函数,当进度不足时提前退出
- 使用带有限样本修正的分布无关风险控制(UCB-based)在校准集上选择阈值,避免验证集过拟合
- 支持多信号集成:枚举候选不确定性信号(如Confidence、EAT、probe等),选择满足风险约束且效率损失最小的组合
- 推理时取上下阈值触发时间的最小值作为实际退出点:τ = min{τ⁺, τ⁻, T}
关键结果
- 在Qwen3-8B/AIME上,使用UCB修正的风险控制方法在40次随机划分中均能将测试风险控制在目标ϵ以下,而朴素方法频繁超标
- 集成多个不确定性信号可使Pareto前沿显著左移,在相同准确率下减少token消耗(如图5所示)
- 当测试集中不可解实例占比达1:1或1:3时,仅用上阈值会导致大量样本耗尽预算,加入下阈值后token使用量明显下降(图6)
- 在DeepScaleR上,验证集大小从40降至8时,UCB相比Naive方法的稳定性优势更加突出(图7)
- 面对长度偏移(短验证→长测试)和数据集偏移(AIME→GPQA),UCB仍能维持风险控制能力,尤其在下阈值场景中(图8-9)
局限与风险
- 下阈值性能依赖于推理轨迹长度的稳定性,在长度分布偏移较大时控制效果减弱
- 联合使用双阈值时,假阳性风险的计算基准变为‘未弃答样本’,可能导致实际控制偏差,需权衡校准复杂度
- 实验未涵盖所有类型的不确定性信号,部分信号(如token计数)在分布偏移下表现较差
- 最大token预算T需预先设定,框架本身不动态调整总预算
适合沉淀的概念
adaptive-reasoning, early-exit-mechanism, risk-control, conformal-prediction, dual-threshold-stopping, false-positive-risk, false-negative-risk, efficiency-loss, uncertainty-signal, distribution-free-calibration
阅读注意
- 重点关注第4.1节中四种损失函数的定义方式,特别是假阴性损失采用未来正确步骤的平均而非存在性判断
- 图3直观展示了不同阈值形状对正确性与效率损失的影响,是理解方法设计的关键
- 算法1虽简洁,但核心在于有限样本修正项的实现(附录B),实际部署需注意δ和网格大小的联合影响
- 实验部分图6的solvable:unsolvable比例构造方法值得借鉴,可用于评估模型在困难任务上的真实效率
质量说明
- 采用来源:
raw,raw/papers/2026/02/2602.03814.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论框架、算法流程、多维度实验验证及消融分析,关键图表清晰,方法可复现性强。