2502.06589
论文导读
提出 Hephaestus-Forge 预训练语料库与 Hephaestus 模型,通过持续预训练增强 LLM 在 API 调用、内在推理规划和环境反馈适应方面的基础智能体能力。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Hephaestus:通过持续预训练提升大语言模型的基础智能体能力
一句话定位
提出 Hephaestus-Forge 预训练语料库与 Hephaestus 模型,通过持续预训练增强 LLM 在 API 调用、内在推理规划和环境反馈适应方面的基础智能体能力。
小学生也能听懂
这篇论文像给AI大脑“加餐”,专门准备了一套包含大量工具使用记录和API调用方法的学习资料(Hephaestus-Forge),让大模型通过持续学习掌握调用工具、推理规划和适应环境的能力,最终表现超过许多同类模型。
为什么值得记录
- 首次系统性地在预训练阶段引入大规模智能体专用数据,而非仅依赖指令微调或提示工程
- 构建了包含 103B token、76,537 个 API 的 Hephaestus-Forge 语料库,涵盖工具文档与函数调用轨迹
- 通过缩放律实验确定最优数据混合比例(约 36% 智能体数据),为后续研究提供可复用的训练配方
- Hephaestus-8B 在多个智能体基准上超越同规模开源模型,并接近商业 API 模型性能
核心方法
- 构建三阶段 Hephaestus-Forge 语料库:种子数据收集(高质量 API 文档与轨迹)、网页数据检索(基于语义相似度扩展)、数据质量控制(fastText 分类器过滤非智能体内容)
- 采用两阶段持续预训练:第一阶段在整个 Hephaestus-Forge 上注入通用智能体知识,第二阶段在高质量种子数据上强化特定能力
- 使用语言建模目标进行自回归预训练,随后在 ShareGPT、ToolACE 和 AgentFlan 等数据集上进行指令微调
- 通过小模型缩放律实验拟合损失函数,确定智能体数据、文本数据与代码数据的最佳混合比例约为 1:1:1
关键结果
- Hephaestus-8B 在 AgentBench 上平均成功率比 LLaMA-3-8B 高 9.6%,比 Mixtral-8x22B 高 17.6%
- 在 Berkeley Function Calling Leaderboard (BFCL) 上,Hephaestus-8B 准确率超过 Claude-3-Haiku 18.9%,超过 GPT-3.5-turbo 4.1%
- 缩放律实验表明,当智能体数据占比约为 36% 时,模型在智能体任务与通用任务上的综合表现最优
- 使用 Mistral-7B 作为 backbone 时,Hephaestus-7B 在 AgentBench 上的平均得分提升 1.06(base)和 0.4(instruct)
局限与风险
- 数据质量控制依赖 fastText 模型,存在误判风险(如将含技术术语的一般文本错误归类为智能体数据)
- 未公开 Hephaestus-Forge 的完整数据构成细节,仅提供部分种子数据来源,影响可复现性
- 实验未涵盖多模态或具身智能场景,主要聚焦文本型 API 调用与规划任务
适合沉淀的概念
hepphaestus-forge, agent-pretraining-corpus, scaling-laws-for-agent-data, continual-pretraining-for-agents, function-calling-benchmarks, intrinsic-reasoning-in-llms, environment-feedback-adaptation, data-mixing-ratio-optimization
阅读注意
- 关注作者如何通过 t-SNE 可视化验证检索数据与种子数据的语义接近性(图 2d)
- 注意两阶段持续预训练的设计动机:缓解分布偏移导致的‘稳定性间隙’问题
- 附录 G 提供了代码合成、检索数据示例及过滤失败案例,有助于理解数据构建的实际挑战
- 表 9 和表 10 列出了种子数据的具体来源,可作为后续构建类似语料库的参考
质量说明
- 采用来源:
raw,raw/papers/2025/02/2502.06589.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了较完整的方法描述、实验设置与结果分析,包含消融实验与案例分析。尽管部分数据细节未完全公开,但整体信息足以支持核心结论的理解与部分复现。