论文
arXiv2502.06589
时间2025-02
来源Markdown
页面质量中文卡片
阅读量级158 分钟

2502.06589

论文导读

提出 Hephaestus-Forge 预训练语料库与 Hephaestus 模型,通过持续预训练增强 LLM 在 API 调用、内在推理规划和环境反馈适应方面的基础智能体能力。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Hephaestus:通过持续预训练提升大语言模型的基础智能体能力

一句话定位

提出 Hephaestus-Forge 预训练语料库与 Hephaestus 模型,通过持续预训练增强 LLM 在 API 调用、内在推理规划和环境反馈适应方面的基础智能体能力。

小学生也能听懂

这篇论文像给AI大脑“加餐”,专门准备了一套包含大量工具使用记录和API调用方法的学习资料(Hephaestus-Forge),让大模型通过持续学习掌握调用工具、推理规划和适应环境的能力,最终表现超过许多同类模型。

为什么值得记录

  • 首次系统性地在预训练阶段引入大规模智能体专用数据,而非仅依赖指令微调或提示工程
  • 构建了包含 103B token、76,537 个 API 的 Hephaestus-Forge 语料库,涵盖工具文档与函数调用轨迹
  • 通过缩放律实验确定最优数据混合比例(约 36% 智能体数据),为后续研究提供可复用的训练配方
  • Hephaestus-8B 在多个智能体基准上超越同规模开源模型,并接近商业 API 模型性能

核心方法

  • 构建三阶段 Hephaestus-Forge 语料库:种子数据收集(高质量 API 文档与轨迹)、网页数据检索(基于语义相似度扩展)、数据质量控制(fastText 分类器过滤非智能体内容)
  • 采用两阶段持续预训练:第一阶段在整个 Hephaestus-Forge 上注入通用智能体知识,第二阶段在高质量种子数据上强化特定能力
  • 使用语言建模目标进行自回归预训练,随后在 ShareGPT、ToolACE 和 AgentFlan 等数据集上进行指令微调
  • 通过小模型缩放律实验拟合损失函数,确定智能体数据、文本数据与代码数据的最佳混合比例约为 1:1:1

关键结果

  • Hephaestus-8B 在 AgentBench 上平均成功率比 LLaMA-3-8B 高 9.6%,比 Mixtral-8x22B 高 17.6%
  • 在 Berkeley Function Calling Leaderboard (BFCL) 上,Hephaestus-8B 准确率超过 Claude-3-Haiku 18.9%,超过 GPT-3.5-turbo 4.1%
  • 缩放律实验表明,当智能体数据占比约为 36% 时,模型在智能体任务与通用任务上的综合表现最优
  • 使用 Mistral-7B 作为 backbone 时,Hephaestus-7B 在 AgentBench 上的平均得分提升 1.06(base)和 0.4(instruct)

局限与风险

  • 数据质量控制依赖 fastText 模型,存在误判风险(如将含技术术语的一般文本错误归类为智能体数据)
  • 未公开 Hephaestus-Forge 的完整数据构成细节,仅提供部分种子数据来源,影响可复现性
  • 实验未涵盖多模态或具身智能场景,主要聚焦文本型 API 调用与规划任务

适合沉淀的概念

hepphaestus-forge, agent-pretraining-corpus, scaling-laws-for-agent-data, continual-pretraining-for-agents, function-calling-benchmarks, intrinsic-reasoning-in-llms, environment-feedback-adaptation, data-mixing-ratio-optimization

阅读注意

  • 关注作者如何通过 t-SNE 可视化验证检索数据与种子数据的语义接近性(图 2d)
  • 注意两阶段持续预训练的设计动机:缓解分布偏移导致的‘稳定性间隙’问题
  • 附录 G 提供了代码合成、检索数据示例及过滤失败案例,有助于理解数据构建的实际挑战
  • 表 9 和表 10 列出了种子数据的具体来源,可作为后续构建类似语料库的参考

质量说明

  • 采用来源:rawraw/papers/2025/02/2502.06589.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了较完整的方法描述、实验设置与结果分析,包含消融实验与案例分析。尽管部分数据细节未完全公开,但整体信息足以支持核心结论的理解与部分复现。