---
title: "2502.06589"
title_zh: "Hephaestus：通过持续预训练提升大语言模型的基础智能体能力"
arxiv_id: "2502.06589"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/02/2502.06589.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Hephaestus：通过持续预训练提升大语言模型的基础智能体能力

## 一句话定位

提出 Hephaestus-Forge 预训练语料库与 Hephaestus 模型，通过持续预训练增强 LLM 在 API 调用、内在推理规划和环境反馈适应方面的基础智能体能力。

## 小学生也能听懂

这篇论文像给AI大脑“加餐”，专门准备了一套包含大量工具使用记录和API调用方法的学习资料（Hephaestus-Forge），让大模型通过持续学习掌握调用工具、推理规划和适应环境的能力，最终表现超过许多同类模型。

## 为什么值得记录

- 首次系统性地在预训练阶段引入大规模智能体专用数据，而非仅依赖指令微调或提示工程
- 构建了包含 103B token、76,537 个 API 的 Hephaestus-Forge 语料库，涵盖工具文档与函数调用轨迹
- 通过缩放律实验确定最优数据混合比例（约 36% 智能体数据），为后续研究提供可复用的训练配方
- Hephaestus-8B 在多个智能体基准上超越同规模开源模型，并接近商业 API 模型性能

## 核心方法

- 构建三阶段 Hephaestus-Forge 语料库：种子数据收集（高质量 API 文档与轨迹）、网页数据检索（基于语义相似度扩展）、数据质量控制（fastText 分类器过滤非智能体内容）
- 采用两阶段持续预训练：第一阶段在整个 Hephaestus-Forge 上注入通用智能体知识，第二阶段在高质量种子数据上强化特定能力
- 使用语言建模目标进行自回归预训练，随后在 ShareGPT、ToolACE 和 AgentFlan 等数据集上进行指令微调
- 通过小模型缩放律实验拟合损失函数，确定智能体数据、文本数据与代码数据的最佳混合比例约为 1:1:1

## 关键结果

- Hephaestus-8B 在 AgentBench 上平均成功率比 LLaMA-3-8B 高 9.6%，比 Mixtral-8x22B 高 17.6%
- 在 Berkeley Function Calling Leaderboard (BFCL) 上，Hephaestus-8B 准确率超过 Claude-3-Haiku 18.9%，超过 GPT-3.5-turbo 4.1%
- 缩放律实验表明，当智能体数据占比约为 36% 时，模型在智能体任务与通用任务上的综合表现最优
- 使用 Mistral-7B 作为 backbone 时，Hephaestus-7B 在 AgentBench 上的平均得分提升 1.06（base）和 0.4（instruct）

## 局限与风险

- 数据质量控制依赖 fastText 模型，存在误判风险（如将含技术术语的一般文本错误归类为智能体数据）
- 未公开 Hephaestus-Forge 的完整数据构成细节，仅提供部分种子数据来源，影响可复现性
- 实验未涵盖多模态或具身智能场景，主要聚焦文本型 API 调用与规划任务

## 适合沉淀的概念

`hepphaestus-forge`, `agent-pretraining-corpus`, `scaling-laws-for-agent-data`, `continual-pretraining-for-agents`, `function-calling-benchmarks`, `intrinsic-reasoning-in-llms`, `environment-feedback-adaptation`, `data-mixing-ratio-optimization`

## 阅读注意

- 关注作者如何通过 t-SNE 可视化验证检索数据与种子数据的语义接近性（图 2d）
- 注意两阶段持续预训练的设计动机：缓解分布偏移导致的‘稳定性间隙’问题
- 附录 G 提供了代码合成、检索数据示例及过滤失败案例，有助于理解数据构建的实际挑战
- 表 9 和表 10 列出了种子数据的具体来源，可作为后续构建类似语料库的参考

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/02/2502.06589.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了较完整的方法描述、实验设置与结果分析，包含消融实验与案例分析。尽管部分数据细节未完全公开，但整体信息足以支持核心结论的理解与部分复现。
