---
title: ""
title_zh: "从上下文到技能：语言模型能否熟练地从上下文中学习？"
arxiv_id: "2604.27660"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.27660.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 从上下文到技能：语言模型能否熟练地从上下文中学习？

## 一句话定位

提出 Ctx2Skill 框架，通过多智能体自博弈和跨时间回放机制，无需人工标注或外部反馈即可从复杂上下文中自动发现、精炼和选择上下文相关技能，提升语言模型在上下文学习任务上的表现。

## 小学生也能听懂

这篇论文就像教一个学生如何自学一本厚厚的技术说明书。它不直接告诉学生答案，而是让两个AI互相出题和答题：一个AI（挑战者）根据说明书出难题，另一个AI（推理者）尝试解答。答错了，推理者就总结新规则；答对了，挑战者就改进出题策略。它们不断迭代，直到推理者掌握说明书里的所有关键知识。最后，系统会从所有学到的规则中选出最通用的一套，用来帮助其他AI更好地理解这本说明书。

## 为什么值得记录

- 解决了上下文学习中手动构建技能成本高昂且难以自动化的问题，为处理长文本、高密度技术文档提供了新思路。
- 提出了一种无需外部反馈信号的自动化技能发现范式，突破了现有方法依赖执行反馈或真值比较的限制。
- 通过跨时间回放机制有效缓解了自博弈过程中的对抗性崩溃问题，确保技能集的泛化能力。
- 在 CL-Bench 四个类别任务上均显著提升主流大模型（如 GPT-4.1、GPT-5.1）的解决率，验证了方法的有效性和通用性。
- 生成的技能以自然语言形式存在，可插拔至任意语言模型，无需参数更新，具有良好的可解释性和部署灵活性。

## 核心方法

- 采用多智能体自博弈框架，包含 Challenger（生成任务与评分标准）、Reasoner（基于当前技能集尝试解题）、Judge（二元判定是否通过所有评分项）三个核心角色。
- 引入 Proposer-Generator 对机制：失败案例由 Reasoner 侧的 Proposer 诊断缺失知识，Generator 将其转化为新技能；成功案例则由 Challenger 侧用于强化任务生成策略。
- 所有智能体使用冻结的语言模型，仅通过自然语言技能文本进行演化，避免参数更新。
- 设计 Cross-Time Replay 机制：在每一轮收集最难失败和最易成功样本作为探针集，最终选择在硬/易探针集上综合表现最优的技能集，防止过拟合。
- 技能以 Markdown 文件形式存储，在推理时前置到系统提示中，供任意语言模型调用。
- 整个流程完全无监督，不依赖人工标注或外部验证信号。

## 关键结果

- 在 CL-Bench 基准测试中，Ctx2Skill 在 GPT-4.1 上将从基线 11.1% 提升至 16.5%，在 GPT-5.1 上从 21.2% 提升至 25.8%，在 GPT-5.2 上从 18.2% 提升至 21.4%。
- 在 Domain Knowledge Reasoning、Rule System Application、Procedural Task Execution、Empirical Discovery & Simulation 四个类别上均实现稳定增益。
- 相比 Prompting 和 AutoSkill4Doc 基线方法，Ctx2Skill 表现出更强的上下文知识提取与泛化能力。
- 案例分析显示，使用 Ctx2Skill 技能的响应更结构化，更严格遵守评分细则和格式要求。
- 技能集大小随迭代线性增长，但 Cross-Time Replay 能有效选择出更简洁且泛化性更强的中间版本（如 GPT-4.1 最终选中约 705 词的中位技能集，而非第5轮最长的 1703 词）。

## 局限与风险

- 实验受限于 API 预算，仅运行 5 轮迭代、每轮 5 个任务，更大规模运行可能带来进一步改进但未验证。
- 未报告多次独立运行的误差范围或置信区间，尽管评估覆盖全部 500 个上下文，结果仍具稳定性。
- 当前 Judge 依赖 LLM-as-a-judge（GPT-5.1），虽与原基准一致，但仍属近似评估，未来可探索形式化验证替代方案。
- 框架假设上下文本身包含解题所需全部信息，若上下文不完整或矛盾，性能可能下降。
- 技能生成质量受底层 LLM 能力影响显著（如 GPT-5.1 生成技能更详细），在较弱模型上效果可能受限。

## 适合沉淀的概念

`context-learning`, `inference-time-skill-augmentation`, `multi-agent-self-play`, `adversarial-collapse`, `cross-time-replay`, `skill-discovery-without-feedback`, `llm-as-a-judge`, `procedural-knowledge-extraction`

## 阅读注意

- 重点关注 3.3 节中的五类智能体角色定义及其交互流程，这是理解整个框架的核心。
- 注意 3.4 节提出的对抗性崩溃问题及其解决方案——跨时间回放机制的设计动机与数学形式化。
- 查看表 1 和附录中的统计表格（如表 10），了解不同模型下技能集演化趋势及最终选择策略的实际效果。
- 附录 C 的案例研究直观展示了有无技能时响应质量的差异，有助于理解技能的实际作用。
- 算法 1 提供了完整的伪代码流程，适合复现或工程实现参考。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.27660.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、结果数据、消融分析和案例研究，包含关键公式、算法伪代码和提示模板，信息充分且结构清晰，足以支持理解和复现。
