论文
arXiv2604.24026
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级112 分钟

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

论文导读

提出一种三层结构化表示法 SSL,将自然语言描述的智能体技能文档转化为可机器解析的调度、结构与逻辑图,提升技能发现与风险评估效果。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示法

一句话定位

提出一种三层结构化表示法 SSL,将自然语言描述的智能体技能文档转化为可机器解析的调度、结构与逻辑图,提升技能发现与风险评估效果。

小学生也能听懂

这篇论文像把说明书变成乐高图纸,把机器人技能的杂乱文字拆成三层清晰结构:怎么调用、分几步做、每步动哪些零件,让电脑更容易找技能和检查危险,效果明显变好。

为什么值得记录

  • 当前智能体技能多以自然语言文档(如 SKILL.md)形式存在,导致机器难以有效提取接口、执行流程和副作用等关键信息;
  • SSL 首次显式分离技能调用接口、执行阶段结构和原子操作证据,为技能检索、路由与安全审查提供结构化支持;
  • 实验表明,在技能发现任务中 MRR@50 提升 0.080,在风险评估中 macro F1 提升 0.101,验证其实际效用;
  • 该表示法基于 Schank 与 Abelson 的认知语言学理论设计,具备理论基础与工程可实现性。

核心方法

  • 设计三层 JSON 图结构:调度层(Scheduling Layer)记录技能调用接口与意图签名;结构层(Structural Layer)建模执行阶段(如准备、执行、验证)及其转移;逻辑层(Logical Layer)分解为原子动作及资源使用证据;
  • 构建 LLM 驱动的归一化管道(基于 DeepSeek-V3.2),将原始 SKILL.md 文档转换为 SSL 表示,要求所有字段必须源文档 grounded,避免虚构行为;
  • 定义封闭词汇表与类型约束,确保输出可比性与结构化一致性;
  • 通过人工审计验证归一化 fidelity,100 个样本中 83% 的 SSL 字段被判定为源文档支持;
  • 在技能发现任务中,将 SSL 不同层级字段与原始描述或全文结合,用于向量检索;
  • 在风险评估任务中,固定 LLM 判断模型,仅改变输入表示(纯文本 vs. 文本+SSL),评估六类风险维度。

关键结果

  • 技能发现:Desc + SSL-Rich 表示在 431 个查询上达到 MRR@50=0.729,显著优于最强基线 Desc + Source Outline(0.649),提升 0.080(95% CI [0.051, 0.111]);
  • 风险评估:Full SKILL.md + SSL 输入在 252 个技能上 macro F1 达 0.509,优于纯全文输入(0.409),提升 0.101(95% CI [0.051, 0.152]);
  • 细粒度分析显示,SSL 在数据外泄、凭证访问和资源滥用等维度提升最显著;
  • 完整 SSL 单独使用略优于全文,但结合原文效果最佳,说明其作为补充证据层的价值。

局限与风险

  • SSL 归一化依赖 LLM,存在过度抽象或遗漏弱指定流程的风险,人工审计显示 17% 字段未完全 grounded;
  • 当前评估集中于预执行阶段(发现与审查),未验证其在运行时技能调度或执行监控中的效果;
  • SSL 不替代源文档,需与原文配合使用,增加系统复杂度;
  • 风险标签基于静态文档证据,不能保证运行时安全性,可能被误用为攻击指导。

适合沉淀的概念

skill-representation, agent-skills, structured-knowledge-extraction, llm-normalization, skill-discovery, risk-assessment-for-agents, memory-organization-packets, script-theory, conceptual-dependency

阅读注意

  • 关注 SSL 三层如何分别对应调用、执行与操作语义,并理解其与 Schank 理论的类比关系;
  • 注意归一化管道的设计原则:grounded、typed、compact,以及验证机制;
  • 区分技能发现与风险评估两个任务中 SSL 的作用机制:前者重接口与结构匹配,后者重动作与资源证据提取;
  • 查看附录 B 的完整 SSL 实例以理解实际输出格式;
  • 注意作者强调 SSL 是‘证据接口’而非‘标准’,不应完全替代源文档。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.24026.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法设计、实验设置、数据集构建细节与统计显著性检验,包含人工审计与案例研究,材料充分且可复现路径清晰。