From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills
论文导读
提出一种三层结构化表示法 SSL,将自然语言描述的智能体技能文档转化为可机器解析的调度、结构与逻辑图,提升技能发现与风险评估效果。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示法
一句话定位
提出一种三层结构化表示法 SSL,将自然语言描述的智能体技能文档转化为可机器解析的调度、结构与逻辑图,提升技能发现与风险评估效果。
小学生也能听懂
这篇论文像把说明书变成乐高图纸,把机器人技能的杂乱文字拆成三层清晰结构:怎么调用、分几步做、每步动哪些零件,让电脑更容易找技能和检查危险,效果明显变好。
为什么值得记录
- 当前智能体技能多以自然语言文档(如 SKILL.md)形式存在,导致机器难以有效提取接口、执行流程和副作用等关键信息;
- SSL 首次显式分离技能调用接口、执行阶段结构和原子操作证据,为技能检索、路由与安全审查提供结构化支持;
- 实验表明,在技能发现任务中 MRR@50 提升 0.080,在风险评估中 macro F1 提升 0.101,验证其实际效用;
- 该表示法基于 Schank 与 Abelson 的认知语言学理论设计,具备理论基础与工程可实现性。
核心方法
- 设计三层 JSON 图结构:调度层(Scheduling Layer)记录技能调用接口与意图签名;结构层(Structural Layer)建模执行阶段(如准备、执行、验证)及其转移;逻辑层(Logical Layer)分解为原子动作及资源使用证据;
- 构建 LLM 驱动的归一化管道(基于 DeepSeek-V3.2),将原始 SKILL.md 文档转换为 SSL 表示,要求所有字段必须源文档 grounded,避免虚构行为;
- 定义封闭词汇表与类型约束,确保输出可比性与结构化一致性;
- 通过人工审计验证归一化 fidelity,100 个样本中 83% 的 SSL 字段被判定为源文档支持;
- 在技能发现任务中,将 SSL 不同层级字段与原始描述或全文结合,用于向量检索;
- 在风险评估任务中,固定 LLM 判断模型,仅改变输入表示(纯文本 vs. 文本+SSL),评估六类风险维度。
关键结果
- 技能发现:Desc + SSL-Rich 表示在 431 个查询上达到 MRR@50=0.729,显著优于最强基线 Desc + Source Outline(0.649),提升 0.080(95% CI [0.051, 0.111]);
- 风险评估:Full SKILL.md + SSL 输入在 252 个技能上 macro F1 达 0.509,优于纯全文输入(0.409),提升 0.101(95% CI [0.051, 0.152]);
- 细粒度分析显示,SSL 在数据外泄、凭证访问和资源滥用等维度提升最显著;
- 完整 SSL 单独使用略优于全文,但结合原文效果最佳,说明其作为补充证据层的价值。
局限与风险
- SSL 归一化依赖 LLM,存在过度抽象或遗漏弱指定流程的风险,人工审计显示 17% 字段未完全 grounded;
- 当前评估集中于预执行阶段(发现与审查),未验证其在运行时技能调度或执行监控中的效果;
- SSL 不替代源文档,需与原文配合使用,增加系统复杂度;
- 风险标签基于静态文档证据,不能保证运行时安全性,可能被误用为攻击指导。
适合沉淀的概念
skill-representation, agent-skills, structured-knowledge-extraction, llm-normalization, skill-discovery, risk-assessment-for-agents, memory-organization-packets, script-theory, conceptual-dependency
阅读注意
- 关注 SSL 三层如何分别对应调用、执行与操作语义,并理解其与 Schank 理论的类比关系;
- 注意归一化管道的设计原则:grounded、typed、compact,以及验证机制;
- 区分技能发现与风险评估两个任务中 SSL 的作用机制:前者重接口与结构匹配,后者重动作与资源证据提取;
- 查看附录 B 的完整 SSL 实例以理解实际输出格式;
- 注意作者强调 SSL 是‘证据接口’而非‘标准’,不应完全替代源文档。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.24026.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法设计、实验设置、数据集构建细节与统计显著性检验,包含人工审计与案例研究,材料充分且可复现路径清晰。