AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
论文导读
提出 AgenticRecTune,一个由五个专用 LLM 智能体(Actor、Critic、Insight、Skill、Online)构成的端到端推荐系统配置优化框架,通过自演进 Skillhub 和在线 A/B 测试实现多阶段系统参数自动化调优。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
AgenticRecTune:基于自演进技能中心的多智能体推荐系统优化框架
一句话定位
提出 AgenticRecTune,一个由五个专用 LLM 智能体(Actor、Critic、Insight、Skill、Online)构成的端到端推荐系统配置优化框架,通过自演进 Skillhub 和在线 A/B 测试实现多阶段系统参数自动化调优。
小学生也能听懂
这篇论文就像让五个聪明的小机器人一起帮推荐系统自动调参数:一个出主意,一个挑毛病,一个做实验,一个学经验,一个记好办法,它们不断试错、学习,让推荐更准更有趣,在真实系统里效果明显变好了。
为什么值得记录
- 解决了工业级推荐系统中多阶段配置优化的可扩展性问题,传统手动调参难以应对高维非可微参数空间
- 引入自演进 Skillhub 机制,将历史实验数据转化为可执行领域知识,实现系统持续自我改进
- 通过 Actor-Critic 架构提升候选配置质量,结合 Online Agent 直接优化真实线上多目标指标(如 engagement、diversity)
- 在 Google Discover 生产环境中验证有效性,多个任务实现统计显著的线上指标提升
核心方法
- 构建五智能体协同架构:Actor 提出配置候选,Critic 过滤次优方案,Online 执行 A/B 测试,Insight 分析历史数据,Skill 更新技能库
- 设计结构化任务提示(Task Prompt),融合当前配置、领域知识、历史 elite 候选和约束条件,指导 LLM 推理
- 实现 Agent Memory 模块,支持配置候选的写入、读取、剪枝与多样性最大化,保留 Pareto 前沿上的 elite 解
- 提出自演进 Skillhub:Insight Agent 通过自学习与跨任务学习提取敏感参数与成功模式,Skill Agent 动态更新技能中的搜索空间与领域知识
- 采用 Actor-Critic 策略增强稳定性,Critic 基于格式、护栏、历史失败案例等维度对 Actor 提案进行批评与精炼
- Online Agent 自动生成实验代码并调度 A/B 测试,收集线上指标反馈至 Agent Memory 形成闭环
关键结果
- 在预排序阶段 Value-Based Retrieval 任务中,engagement metric 1/2 分别提升 0.75%/0.90%,diversity 提升 0.48%
- 在排序阶段 Value Fusion 任务中,engagement metric 1/2 分别提升 0.62%/0.19%
- 在重排序阶段 Diversity 任务中,diversity metric 显著提升 3.43%,同时 engagement metric 1/2 也分别提升 0.21%/0.29%
- 模型消融显示 Gemini 3 Pro 在多样性任务上表现最优(3.43% vs Flash 的 1.69%),表明大模型推理能力对复杂优化至关重要
- 策略消融表明 Actor-Critic 架构相比单 Agent 在 Value-Based Retrieval 任务中 engagement 提升翻倍(0.75% vs 0.29%)
局限与风险
- 依赖高质量的历史实验日志与结构化技能定义,冷启动阶段需人工初始化 Skillhub
- A/B 测试周期长,每次迭代需等待统计显著性结果,影响优化速度
- 未公开具体参数搜索空间定义方式与多样性距离计算细节,复现需额外工程实现
- 当前仅验证于 Google Discover 场景,跨域泛化能力待进一步验证
适合沉淀的概念
multi-agent-system, self-evolving-skillhub, actor-critic-architecture, recommendation-system-optimization, online-ab-testing, agent-memory, compositional-optimization, llm-powered-automl
阅读注意
- 重点关注第 4.3 节 Agent Memory 的更新机制,特别是多样性最大化与模式学习如何避免局部最优
- 注意 Skillhub 的动态演化过程(4.4 节):Insight Agent 提取模式 → Skill Agent 更新 Domain Knowledge 与 Task Requirements
- Table 1-3 展示了不同维度(任务、模型、策略)的消融结果,是验证框架有效性的核心证据
- 公式 (1) 定义了多目标组合优化问题,明确系统成本约束与 North Star 指标最大化目标
- Figure 1 和 Figure 2 提供了整体工作流与 Actor Prompt 结构,有助于理解信息流动路径
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.26969.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、实验设置与量化结果,包含消融研究,且明确说明部署于 Google Discover 生产环境。虽部分实现细节未完全公开(如距离函数、剪枝阈值),但核心机制与验证充分,具备可复现基础。