论文
arXiv2604.26969
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级63 分钟

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

论文导读

提出 AgenticRecTune,一个由五个专用 LLM 智能体(Actor、Critic、Insight、Skill、Online)构成的端到端推荐系统配置优化框架,通过自演进 Skillhub 和在线 A/B 测试实现多阶段系统参数自动化调优。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

AgenticRecTune:基于自演进技能中心的多智能体推荐系统优化框架

一句话定位

提出 AgenticRecTune,一个由五个专用 LLM 智能体(Actor、Critic、Insight、Skill、Online)构成的端到端推荐系统配置优化框架,通过自演进 Skillhub 和在线 A/B 测试实现多阶段系统参数自动化调优。

小学生也能听懂

这篇论文就像让五个聪明的小机器人一起帮推荐系统自动调参数:一个出主意,一个挑毛病,一个做实验,一个学经验,一个记好办法,它们不断试错、学习,让推荐更准更有趣,在真实系统里效果明显变好了。

为什么值得记录

  • 解决了工业级推荐系统中多阶段配置优化的可扩展性问题,传统手动调参难以应对高维非可微参数空间
  • 引入自演进 Skillhub 机制,将历史实验数据转化为可执行领域知识,实现系统持续自我改进
  • 通过 Actor-Critic 架构提升候选配置质量,结合 Online Agent 直接优化真实线上多目标指标(如 engagement、diversity)
  • 在 Google Discover 生产环境中验证有效性,多个任务实现统计显著的线上指标提升

核心方法

  • 构建五智能体协同架构:Actor 提出配置候选,Critic 过滤次优方案,Online 执行 A/B 测试,Insight 分析历史数据,Skill 更新技能库
  • 设计结构化任务提示(Task Prompt),融合当前配置、领域知识、历史 elite 候选和约束条件,指导 LLM 推理
  • 实现 Agent Memory 模块,支持配置候选的写入、读取、剪枝与多样性最大化,保留 Pareto 前沿上的 elite 解
  • 提出自演进 Skillhub:Insight Agent 通过自学习与跨任务学习提取敏感参数与成功模式,Skill Agent 动态更新技能中的搜索空间与领域知识
  • 采用 Actor-Critic 策略增强稳定性,Critic 基于格式、护栏、历史失败案例等维度对 Actor 提案进行批评与精炼
  • Online Agent 自动生成实验代码并调度 A/B 测试,收集线上指标反馈至 Agent Memory 形成闭环

关键结果

  • 在预排序阶段 Value-Based Retrieval 任务中,engagement metric 1/2 分别提升 0.75%/0.90%,diversity 提升 0.48%
  • 在排序阶段 Value Fusion 任务中,engagement metric 1/2 分别提升 0.62%/0.19%
  • 在重排序阶段 Diversity 任务中,diversity metric 显著提升 3.43%,同时 engagement metric 1/2 也分别提升 0.21%/0.29%
  • 模型消融显示 Gemini 3 Pro 在多样性任务上表现最优(3.43% vs Flash 的 1.69%),表明大模型推理能力对复杂优化至关重要
  • 策略消融表明 Actor-Critic 架构相比单 Agent 在 Value-Based Retrieval 任务中 engagement 提升翻倍(0.75% vs 0.29%)

局限与风险

  • 依赖高质量的历史实验日志与结构化技能定义,冷启动阶段需人工初始化 Skillhub
  • A/B 测试周期长,每次迭代需等待统计显著性结果,影响优化速度
  • 未公开具体参数搜索空间定义方式与多样性距离计算细节,复现需额外工程实现
  • 当前仅验证于 Google Discover 场景,跨域泛化能力待进一步验证

适合沉淀的概念

multi-agent-system, self-evolving-skillhub, actor-critic-architecture, recommendation-system-optimization, online-ab-testing, agent-memory, compositional-optimization, llm-powered-automl

阅读注意

  • 重点关注第 4.3 节 Agent Memory 的更新机制,特别是多样性最大化与模式学习如何避免局部最优
  • 注意 Skillhub 的动态演化过程(4.4 节):Insight Agent 提取模式 → Skill Agent 更新 Domain Knowledge 与 Task Requirements
  • Table 1-3 展示了不同维度(任务、模型、策略)的消融结果,是验证框架有效性的核心证据
  • 公式 (1) 定义了多目标组合优化问题,明确系统成本约束与 North Star 指标最大化目标
  • Figure 1 和 Figure 2 提供了整体工作流与 Actor Prompt 结构,有助于理解信息流动路径

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.26969.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置与量化结果,包含消融研究,且明确说明部署于 Google Discover 生产环境。虽部分实现细节未完全公开(如距离函数、剪枝阈值),但核心机制与验证充分,具备可复现基础。