---
title: "AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization"
title_zh: "AgenticRecTune：基于自演进技能中心的多智能体推荐系统优化框架"
arxiv_id: "2604.26969"
paper_type: "system"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.26969.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# AgenticRecTune：基于自演进技能中心的多智能体推荐系统优化框架

## 一句话定位

提出 AgenticRecTune，一个由五个专用 LLM 智能体（Actor、Critic、Insight、Skill、Online）构成的端到端推荐系统配置优化框架，通过自演进 Skillhub 和在线 A/B 测试实现多阶段系统参数自动化调优。

## 小学生也能听懂

这篇论文就像让五个聪明的小机器人一起帮推荐系统自动调参数：一个出主意，一个挑毛病，一个做实验，一个学经验，一个记好办法，它们不断试错、学习，让推荐更准更有趣，在真实系统里效果明显变好了。

## 为什么值得记录

- 解决了工业级推荐系统中多阶段配置优化的可扩展性问题，传统手动调参难以应对高维非可微参数空间
- 引入自演进 Skillhub 机制，将历史实验数据转化为可执行领域知识，实现系统持续自我改进
- 通过 Actor-Critic 架构提升候选配置质量，结合 Online Agent 直接优化真实线上多目标指标（如 engagement、diversity）
- 在 Google Discover 生产环境中验证有效性，多个任务实现统计显著的线上指标提升

## 核心方法

- 构建五智能体协同架构：Actor 提出配置候选，Critic 过滤次优方案，Online 执行 A/B 测试，Insight 分析历史数据，Skill 更新技能库
- 设计结构化任务提示（Task Prompt），融合当前配置、领域知识、历史 elite 候选和约束条件，指导 LLM 推理
- 实现 Agent Memory 模块，支持配置候选的写入、读取、剪枝与多样性最大化，保留 Pareto 前沿上的 elite 解
- 提出自演进 Skillhub：Insight Agent 通过自学习与跨任务学习提取敏感参数与成功模式，Skill Agent 动态更新技能中的搜索空间与领域知识
- 采用 Actor-Critic 策略增强稳定性，Critic 基于格式、护栏、历史失败案例等维度对 Actor 提案进行批评与精炼
- Online Agent 自动生成实验代码并调度 A/B 测试，收集线上指标反馈至 Agent Memory 形成闭环

## 关键结果

- 在预排序阶段 Value-Based Retrieval 任务中，engagement metric 1/2 分别提升 0.75%/0.90%，diversity 提升 0.48%
- 在排序阶段 Value Fusion 任务中，engagement metric 1/2 分别提升 0.62%/0.19%
- 在重排序阶段 Diversity 任务中，diversity metric 显著提升 3.43%，同时 engagement metric 1/2 也分别提升 0.21%/0.29%
- 模型消融显示 Gemini 3 Pro 在多样性任务上表现最优（3.43% vs Flash 的 1.69%），表明大模型推理能力对复杂优化至关重要
- 策略消融表明 Actor-Critic 架构相比单 Agent 在 Value-Based Retrieval 任务中 engagement 提升翻倍（0.75% vs 0.29%）

## 局限与风险

- 依赖高质量的历史实验日志与结构化技能定义，冷启动阶段需人工初始化 Skillhub
- A/B 测试周期长，每次迭代需等待统计显著性结果，影响优化速度
- 未公开具体参数搜索空间定义方式与多样性距离计算细节，复现需额外工程实现
- 当前仅验证于 Google Discover 场景，跨域泛化能力待进一步验证

## 适合沉淀的概念

`multi-agent-system`, `self-evolving-skillhub`, `actor-critic-architecture`, `recommendation-system-optimization`, `online-ab-testing`, `agent-memory`, `compositional-optimization`, `llm-powered-automl`

## 阅读注意

- 重点关注第 4.3 节 Agent Memory 的更新机制，特别是多样性最大化与模式学习如何避免局部最优
- 注意 Skillhub 的动态演化过程（4.4 节）：Insight Agent 提取模式 → Skill Agent 更新 Domain Knowledge 与 Task Requirements
- Table 1-3 展示了不同维度（任务、模型、策略）的消融结果，是验证框架有效性的核心证据
- 公式 (1) 定义了多目标组合优化问题，明确系统成本约束与 North Star 指标最大化目标
- Figure 1 和 Figure 2 提供了整体工作流与 Actor Prompt 结构，有助于理解信息流动路径

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.26969.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置与量化结果，包含消融研究，且明确说明部署于 Google Discover 生产环境。虽部分实现细节未完全公开（如距离函数、剪枝阈值），但核心机制与验证充分，具备可复现基础。
