推荐系统优化天然适合 MLE Agent,但直接应用通用 MLE Agent 存在一个关键的系统挑战:每个候选修改都需要代码生成、执行、训练和验证,
每一次试验都消耗不可忽略的预算。更重要的是,推荐模型优化不是一组独立的单次实验,而是一个持续的模型迭代过程,每次试验都提供超越最终验证分数的优化相关证据(收敛行为、训练稳定性、暴露的失败模式)。如果让 LLM 同时负责
选择修改方向和
生成具体假设,往往会导致在有限实验预算下搜索不稳定
“RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems” 论文笔记
未经允许不得转载:小狮博客 » “RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems” 论文笔记
小狮博客