Meta发布了一篇新论文,介绍了一个名为CORAL的LLM原生agent harness(智能体框架)。它做的事情有点反直觉:在不更新任何模型参数的情况下,持续改进线上推荐系统的表现。
传统推荐系统的优化,往往依赖重新训练模型或调整参数。CORAL的思路完全不同——它把优化过程变成了一个闭环循环。
![]()
闭环里发生了什么?
CORAL的核心动作有三个:
- 观察:闭环监控线上推荐系统的运行信号
- 回溯:回顾过往的决策记忆,作为当前判断的依据
- 调用工具:使用数值优化器等工具辅助决策
在固定的变更预算内,CORAL会持续对线上系统进行重新配置。每一轮循环结束,策略本身就会随着迭代而改进——但模型参数始终没动。
这意味着,优化逻辑被从参数更新中剥离出来,交给了LLM智能体去动态执行。对于生产环境来说,这种方式的成本结构和迭代速度,可能和传统路径很不一样。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.