Meta 最近发布了一篇新论文,介绍了一个叫 CORAL 的系统。它最特别的地方在于:推荐系统在运行过程中,不需要更新任何参数,却能持续变聪明。
这听起来有点反常识。传统推荐系统要优化,通常得重新训练模型、调整权重。但 CORAL 走的是另一条路——它更像一个“调度员”,在后台观察线上系统的实时表现,然后想办法调整策略。
![]()
它具体是怎么运作的?
CORAL 的核心是一个基于大语言模型(LLM)的智能体框架。它主要做三件事:
- 闭环观察:持续监控线上推荐系统的运行信号,了解当前状态。
- 回溯记忆:翻看过去做过的决策,分析哪些有效、哪些无效。
- 调用工具:必要时会调用数值优化器等工具,辅助计算和判断。
这三步循环往复,CORAL 就能在固定的“变更预算”内,不断调整线上推荐系统的配置。这里的“变更预算”可以理解为允许调整的次数或幅度限制。
循环迭代,策略自动进化
关键在于,每一次循环结束,CORAL 的策略都会比上一次更优。它不需要动模型内部的参数,只是通过改变外部策略来提升整体效果。这种“外挂式”的优化思路,让推荐系统在保持模型稳定的同时,还能持续适应环境变化。
对于生产环境来说,这或许意味着一种更轻量、更灵活的优化方式——不用频繁重训模型,也能让系统保持“在线进化”的状态。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.