提示词优化通常被认为是个"笨功夫"——要维护多个候选版本,反复搜索对比。普渡大学的一篇新论文却给出了一个更轻巧的答案:只保留一条提示词谱系,让教师模型根据近期轨迹和奖励迭代修改,效果就能匹敌复杂的多候选搜索方法。
这个方法叫NPO(Naive Prompt Optimization,朴素提示词优化)。它的核心思路很直接:不搞复杂的Pareto选择,不维护多候选池,就靠一条提示词不断迭代,由教师模型根据最近的rollout轨迹和奖励反馈来修改。
![]()
在IFBench和HotpotQA两个基准上,NPO用更少的rollout就达到了与GEPA相当或更好的结果:3,500次对比3,593次,6,800次对比6,871次。也就是说,更少的尝试次数,拿到了不输甚至更好的成绩。
这个结果对开发者来说是个好消息——提示词调优的门槛可能比想象中低。复杂的搜索策略未必是必需品,一条清晰的迭代路径加上有效的教师反馈,或许就够用了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.