![]()
公司情报专家《财经涂鸦》获悉,9月12日上午2026 Inclusion·外滩大会上,以“Agent Post-Training:智能本质与下一个 Scaling Law”为主题的见解论坛正式举行。
论坛围绕智能体后训练的算法、环境、基础设施及自我进化等议题展开交流,邀请到模型研发与Agent领域的研究者、产业实践者,共同探讨智能体能力发展的关键问题。
在《Agent后训练的产业化全景:让模型走出实验室》演讲中,蚂蚁百灵大模型负责人周俊指出,大模型的真实任务并不限于编程,还包括医疗、金融、法律等领域的大量专业工作。蚂蚁百灵3.0(Ling-3.0)希望构建的,是一套能够在可控成本下持续发展专业能力、服务真实任务的基础模型体系。
围绕真实任务,周俊提出高质效、可专业化与可信执行三个关键词。
其中,高质效需要综合考察任务质量、成本、等待时间与成功率;可专业化意味着模型不仅要掌握行业知识,还要理解专业语境、使用专业工具,并遵循工作流程;可信执行则要求模型能够及时发现问题、限制错误影响,在证据不足、风险过高或权限不够时主动请求人工接手。
“一个好的agent,他不是知道下一步应该做什么,他更加重要的是知道下一步哪些不能擅自去做。”周俊强调,现阶段的目标并非假设模型不会犯错,而是建立能够识别风险、明确边界的执行体系。
在医疗领域,团队关注模型能否识别缺失信息、开展循证检索,并审慎表达判断中的不确定性。在金融投研领域,模型则需要完成资料检索、多文档分析、计算建模与报告生成,同时说明数据来源、统一统计口径、区分事实与假设,使输出能够追溯和复核。专业化的重点,因此从补充知识进一步延伸到了理解和执行专业工作流。
周俊同时指出,场景不会自动转化为模型能力。
“真正重要的是从实际使用中沉淀可复盘的失败案例、更符合专业要求的评测体系,以及可交互的训练环境,再将这些积累用于改进模型。真实场景既是检验能力的考场,也是推动能力发展的训练场。”他总结道。
现场,上海交通大学人工智能学院副教授、美国卡内基梅隆大学博士陈思衡亦针对递归自演进进行分享。
他认为,实现有效迭代需要兼顾四个条件:能够较快获得验证反馈,任务难度足以持续牵引能力提升,任务足够多样以支持泛化,以及数据与探索能够规模化。前沿科学研究涵盖多个学科,持续产生高难度问题,并具有验证与证伪机制,因此被团队选作探索这一方向的重要场景。
此前,其团队围绕科研智能体、机器学习任务及仿真环境中的模型训练开展了多项工作,其中一项重点是通过上下文与记忆调度,让智能体在长时间、反复迭代的研究过程中持续作出有效决策。
“但从进一步提升能力的角度看,系统、模型、基础设施和数据都可以成为自演进的对象。对于资源有限的研究组织,高价值专业场景中的数据迭代,是一条值得投入的路径。”他指出。
这一路径的难点在于,越接近前沿的专业问题,能够参与出题、解题和评估的人越少。对此,团队搭建起包含知识库、代码库、数据库和计算工具的科研环境,让智能体在其中探索,再将研究过程提炼为可用于训练的数据。由此形成“智能体—环境—数据—模型”的循环:更好的研究轨迹用于训练更强的模型,新模型再支持下一轮探索。
现场,陈思衡展示了团队基于35B模型开展后训练的结果。据其介绍,模型在Frontier Science评测上的得分从基础模型的1.7分,提高至5月版本的31.7分,并在7月版本中达到46.2分。团队还在机器学习、论文复现和生物信息学等任务中进行了评估,并观察到部分能力向搜索、代码等更通用任务迁移的现象。
对于当前进展,陈思衡也明确指出,现有体系仍将人类知识和规则预先沉淀在数据管线之中,属于较为有限的自动化与自演进。如何进一步减少对人工设计的依赖,提高递归迭代的效率,仍是后续研究需要推进的问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.