9月24日消息,千里科技(AFARI)旗下AI研究团队 World Model Team 于2026年8月发布 BehaviorWorldGen 框架,首次系统解决了自动驾驶世界模拟器中“周围车辆不会真实反应”的结构性缺陷。该框架通过核心组件 BehaviorFlow 实现对周围车辆行为的可控生成,打通动作模型与世界模拟器的自改进闭环。该研究针对自动驾驶行业从“堆路测数据”转向“模拟器自训练闭环”的趋势,解决了闭环中的关键瓶颈。
据悉,自动驾驶动作模型的训练依赖世界模拟器生成未来场景数据。但现有模拟器存在两个根本缺陷。第一,周围车辆不反应。第二,长尾场景覆盖不足。论文指出,这解释了为什么稀有交互场景至今仍然难以学习。BehaviorFlow 是一种元动作条件的交通流模型,同时也是整个框架的核心,它为每个车辆注入可解释的帧级元动作作为显式行为控制手柄。注入后,周围车辆能对自车及其他车辆做出真实响应,实现多车交互一致性。同时可按需编排稀有交互场景,将动作模型表现最差的失败案例转化为针对性训练数据。框架以结构化轨迹为模块间接口。上游兼容各类动作模型,包括端到端规划器和VLA模型;下游对接生成式世界模型和3D高斯溅射重建式模拟器。
在关键数据方面,因果模型相比双向模型推理速度提升近70倍(0.3s/帧 vs 20s/帧),同时生成质量反而更优(FID 4.36 vs 6.72)。在三种不同架构的动作模型上均实现一致提升:ChainFlow-VLA 在 NAVSIM 基准上达到93.3 PDMS(较原始93.1提升0.2),为同类方法最高;ReCogDrive 从86.5提升至87.3;DiffusionDrive 从87.7提升至88.6。在最困难场景区间(PDMS<0.15),原模型接近崩溃(PDMS=0.0),加入 BehaviorWorldGen 生成数据后恢复至34.8,属于质变式恢复,远超常规微调幅度。
除核心的 BehaviorFlow 外,论文还展示了两项辅助技术能力。一是场景编辑能力,包括稀有物体插入、雾度连续控制、天气风格迁移、轨迹编辑。二是3D高斯溅射场景外推,团队用 BehaviorFlow 预测未来交通演化,用生成式世界模型合成多视图观测和LiDAR点云,追加到原始日志中联合重建,突破了重建式模拟器只能在原始观测区域内高质量渲染的空间边界限制。论文指出,LiDAR监督对于维持外推区域的几何可靠性至关重要。(韩蕾)
