用33美元和约800万token,AI编程智能体在浏览器里重建了旧金山的联合广场。这不是简单的代码生成实验——PhiloLabs想测试的是,当"能跑"不再是唯一标准时,AI智能体到底能做到什么程度。
实验的结果相当惊人。两个小时内,Claude Fable 5.1智能体完成了一个可运行的Three.js版本联合广场,包含453个建筑轮廓、75个定制立面、129个具名店面,以及220个行人和109辆行驶中的车辆,连鲍威尔街的缆车都还原了。
![]()
但"能跑"和"看起来对"是两回事
PhiloLabs的特别之处在于,他们没有满足于"程序能运行"。团队把Playwright放进了开发流程,让智能体自己检查视觉效果——那些传统自动化测试根本发现不了的问题。
具体做法是:智能体在34个预设相机位置截图,然后和真实联合广场的照片逐一对比。整个过程产出了147张对比图,专门用来揪出"技术上正确但视觉上不对劲"的细节。
比如,建筑位置对了但比例不对,或者店面跑到了街道错误的一侧。固定相机位置还有个额外好处——每次迭代后,哪里变了、哪里没变,一目了然。
让AI智能体互相审查
PhiloLabs还安排了专门的审查智能体来检查这些材料。有的负责建筑和地理,有的负责技术美术和交互,这些审查结果成了下一轮迭代的整改清单。开发智能体根据审查意见修改后,重新运行场景。这种分工之所以必要,是因为并非所有错误都能转化成测试用例——你可以写测试检查建筑坐标是否正确,但很难写一个测试来判断"这条街看起来到底像不像联合广场"。
数据缺口才是真正的挑战
智能体并不是在复刻一个现成的3D模型。它们需要从零开始,整合开放地理数据(主要是OpenStreetMap和USGS高程数据)以及真实地点的信息,再把这些全部转化成能在浏览器里运行的几何体、立面和物体。
原始数据里依然存在大量空白需要填补——这正是实验最有价值的部分:当数据不完整时,AI智能体会如何做出判断,又会犯下哪些人类工程师一眼就能看出的错误?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.