日前,阿里国际站在面向创业者及小企业的年度活动CoCreate上,公布旗下商用AI代理平台Accio的107项任务基准测试结果。数据显示,Accio完成全量电商任务的预估总成本为3.69美元,同期OpenAI Codex为9.27美元,Anthropic Claude Code为9.51美元,Accio成本较两者均低超50%,任务完成质量相当,是目前面向中小商家成本竞争力最强的电商AI工具。
阿里国际站总裁张阔称,对小企业来说负担不起的AI毫无用处,团队目标不是单纯提升AI性能,是让商用AI哪怕对单人公司也足够实用可负担。
据介绍,Accio的效率来源于针对真实商业场景的全系统优化。平台依托电商专属数据及工作流对轻量模型做针对性后训练,适配明确细分的任务,小型模型可高效处理常规工作,需要深度推理时再调用能力更强的模型。Accio不会单纯选择最便宜的模型,也不会默认调用最强模型,而是将复杂需求拆解为可执行步骤,为每个步骤平衡质量速度成本及数据要求,让商家无需为不需要的算力资源付费。缓存复用、上下文压缩及代理协同执行机制,还可减少重复处理、不必要的工具调用及冗余token消耗。
此次活动上,阿里国际站同时推出升级后的Accio,整合调研寻源及日常电商运营功能,形成面向小企业的统一AI工作空间。商家可通过Accio完成市场调研、产品机会识别、产品开发、供应商评估及日常运营管理,平台已打通亚马逊、Shopify、eBay、TikTok Shop、沃尔玛等渠道,商家可在同一界面完成上述平台支持的店铺操作。
另外,阿里国际站已在GitHub开源Commerce Agent Bench测试集。该测试集未采用合成训练题,而是从1000万活跃中小商家、160万次对话及20万条执行轨迹的真实商家行为中,提炼出覆盖7大类、4个自主等级的107项端到端电商任务,具体包括审阅数百封非结构化邮件、识别支付欺诈、计算落地成本、预订多承运人运输路线等。本次测试结果显示,没有任何单一模型可在全品类任务中保持领先,进一步印证任务层级路由的合理性,即不同任务由不同AI模型处理效果最优,无需依赖单一通用模型完成全部工作。
本文首发于 亿邦动力 官方网站
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.