2026云栖大会的会场外停了八辆车,来自腾势、神行者、红旗、智己、MG等不同品牌。其中一辆是首款搭载高通骁龙8397平台与斑马智能AutoOmni的量产车,它的智能座舱模型跑在车规芯片上,而不是云端。
这辆车旁边,是一场名为「原生智能·端上生长」的论坛。当Agent Native成为AI的新主流叙事,产业焦点正从云侧AI基础设施转向端侧。云端决定AI有多强,端侧决定它敢不敢接管真实世界。
![]()
渗透率七成,付费率不足一成
先看两组数据。按工信部披露的数据,2026年上半年具备L2级组合驾驶辅助功能的乘用车新车渗透率达到70.5%,具备领航辅助(NOA)能力的车型装车率超过三成。硬件层面的普及已经基本完成。
但另一组数据是另一回事。据多家行业调研数据,国内高阶智驾的付费订阅与买断整体渗透率不足10%,多数自主品牌自研智驾的付费激活率不足30%,而在20万元级以下的走量家用车型上,付费率甚至低于2%。
麦肯锡《2026中国汽车消费者洞察》显示,约八成受访者将城市NOA视为购车时的重要选项;另有罗兰贝格等多家调研机构的结果显示,多数用户认为核心智驾与座舱的基础功能应当免费标配。用户认可这项能力的价值,但不认为它应该被单独收费。
斑马智能首席战略官邢悦这样解释智驾软件付费转化偏低的原因:「核心原因在于,行业尚未形成真正的超级智能体交互范式。」
座舱侧也有同样的落差。据斑马智能提供的数据,从2024年中启动全面AI转型至今,该公司对主流车企的服务覆盖率达到68%,在端侧智能与端模型应用领域的市场份额为63%。但装机不等于使用。
斑马智能首席产品官蔡明的判断是:「AI上车不是终点,更是一个更重要问题的起点:用户的深度使用。」他认为,深度使用的核心在于基于意图驱动、AI真正懂「我的世界」,这就需要在端侧发生一场交互范式变革,需要以用户为中心的跨端上下文和记忆连通。
端侧的三堵墙
把端侧理解为「云端模型的缩小版」,是这个领域最常见的误解。端侧的约束不是尺寸,而是三堵墙。
- 内存墙:车规级芯片的运行内存远低于服务器,且要和座舱系统的其他进程共享。一个模型能不能跑起来,往往不取决于算力峰值,而取决于权重能否驻留。
- 时延墙:座舱交互的容忍度以百毫秒计,主动安全类的提醒更短。云端往返的网络抖动可能吃掉全部预算。
- 并发墙:真实的座舱不是单任务环境,语音、视觉、车控、导航、音乐往往同时在线,模型需要在多路任务下保持稳定,而不是在单任务benchmark上刷高分。
这三堵墙之外,还有两项来自产业的约束。隐私方面,座舱内的语音、图像、位置属于高敏数据,全量上云在多数市场已不可行。斑马智能首席技术官司罗判断:「车是一个非常重要的半封闭的场景,需要保护隐私的场景。」
成本方面,Agent时代的token消耗是持续性支出,全部由云端承担意味着车企要为每一辆在用车支付长期账单。司罗认为,车主和OEM厂商在车本身的芯片能力上已经花了很大成本,端模型的价值就是把这部分已付出的硬件价值释放出来,「把端上的能力变成我们真正的端上的token工厂」,从而大规模降低传上云的流量与云端token消耗。
顺着这两项约束,司罗给出了三个趋势判断:端AI随着端侧算力与资源的快速提升进入快速发展期,且端上做的不是云端能力的简单迁移,而是差异化能力;云侧AI从级联式的小模型链路全面转向大模型驱动,端云一体的整体架构从2026年开始出现、之后会成为主流;舱驾融合加快落地,2026年以两个系统互相调用的形态出现,之后走向模型层面的融合。
稀疏化:把大模型塞进芯片的解法
内存墙的存在,使得稀疏架构在端侧的意义比在云端更重要。在云端,MoE解决的主要是训练与推理的经济性问题,即用更少的激活参数换取更大的总参数容量。在端侧,这件事的性质大不一样,它决定的是一个模型能否被放进芯片。
总参数决定能力上限,激活参数决定单次推理的内存与算力开销,二者解耦之后,端侧才有机会在有限的物理资源上获得接近中大型模型的能力。斑马智能的AutoOmni走的正是这条路线。
司罗在演讲中把端模型的竞争要素概括为四句话:「首先基模是支柱,同时量化与部署在端上是壁垒,系统是围栏,能够有差异化的场景是非常重要的特色。」四个词各指一层:基础模型决定能力上限,量化与部署决定能不能真的装进车里,系统决定它的行为边界,场景决定它值不值得用。在端侧,第二和第三层才是真正的分水岭。
在工程指标上,斑马智能这套端侧方案可概括为多、快、好、省四项:多指8路以上多任务稳定并发,快指大模型推理提速5至6倍,好指99%以上的量化保真度,省指运行内存占用减少50%。
这四项里,最能说明端侧工程性质的是后两项。量化是端侧部署的必经之路,但激进量化会以精度损失为代价,保真度指标衡量的正是「压缩之后还剩多少」;内存占用减半则直接决定了模型能否与座舱其他进程共存。
在此之前,斑马的端侧主力是4B的稠密模型。据司罗介绍,相比通用领域的大模型,AutoOmni-4B在智能座舱的全场景平均能力提升达到20%,其中座舱文本(车控、导航、娱乐等)的理解提升22%,视觉相关的场景理解提升17%,音频尤其是情绪与语音理解的提升更大,达122%,同时在通用领域的能力与头部通用大模型保持一致。
端模型的天花板在哪
4B能做的事已经不少。现场放出的实车视频里,它完成了多意图与跨意图的连续车控,也通过手车互联直接操作了微信、读取并转述消息。但司罗把一个更关键的问题摆了出来:端模型的天花板在什么地方?是不是能够接近云侧大模型的能力?
这正是AutoOmni 2.0-23B-A3B要回答的。按他给出的口径,这个激活3B的MoE端模型在智能座舱场景下,普通任务基本相当于10倍参数量的云侧模型,复杂任务的处理能力相当于10倍参数量云模型的80%到90%之间。
现场播放的实车视频里,一条连续指令包含调整座椅位置、打开前排按摩、开启全车通风三个动作;随后的导航任务则经历了「去王总公司」「去之前先把王总的儿子和女儿接上」「在附近找一个加油站并添加为途经点」的多轮追加与重规划。
比数字更有说服力的是司罗对迭代速度的一段自述:「就在一个月前、三周前,当时我第一次来评测我们自己模型的能力的时候,差距是非常非常大的,我当时一个判断是在一季度内我们不可能做展示。但是就在短短的几周之内,通过我们快速的迭代以及能力的提升,已经提升到在很大程度上接近云侧模型。」
一位CTO在发布现场承认三周前自己还判断「不可能展示」,这句话透露的信息量不小:端模型能力提升速度,比从业者自己的预期还快。
支撑这套能力落地的是大算力芯片适配。据介绍,斑马智能已经合作包括高通、英伟达、紫光展锐、小鹏图灵在内的十家芯片厂商;这条路径始于2025年云栖大会与高通联合发布的8397首个座舱AI端侧方案,到2026年已有多个量产车型落地。
大脑与小脑的分工
端侧变强不等于云端退场。真正的架构问题是分工。斑马智能的分工方式是把理解与执行分开:AutoOmni承担多模态理解与规划,相当于大脑;AutoClaw、System Agent与Harness承担意图拆解、任务路由与受控执行,相当于小脑。
司罗说明了这套框架的职责:以端侧模型为底座的端云一体框架,除了模型能力与上层的Harness Engineering框架能力之外,还要统一安排什么样的任务放在云上、什么样的任务放在端上,以及数据如何分配,比如哪些隐私数据必须留在端上,哪些记忆数据可以经过总结之后放到云上。
端云协同由此变成两个能实际解决的问题:任务按什么标准切分?数据按什么标准留存?
在此之下,端上的Agent Group按领域拆成导航、媒体、主动视觉、GUI等分支,由SystemAgent统一负责分域与拒识、主动参与、记忆信号提取,以及端云后仲裁——端侧与云侧各自给出结果,再由系统裁决采信哪一个。记忆则单独成层,通过Memory接口完成实时信息提取、个人信息注册与记忆增强,底下用SQLite与RAG落地存储。
拒识这一项,现场的demo给了一个很直观的注脚。视频里两位乘客正在聊天,车机始终在听,却不作声;直到其中一人说出「外面太吵了,可以把车窗关上吧」,它才响应。司罗在旁解释:「它可以分辨什么时候是人人对话,什么时候是人机对话。」全车全时免唤醒的难点其实不在「听得见」,而在「知道什么时候不该应答」。
而端侧记忆走SQLite与RAG则是蔡明所说的「我的世界」在实现层的落点:愿景是让AI懂每个用户,代码层面就是一张本地数据库加一套检索。按司罗给出的数字,斑马目前已与合作伙伴一起搭建了数十个主动智能场景,能力概括为「长聆听、长观察、善记忆」。
云端的角色则是知识与复杂推理。蔡明把这套端云一体架构概括为三个连通:「首先是端上和云上的算力和服务的连通,这是元神AI的主体;第二,实现了围绕着用户的各个智能终端的连通,所有的数据和场景被打通,AI能够真正完整地理解我的世界;第三个,实现了用户与服务的连通,围绕用户所有服务都可以完全实现跨场景、跨端、跨APP的整合与联动。」
把执行框架推到智驾侧
座舱之外,斑马把同一套思路延伸到了智能驾驶。据介绍,公司正与头部智驾厂商合作,第一阶段是用座舱的自然语言理解与规划能力,去调用智驾系统提供的API接口,以此实现更好的出行体验;第二阶段则是更深的耦合,座舱与智驾在模型层面融合。
按其技术方案的描述,这条链路从传感器输入与用户需求出发,先经过一道由规则加提示词构成的安全边界,再通过工具和协议去调用自动驾驶能力,智驾方案商把能力封装成activate_noa(destination)、lane_change(direction)这类函数交给座舱侧调用。到了第二阶段,座舱大模型的VLM/VLA识别与推理结果将直接影响智驾行为,用于增强场景理解与规划、协助处理长尾场景。
这套设计里最值得注意的是那道安全边界被单独画成了一个环节。模型负责理解「离前面那辆货车远一点」,而系统负责保证这个理解不会变成一次危险的变道。
端侧要把模型部署到车上,也会带来两个问题。一道对内:模型拿到执行权之后,系统能不能管住它?一道对外:这套东西能不能被第三方认可,从而进入不同的市场?前者决定AI在车里敢做多少事,后者决定这辆车能开到哪里去。用司罗的话说,「随着端能力的出现,端安全变成了一个新兴的至关重要的功能」。
「数据不出车」是端侧最常被引用的安全论据,但它只回答了数据去哪儿的问题,没有回答模型在车内做什么的问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.