![]()
九月的手机圈成了全年最激烈的战场,今年 AI 手机悄悄站上了 C 位。有人把 Agent 做进操作系统,有人试图将小程序和服务封装成可调用的能力,也有人干脆从硬件开始,为 Agent 重新设计入口。
刚刚结束的苹果发布会上,新任 CEO 特努斯给 iPhone 提出了一个新的定位:智能个人中枢(Intelligent Personal Hub)。
![]()
在他的设想里,理想的 AI 设备要随时陪伴用户,理解日程、人际关系和日常习惯,能看见、听见周围的世界,也能与其他设备、App 和服务协同。
过去十多年,手机把越来越多的工具装进口袋,却把组织这些工具的工作留给了人。现在 AI 手机正在尝试接手这部分工作。
今天,豆包手机助手消费者版也正式发布了。
我们之前评测豆包手机技术预览版的时候,认为它把我的手机「变薄」了。
那会儿最让我惊喜,是它真能替我横跨不同应用操作,能钻进一个几百条消息的群里,把文件挨个下载、分类、打包,再发给同事。那种感觉,像是手机第一次自己长出了手。
这次的豆包手机助手消费者版,「操作手机」能力继续以 Beta 版保留,并存在一定能力限制。同时新增了一枚独立 AI 键,可以更快调用各种操作。
![]()
另一项重要升级是个人 Context 和记忆能力。豆包手机可以在获得授权后获得手机更多的信息,你也可以通过语音、按键、手势和截图,随时把觉得有用的信息保存到记忆,这些上下文最终会让 Agent 在行动前更懂你。
![]()
如果说,技术预览版展示了 AI 操作手机的想象空间,消费者版本要回答的,则是普通人是否愿意每天使用它。
所以这次爱范儿拿到豆包手机助手消费者版,并没急着去挑战它能做多难的任务,我更想知道的,它到底能不能真的每天帮我把事办成?
AI 键不新鲜,但按下之后不一样了
先说侧面新增的那颗 AI 键。
长按 AI 键可以直接唤起豆包助手,双击则进入实时视频对话;即使手机停留在锁屏界面,用户也可以直接向豆包询问天气等通用信息。涉及敏感操作时,这颗按键还可以结合指纹验证,确认手机是否获得了继续执行的授权。
![]()
为 AI 增加实体按键,本身已经不是什么新鲜设计。过去几年,不少手机都将电源键、侧边键或独立按键与 AI 功能绑定。它们通常负责打开语音助手、启动识屏、进入相机,或者唤起一个集合了各种 AI 功能的页面。
但这台手机并不是又为 AI 腾出了一个物理位置,它按键背后连接的对象变了。
![]()
你可以按下它问一个问题,也可以交代一项需要继续执行的任务,豆包手机助手可以调用日历、文件、录音和已接入的第三方服务,并在后台继续工作,不打扰你当前使用手机处理其他事情。
也就是说,这个 AI 键不只是打开豆包的快捷键,它试图启动一次行动,并承担着 Agent 与用户之间的权力交接:按下时,用户交出目标,并决定手机可以替自己走到哪一步。
传统语音助手经常要求用户重新描述屏幕内容,或者先截图,再上传给 AI。
豆包手机助手的 AI 键省掉了这些步骤。按下之后,当前屏幕会直接成为模型理解问题的上下文。
我在在社交媒体刷到一只狗,直接问:
这是什么狗,适合新手养吗?
![]()
豆包会识别犬种,并结合运动量、性格、掉毛情况和饲养难度给出建议,全程不用退出应用。
打开《Attention Is All You Need》后,我又让它总结论文。豆包手机助手可以识别当前屏幕中的论文内容,并结合屏幕信息提炼 Transformer、自注意力机制等核心概念,无需手动复制文字或切换应用。
![]()
面对唐国强饰演的诸葛亮,我问它演员和角色信息。豆包不仅识别出唐国强和诸葛亮,还找到了「秋风五丈原」这一具体场景。
![]()
相比简单识图,更有价值的能力是理解完整语境,将演员、角色、作品和剧情联系起来。用户看到什么,就可以直接围绕什么提问。
屏幕信息也可以直接变成任务输入。
比如我展示浴室墙面后询问:「我想装一个免打孔的洗漱用品置物架,这面墙大概有 30 厘米空隙,有没有防锈、极简的商品推荐?」
![]()
豆包会结合墙面环境、空间尺寸和材质要求筛选商品。过去需要测量、搜索和反复查看详情的过程,现在可以从眼前的真实环境直接开始,它也能直接给出一些商品购买链接。
这颗 AI 键想做的,其实是让发起任务的起点更低,一切都是为下面这些体验做准备。
手机自己干活,不只看能调用多少 App
操作手机 Beta 版依然是豆包手机助手最有辨识度的能力。
![]()
爱范儿实测后,发现日常的生活和飞书等办公场景的应用基本都能满足,涉及支付、隐私和不可逆操作也会要求用户接管确认。
这次豆包手机助手对于第三方应用的操作,有了明确的规范,他们发布了面向第三方应用接入的屏幕自动化操作声明协议 SAEP(Screen Automation Execution Protocol),并同步启动为期 30 天的规则公示。
按照这套协议,第三方应用可以自主声明 AI 在应用内的操作边界,明确允许或拒绝 AI 助手进行屏幕自动化操作。豆包手机助手方面表示,会尊重开发者的选择,对于明确拒绝相关操作的第三方应用,不会进行自动化操作。
某种程度上,这也给「操作手机」补上了另一层权限关系。用户决定 AI 能替自己做到哪一步,开发者则决定 AI 能不能进入自己的应用、能够操作到什么程度。
AI 调用 App 到今天其实已经不是技术问题,豆包手机助手的意图理解能力经过半年多的升级,我发现它对需求理解比之前的技术预览版更准确,执行的成功率也有了明显提升。
比如我甚至可以一次给把几个任务同时抛给它,提示词如下:
把手机调成静音模式,然后设一个 3 点的闹钟提醒我开会。另外,帮我查一下未来 3 天的天气,然后在每天早上 7 点钟出门前给我一个提示。
![]()
这里涉及四个待办事项,需要调用不同的应用和工具,它花了一分钟也全搞定了。
再上点难度,WAIC 期间我一天要参加多个活动,我直接让它找相册里的邀请函,把行程添加到日历,根据天气路况规划行程,再给我整理下活动背景方便现场交流。
![]()
这个任务确实有点复杂,它花了 17 分钟才完成,但中间我基本不用管它,真能拿它当贴身助理用了,这效率可能比请一个真秘书还要高。
个人 AI 终端,始于 AI 真正记住你
AI 助手长期面临一个问题:每次打开,都像第一次见面。用户负责什么项目、常去哪里、老板偏好什么汇报结构、上周和客户谈过什么,往往需要重新说明。
豆包手机助手的记忆能力,试图把这些零散对话连接起来。
它能记住和找回两类信息。一类是手机中已有的数据。在用户授权后,豆包可以检索录音、联系人、相册、短信、便签和日历,用户无需记住文件名或日期,直接用自然语言描述即可。
![]()
另一类是用户主动保存的内容,比如地址、订单号、旅行攻略和商品信息。用户可以通过语音指令、同时按下 AI 键与音量键、三指上滑,或在截图后点击「记忆」完成保存。需要找回时,长按 AI 键、语音唤醒豆包,或进入豆包 App 直接提问即可。
长按 AI 键,说出或输入任务需求,即使是过去通常需要在 PC 端完成的办公任务,如信息检索、数据分析、内容生成和文件制作,现在也可以通过豆包手机助手完成。
用户还可以切换到豆包专业版的「工作任务」模式,获得更适合复杂办公场景的处理能力。
整个过程更像是集成到手机系统的 Codex,用户只负责描述目标,最终可以直接拿到 Word、Excel 或 PPT 文件。
我先设置了一项定时任务:「每天下午 5 点,检索国内大模型行业的最新融资和产品动态,过滤低价值内容,总结三条核心情报,导出 Word 简报存到手机里。」
![]()
任务包含定时执行、全网检索、信息筛选、内容提炼和文档导出。
再比如老板对我说,「以后做行业简报,开头先放三条核心结论,正文控制在五页以内,少用大段文字,数据来源放在最后一页。」
![]()
我顺手将其保存到记忆中,这样下一次我只需要说:「按照之前老板要求的格式,更新一份最新国内大模型行业简报。最终输出 word 文档」
![]()
![]()
![]()
豆包便可以调用此前保存的结构和偏好,再补充最新数据。记忆功能的价值,体现在用户少说了多少重复的话。当 AI 能理解「按照上次的方式」具体指代什么,它才更接近一个真正属于个人的助手。
再比如,我还让它制作了一份《2026 年国内露营经济发展趋势》分析 PPT,内容包括用户画像、品牌格局和商业模式预测,并直接输出 .pptx 文件。
![]()
评价这类能力时,文字质量只是一部分。数据是否可靠、结构是否清晰、文件能否编辑和继续修改,同样决定实际价值。
![]()
需要注意的是,「专家模式」和「工作任务」属于独立的任务模式。进入其中任一模式后,暂时无法同时使用「操作手机」及其他助手工具,需要退出当前模式后再调用。
使用一段时间,结合我的记忆处理一些本地的信息确实很丝滑。
我突然想找到之前一场发布会提到的模型参数和数据,直接让它从录音里找,马上就有了,比我去再搜一搜要更便捷。
![]()
而且有些采访录音或者个人信息可能只有在本地才收,比如之前去美国前要登记 EVUS,我让它从相册里找出我的护照美签页,把填写所需的资料的单独提取发我。
![]()
完了我还可以手动保存到记忆,下次出差也不用再从头找一遍了。
个人 AI 终端最大的价值,由这些连续的上下文构成。模型掌握的信息越完整,对用户意图和偏好的判断也会越准确,也开始接近一个了解长期工作和生活的个人助手。
当然,这种能力同时对隐私提出了更高要求。哪些本机信息可以调用、哪些个人偏好可以保存,豆包手机助手的记忆功能都建立在用户知情和主动授权的基础上,用户也能够查看、修改和删除已经保存的记忆。
真正的 AI 手机,应该是「行动终端」
过去十多年,智能手机几乎没有改变过核心的交互逻辑。
现在, Agent 开始改变人与计算机的分工。手机第一次有机会越过「提供工具」这条边界,开始代表用户行动。
Agent 改变的不只是输入方式。鼠标和触控让软件更容易操作,Agent 则开始承担从意图到结果之间的过程。
我们不妨将这样的新一代智能终端,称为:行动终端。
![]()
它不再要求用户先把一件事拆成若干步骤,再分别找到对应的软件;它可以理解目标,调用能力,安排顺序,在后台持续执行,并在真正需要用户决定的时候回来。
智能终端以功能(App)为中心,等待人去点击。行动终端则以任务为起点,先理解目标,让一项任务在锁屏、切换应用甚至网络中断之后继续存在。
在使用新版豆包手机过程中,我越来越感受到 Skill 正在成为新的 App。
这并不意味着 App 会消失。地图、支付、通信和办公软件依然存在,只是其中一部分能力会以 Skill 的形式进入 Agent 的工作流。
苹果前首席设计官 Jony Ive 在谈论 iOS 7 设计时曾说过:
真正的简洁,不只是去掉杂乱,而是为复杂建立秩序。(bringing order to complexity)
![]()
这个逻辑,同样适用于 Agent 时代下的行动终端。
AI 手机的简洁,并不是把 App 隐藏掉,也不是把所有入口缩成一个聊天框。真正的工作发生在界面之后:App 提供服务,Skill 提供行动,Agent 负责组合,操作系统管理权限、进度、异常和结果。
你看到的是一个任务完成,系统处理的是背后的全部复杂性。
行动还需要上下文,Skill 决定 Agent 能做什么,上下文决定此刻应该做什么,记忆则让下一次行动不必重新认识用户。日历、联系人、相册、录音、屏幕内容和过去的选择,共同构成一项任务真正发生的背景。
去年的豆包手机助手技术预览版最令人惊喜的,是 AI 像人一样理解屏幕、点击 App,它抹平了 App 与结果之间的路径,也让手机在体验上「变薄」了。
到了消费者版,更值得观察的,是这些行动能否被系统持续管理。一件事发起以后,还要知道它进行到了哪里,什么时候需要确认,遇到问题又该怎样继续。
![]()
后台执行、任务队列、任务中心和指纹确认等设计,让任务开始拥有自己的生命周期。锁屏、切换应用、临时去忙别的事,也随之成为评价 AI 手机体验时需要考虑的场景。
真正的后台能力,是让任务离开用户的视线,也不离开系统的管理。
它开始让手机按照 Agent 的方式工作,尝试把最多人使用的智能终端,变成「行动终端」。把语音、视觉、系统工具、个人信息和第三方服务,组织在同一件任务之下。
AI 手机的未来不是塞入越来越多的 AI 功能,行动终端真正的价值,是把这些分散的智能组织起来,对一件事从意图到结果的过程负责。
App 时代,系统保证软件能够运行;Agent 时代,系统需要确保事情能够完成。
豆包手机助手不一定是行动终端的最终形态,但它让我们看到了,当手机真正能够接管一件事,对过程保持负责,对边界保持克制,并把结果成功带回给用户——AI 手机才有可能真正开始成为智能手机在下一阶段的新终端。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.