实测最新版「豆包手机」助手:所有手机里的AI都该变成它这样
豆包手机助手消费者版正式发布,作者提前上手:侧面 AI 键按住说话,锁屏下就能让它在飞书发会议邀请、跨 App 剪一条 vlog。从原型机走向量产的这一步,把「一句话完成任务」变成了会下意识使用的交互习惯。

豆包手机助手消费者版今天正式发布。
搭配了它的手机长这个样子:

搭配了豆包手机助手消费者版的努比亚 NaviX Ultra 将在 9 月 16 日发布
和预览版相比,官方对这个助手的定位显然变化:这是一个面向量产,面向广大消费者的产品。也就是说,它不再只是一个原型机了。
在此前第一次亮相时,豆包手机助手引起了不小的波澜,它以 GUI 为主的技术路线给既有的一切都带来了新思路,让所有人开始思考模型越来越强后,手机会变成什么样,过往我们已经习以为常的以 App 为主的交互方式又会变成什么样。
所以当豆包的朋友找我说要不要提前体验下这个产品时,我立刻答应下来。我对它充满了好奇,和初代的实验属性不同,这个要真正量产,大规模提供给广大用户的产品,究竟做到了什么程度?
现在正式官宣之后,也终于能跟大家分享这段时间提前使用它的感受了。
01 万能对讲机
豆包手机助手消费者版和硬件做了很多融合设计,比如第一时间拿到这台机器,从外形来看,最明显的就是侧面的 AI 键。是的,你可以用它唤起豆包助手。

在我之后的各种使用里,这个 AI 键成了我和这台机器交互最主要的方式。
比如,当我让豆包自动去飞书发送会议邀请时,我的操作过程是,在锁屏状态按住 AI 键直接呼出豆包,语音告诉它去给我们的飞书群发一个会议邀请。

因为这个小小的 AI 按键配置了指纹识别功能,手机识别指纹后可以给豆包助手相关的更高权限。所以不需要屏幕解锁,只要是 AI 键识别了你的指纹,它就在后台开始一顿操作,然后很快就完成了任务。
后来我还顺便让它去看了看我飞书上昨日在内容部门等几个核心工作群里的记录,给了我一个待办列表。这些都是很多人日常工作的常态,而整个过程丝滑无感。
这种按住说话,然后事情就完成摆在你面前的感觉,的确改变了人们对手机的交互方式的预期。
而且在使用了一段时间,用这种方式处理了诸多类似任务后,它成了我下意识会去使用的交互方式。
任务解决的完成度越高,这种新交互“习惯”养成的顺滑度也越高,我不自觉的去按这个按钮的频率,可能真不亚于人们接受 iPhone“发明”的滑动触碰交互方式的速度。

这是个融入了硬件的 AI 交互。这不免让人想起当年苹果早早在 iPhone 17 的侧面就放了一个“快门”按键,为后来的苹果 Intelligence 先占了坑,然而后面的故事有点变成笑话。
我感觉人们眼里苹果本该给这个按钮打造的功能,应该就是豆包二代的这个样子。
这种按住说话的交互给我的感觉,像是我在拿着一个万能对讲机。
这会让人想不停探索这个对讲机能搞定的事情。
我也试了几个我一直想做的,“一句话完成各种 agent 任务”的能力。
比如,我直接通过语音,让豆包助手去自己操作手机,调用底层能力,跨 App 操作,完成了一个 vlog 剪辑工作。
我“口喷”的提示词(其实就是想到哪说哪)很简单:
把我相册里不超过 20 秒的视频,按照《午夜巴黎》开头的那个空镜的组合的方式去剪辑成一个 vlog, 保留视频本身的原声音,然后再配一个同样同款的 BGM。
以下是它给我的结果:
可以看到这个指令涉及多个复杂环节,它涉及对一部电影的某个含糊表达的具体部分的理解,涉及对我意图的判断,和对手机上可以调用的 App 的选择,以及,自动操作手机的能力。
而我暗中观察了它操作的过程,这些难点都一一顺滑实现。
这是个我一直想做,但因为我从来没用过剪映没怎么剪过视频,而一直没做的任务。现在,只要我手机里有这些素材,就真的能“张张嘴一句话”完成了。
这些体验下来,你很难不觉得这个手机就像一个从哆啦 A 梦兜子里拿出来的万能对讲机。
另外,在这个任务里,还可以看到豆包手机助手在 AI 层面不少核心设计思路。
豆包手机助手预览版最引人瞩目的就是自动操作手机的能力。但也是引起最多争议的能力。这一代在操作不同 App 的方法上,也引入了类似 MCP 的方式。基于软硬件结合的设计,豆包手机助手底层的打通程度更深,大模型可以调用电话、日历、闹钟、飞书等底层工具的能力来完成任务。
而自动操作手机的能力继续以 Beta 版的形态保留。当你在设置里打开,它可以在一些任务里通过模拟点击和调用工具的方式来帮你操作手机上的各类应用。操作可以在后台进行,不影响用户正常使用手机。
在这个任务里,可以看出它对手机本身的相册的底层调用,对 App 的 GUI 点击操作。这些能力目前主要会支持一方应用和字节系相关产品调用。
这也是外界最关注的能力之一,而在这一次发布的同时,豆包手机助手也一起推出了一个新的协议:SAEP,也就是屏幕自动化操作声明协议(Screen Automation Execution Protocol)。
它给了第三方应用选择权,应用可以自主选择允许或拒绝 AI 助手在应用内执行屏幕自动化操作。
同时,它也允许开发者们申请和接入协议。
发布之日起,豆包手机助手也启动了为期 30 天的规则公示:
“公示期内,豆包手机助手仅对系统自带应用、字节跳动旗下应用,以及已经通过 SAEP 或邮件明确同意接入的第三方应用执行自动化操作,其他应用默认不操作。”
我还用了用豆包“替你接电话”的功能:

在设置里,你可以设置它接听的范围,接听的策略。我给了它所有权限,然后用自己的另一个号试了试,再然后,我就……忘记了自己开通了这个设置。
直到有天在车上,我突然看到手机自己开始对话起来,低头发现是豆包在替我接电话。
有意思的是,这个电话听到后面,我才意识到,对面也是 AI。
深度的使用了一段时间后,我发现它的很多功能都已经很强,也比较稳定。而这是任何一个有野心彻底重新建立起一套交互习惯的产品,必须做到的前提。
按照官方给出的数据是,这一代相比此前,整体可用率提升至了 80%。
这些能力已经足够神奇,但在个人 agent 类产品过去一段时间快速的在用户里渗透后,它们似乎多少还有些“常见”。
而我对这款产品更大的期待和好奇,是它能不能更加接近一个真正的个人助手,甚至,私人助手的状态。
也就是它开始在这些常规任务之外,能更深入你个人的 context,解决一些你自己定义的需求。
而在边用边查看它在技术工程上的创新点后,我突然意识到,有一个我嘀咕了一年却一直没实现过的功能,可能终于可以做出来了。
02 胡适日记 AI
2025 年我发过一条朋友圈。

要完成“根据我过去一年的照片的地理位置信息,告诉我过去一年都在哪些地方游荡,分别待了多久”这个任务,其实每一个零件都是现成的。照片有 EXIF,EXIF 里有经纬度和时间戳,地图能把经纬度翻成地名,模型能把这堆结构化数据写成人话。没有任何一环需要新技术。
我常年在外面跑,一年下来去过多少城市、见了多少人,到年底一复盘,全忘了。可这些信息全都躺在这台设备里——几千张带 GPS 和时间戳的照片,排得满满的日历,便签里塞着的机票截图和随手记。
但之前这些信息都是“死”的。
过去一年里我试过第三方 App,试过云端模型,全都卡在同一个地方:拿不到东西。没有一个第三方应用能顺畅读完你整个相册的位置信息,你得一张一张传;没有一个助手能自己跳去日历、跳去便签、跳去读书 App 把材料凑齐。想做一次完整的复盘,先花两三个小时在十几个软件之间复制粘贴——那还不如不做。
模型早就够用了。卡住的是权限和接口。没做的是具体的工程工作。
当时诸多 AI 硬件都在追逐着某种“模型原教旨主义”,试图让模型来接管一切手机和硬件产品的操作。
但我的这种需求并不是要模型来单独搞定,而需要模型、硬件底层、工程等一起协同设计解决。
所以在用了一段时间豆包手机助手消费者版后,我终于把这个需求扔给了它。
第一版指令很简单:根据我相册里的图片来告诉我这两天我在哪里,做了些什么?
几秒钟出结果。准确,完整,有据可查。这一步在过去没有任何设备替我做到过。相册、定位、时间戳,第一次真的被一个助手完整读了一遍,不用我传,不用我导,不用我在十几个软件之间来回捣腾。
但我对着结果看了一会。我发现这本质还是只是把我的数据念了一遍给我听。
读完之后,最大问题是我没觉得它更懂我。它做的还是检索和罗列,我自己想了想,我其实想要的是理解和呈现。
那怎么搞,其实能想到的直接方法也简单,就是提示词再改改。但过去的经验提示,这样去操作其实会很随机,有时效果好有时不好。
如何让这个手机上的 AI 助手能更懂你,最好就是一个安全可控的记忆系统。
说直白一点,记忆这一层夹在你和模型中间。模型本身是不记事的,每次任务都从零开始;而手机里的数据又太多太杂,全塞给它也没用。豆包这次把能记的东西分成了三类。

第一类是你手机里本来就有的存量数据——录音、联系人、相册、短信、便签、日历。这些东西一直都在,只是从来没有被完整读过。主动授权之后助手可以调用,为此他们专门配了一个本地搜索工具,负责在这堆存量里检索和找回。
第二类是你主动告诉它要记的。给助手发一条记忆指令就行,灵感、购物清单、待办都算。
第三类是你日常刷手机时顺手“收”的,豆包手机助手提供了诸多入口:语音(对手机助手说记一下),AI 按键,组合键,快捷手势(三指上滑就能把屏幕里的内容保存进记忆),截图(截完点一下「记忆」,长截图也支持)等。
此外还有一层单独的,也就是个人 context。
它有两个来源:一是你主动提供的、希望被记住的信息,比如常用地址;二是豆包在跟你对话过程中自己学到的偏好,比如口味、习惯。这些不会作为一条条“记忆”摆给你看,而是沉淀下来,在后续任务执行的时候当上下文用。
我感觉是豆包把这手机本身作为一个大模型,给它做了一整套新的 harness 系统。
于是我决定在这个记忆系统里简单操作一下。
我想了想我要它怎样来记录或者说描述我,想了想,也许就像让 Her 里的 Samantha 来描述西奥多。

然后我想到了胡适和他的日记。

既然这是一个有点日记意味的功能,那当你想要记录今天的生活,看着这个全世界不停发生“见证历史”的大事、AI 突飞猛进、但同时每个人其实还是在过着自己眼前生活的时代的时候,总让我想到胡适,想起胡适的日记。
民国乱世,世界打得天翻地覆,他似乎该打牌打牌,该读书读书。一战打得最凶的时候,他在日记里检讨自己最近牌打多了。大时代的惊涛骇浪和一个人细碎的日常揉在一起,读起来让人心有戚戚。
于是!需求到这儿就完整了:
让豆包手机通过理解相册里的图片内容和地理信息,然后用胡适的方式,把我每天的生活细节,和当天发生的行业大事拼进同一篇“日记”里,用最懂我的方式记录日常。
我先让它自己上网搜索并阅读胡适的日记,把其中最符合我所说的感觉的语句加入到长期记忆中去,作为写法的参考。与此同时,它其实也已经根据它的理解,记录了不少它认为适合记录的关于我的个人 context,我很好奇这一切“揉”在一起,产出的“日记”,会是什么样。
然后我对它用语音发出了一个非常随意但繁琐长程的指令:
能不能去看一下我昨天拍摄的照片,然后根据这些照片内容的信息,和尤其是照片在手机里存的这个地理位置信息,结合着一起,然后判断一下我在,我昨天都做了些什么事情。同时呢也去搜索一下当天发生的世界上最重要的的一些新闻,然后呢用你,我之前存过的我非常喜欢的胡适的日记的风格去记录一下我昨天的一些,算是一个小的日记,不用特别长篇大论,然后放到我的便签里面。
说完我放下手机,去倒了杯水。水还没喝完,3 分钟后,手机弹了通知:任务完成,已保存至便签。
我打开这个弹窗:
七月二十一日,星期二
今日在西溪龙湖天街盘桓竟日。傍晚与友人在商场内食寿喜锅,蘸生鸡蛋入口,滋味尚佳。饭后闲步逛店,见玩具反斗城陈设,中庭人来人往,市井烟火气甚浓。晚间驱车返程,至五常港路遇晚高峰拥堵,车窗外灯火连绵,车流如织,伫立良久方得通行。阅今日新闻,英国工党伯纳姆就任首相,十年来英已换七相,政局之不稳可见一斑;西班牙竟在世界杯加时胜阿根廷夺冠,倒是意外之喜;国内上半年工业增加值增百分之五点四,青年失业率回落,也算可喜的消息。世事纷纭,日常的一餐一游,倒是最实在的光景。
看完愣了会。寿喜锅、五常港路的晚高峰、英国换首相、西班牙夺冠。
我的私人生活和当天的世界大事,就这么并排放在了一起。

03 唯一一直在你身边的可能就是你的手机
在“开发”出来这个胡适日记 AI 后,每天一天结束我都会让这个 AI 胡适出来写一写。
操作了几次之后,豆包主动提示可以把它做成一个固定任务。
这样一个我一直想实现的功能就这么实现了,而且它的确让我第一次感觉到一个“手机”能有多懂你。
在快 20 年前 iPhone 诞生的那场发布会上,乔布斯说 iPhone 是三样东西合成一个:一个宽屏 iPod,一部手机,一个上网设备。
他当时没有说、大概也没有办法预料的,是手机的第四个角色。
后来的十几年因为这个东西实在太好用,人们开始把它带去所有地方。吃饭带着,走路带着,睡觉放在枕头边。十几年里,几十亿人把自己拍的、写的、说的、买的、去过的地方,源源不断地倒进了它连着的那张网。
是手机让今天的 AI 真正成为可能。

十几年里,事实上我们一直在往这些设备里写。每个人的一生大多数时候,唯一一直在你身边的可能就是手机。它替你记下了每一个地点、每一顿饭、每一次深夜的搜索。但是从来没有过一个读者。
所以那天那篇日记让我愣住的地方,其实不在于它写得有多好,而在于这些东西第一次被理解了一遍。手机做了十几年的记录设备,现在它多了一个身份,它开始成为一个读者。
当然,没有人愿意用几千张照片、全部行程和通话记录,换一篇写得还不错的日记。它今天之所以能成立,很大程度上是因为这些检索和理解发生在这台设备本身,而不是发生在某个你看不见的地方。二代豆包手机上,这些带指纹识别的 AI 键、留在本地的全局记忆的设定、负责在本机数据里检索的本地搜索工具等,也都是在解决这个隐私和安全问题。这一切能否保障好,才是让手机变成真正最懂你的 AI 助手的前提。
而当这些功能的运转足够安全,当它们开始可以由你自己定义、自己发明、自己在手机上实现后,我觉得我们就真的回不去从前的手机体验了。
我们看待手机的方式也会快速变化。我们用了它十几年来记录这个世界。现在轮到它来记录我们了。
作者|王兆洋
本文由人人都是产品经理作者【硅星人Pro】,微信公众号:【硅星人Pro】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自Unsplash,基于 CC0 协议。
- 目前还没评论,等你发挥!

起点课堂会员权益



