如何设计自然的具身人机交互
具身智能产品设计的关键在于自然的人机交互。本文从人类交互的深层机制出发,揭示预测、身体信号与动作节奏的核心作用,并探讨如何构建机器人的感知架构,以实现真正流畅、安全的协作体验。

前两篇文章,我把具身智能的软件+硬件完整拆解了一遍。后面要聊的,是应用层的具身产品设计。具身的产品设计要考虑的因素能写一大坨,但无论哪个场景,人机交互这个话题都无法绕开。
每个工程师都盼着自己做的机器人看起来”自然”。可”自然”这个词有点太抽象了。我对其的具象化理解是:在 C 端场景中的具身自然,是人和机器人相处时,不需要迁就和提防它,而是能像跟另一个靠谱的人配合一样,凭直觉就知道下一步该干嘛,并且相信它会给出恰当的回应。

人与人之间的交互,是本文章所讲的自然人机交互参照系。在我看来,人与人配合之所以优雅,不是因为我们语言多发达,而是因为我们之间有大量不需要语言的、瞬时的、双向的默契。嘴巴在这套系统里,地位远没有我们以为的那么高。
因此,我在谈”如何设计自然的人机交互”之前,先为大家说清楚”人与人到底是怎么交互的”。人的感官系统是怎么干活的,然后再想机器人该被配上什么对应能力,以及在这场配合里,人和机器各演什么角色。
01 人类社会的交互
人和人交互,并不全靠语言。语言只是信息传输中的通道之一。信息会同时从好几条通道里流出来,各条通道的速度和用途天差地别。
- 极快、无意识的通道:视觉里的运动、余光里的逼近、皮肤上的触碰。这些根本不经过想,直接触发反应。手碰到烫的东西瞬间缩回,这事大脑皮层都懒得签字,是脊髓直接办完的。
- 中速、半自动的通道:身体姿态、朝向、眼神、动作的节奏。你和人并肩走,会不自觉地调整步频和间距。你几乎意识不到,但它一直在发生。
- 慢速、有意识的通道:语言。组织词句、表达意图,需要时间,也最烧脑。

这些通道存在的目的,是把多方角色的注意力拉到同一个维度下。人类为了这个目标进化了不知多少年,才换来今天的成果:把不同的交互任务,分派给不同的通道。要瞬时反应的交给最快的反射,要持续协调的交给中速的身体感知,要传达复杂意图的交给最慢的语言思考。
之前在软件的文章里,我提过”感知-思考-行动”这条链路。用它来执行任务没问题,但如果机器人事事都靠这一条链路,大概率会呈现出一种呆瓜状态。
把人的信息传输能力抽象出来看就会发现:想让机器人像人一样自然,就不能用”感知-思考-行动”一条链路应付所有任务,而要分层。快任务归快处理,慢任务归慢思考。
预测,而非响应
我们无时无刻不在预测,而不是在响应。这是个极易被忽视的交互洞察。一个只会响应的机器人,总有种”慢半拍”的迟钝感。会预测的机器人,才谈得上自然。

人并不是看到别人的动作之后才做反应。神经科学有大量证据表明,人脑是一台预测机器:它不断预测接下来会发生什么,再用实际的感觉输入去校正预测误差。比如接球,你不是等球飞到手里才合掌,而是提前算好了轨迹,在球到之前就张开了手。
人做任务时,不预测就一定会延迟。感知要时间,计算要时间,机械执行还要时间。这些时间一累加,我们就觉得机器人慢半拍。人与人配合之所以流畅,正是因为双方都在持续预测对方的下一步,并提前备好姿势。
想让机器人预测得更优雅,得搭一个任务预测模型:根据人的视线、姿态、手的运动、行走方向,加上情境常识,去猜用户接下来最可能干什么。
预测必然会错,所以必须一边预测、一边用实际感知校正。预测让机器人变快,校正让机器人变准,两者缺一不可。

预测能提升流畅性,但预测不能碰安全。凡是和安全挂钩的任务,必须是基于确定性的设计。不能因为预测人不会突然冲过来,就取消了突发情况的防护。产品经理应该把这句话刻在工位上。
身体本身就是意图信号
人在行动前和行动中,身体会自然地”泄露”意图,而对方会读这些信号。如:你要起身,会先微微前倾、手撑桌子。旁边的人立刻知道你要走了;你走路时的朝向和视线,早就预告了你下一步要去哪。
这些信号不是刻意演出来的,而是动作本身的自然组成部分。可它们承担着巨大的沟通功能。让周围的人能预测你,从而提前协调、避免翻车。
一个行为无法被预测的机器人,会让周围的人一直处在警觉和焦虑里,没法放松地跟它配合。反过来,一个行为高度可预测的机器人,哪怕动作慢一点、保守一点,人们反而能安心地跟它协调。想让机器人被人预测,有三个设计要注意下:

- 增加动作状态。减速表示”我注意到你了 / 我在让你”;平稳匀速表示”一切正常”;停下表示”我不确定,我在等”。机器人的运动本身应该是一种人人都懂的语言,而不是靠额外的屏幕或语音来解释。
- 增加动作信息。抓取前,要有明显、可辨识的预备动作;转向前,先减速、身体先微微朝向目标方向;让路时,明确地侧身,而不是含糊地挪一下。这些信号没什么功能价值,不过正是因为这样的细节存在,才会让机器人变得更加自然。
- 保持行为一致性。同样的场景,机器人给出同样的动作反应。人跟机器人交互几次之后,就能对它建立起直觉预期。如果机器人面对相同场景,行为表现忽左忽右,没人会愿意相信这种猪队友。
动作时机与节奏
在物理世界里,人和人配合时,动作触发的时机和执行节奏同样重要。这点常被忽视,工程师们尤其容易把它当成算法的副产品,随手扔在一边。
- 动作触发的时机。交接物品时,机器人松手太早,东西掉地上;太晚,人觉得被较劲,这货是个杠精。机器人恰当的做法是:感知到东西已被稳稳接住,再松手。
- 动作运行的节奏。跟随行走的节奏:快了是催人,慢了是拖后腿,所以要设计成机器人能动态匹配人的步调。
- 动作响应的时机。太快显得机械抢话,太慢又显得迟钝。
机器人产品的体验差距,要在它完成任务的基础上,执行任务时能更加地合拍。 要把”节奏和时机”当作一个明确的、需要专门打磨的设计维度,而不是听天由命地接受算法的默认输出。苹果之所以是一个伟大的产品,正是因为它在其中穿插了很多细节。
02 从感官系统到感知架构
人靠感官理解世界,机器人也需要一套能力去理解世界。但不能简单照抄人的五官,五官只是信息接收的手段。我们要理解它们最终要达成的效果,再用第一性原理反过来问:为了这个效果,我该给机器人配什么能力?
读懂意图和预测
人视觉能力最重要的作用,不是看清物体细节,而是捕捉运动、预判轨迹、读取对方意图。你的余光对运动极其敏感,这是老祖宗进化时留给我们的保命机制:快速察觉逼近的威胁,而中央视觉负责精细识别。所以机器人真正需要的是意图识别能力,而不只是一套”看得清”的视觉系统。意图可以通过语音、视觉、触觉共同理解。

机器人的视觉系统要分工:一部分低延迟地专门盯着运动和逼近,对应人的余光与快反射,服务于安全和避让;另一部分做精细的物体识别与场景理解,对应中央视觉,服务于任务。
不过摄像头有它的物理局限:怕逆光、怕黑暗、怕遮挡、怕镜面和玻璃。所以视觉绝对不能是唯一的意图识别感官。
除此之外,机器人视觉还要能预测人的意图:人朝哪看、身体朝向哪、手伸向哪、走路的方向和速度。这些都是预判下一步的关键线索。一个能预测人意图的视觉系统,才配得上”自然配合”四个字。预测能力不只让机器人交互更自然,也是机器人智能化的体现。
但预测可以大胆,行动必须收敛、克制,预测之后的动作要有边界。机器人内部可以推测用户有70%概率想喝水,但并不意味着 70% 就该直接动手。中间还要有一层去思考,要不要执行?先评估当前动作的风险等级:中高风险的,必须用户确认后再执行;低风险的,机器人可以主动做。
物理接触的对话
对智能手机这个载体来说,触觉几乎覆盖了它的所有功能。对机器人来说,面对物理世界,力觉和触觉依然是核心中的核心。机器人要用触觉系统完成”物理对话”,关键有三项任务:

- 判断抓握是否稳定:靠感受抓握时的力和微小滑动,而不是靠视觉猜。人抓东西时,手指能感知到物体开始下滑的瞬间并立刻加力,这个过程极快。机器人要实现它,需要在末端有触觉感知,加上快速的局部控制回路。
- 实现柔顺、保障接触安全:当机器人碰到人或易碎物时,能”软”下来,顺着外力让步,而不是硬顶。这既是配合的基础,也是安全的物理保障。
- 参与双向力对话:感知人施加的力,理解人的意图,并做出配合。
虽然接触能获取到客观、真实的信息,但从安全角度看,我认为接触安全不能只靠”视觉看到人 → 软件判断危险 → 急停”这条链路它太慢了,等软件反应过来,接触早就发生了。
真正的接触安全,必须有一部分内建在机器人本体的柔顺性和最底层的高频力控里,让机器人在物理上天生就撞不疼人、伤不到物品。作为产品经理要坚守这条安全红线。
意图理解
听觉系统是机器人接收复杂、抽象意图的主要通道。大语言模型让机器人第一次能较好理解开放的、口语化的、带歧义的自然语言(”帮我把桌上那个蓝色的杯子拿过来”),这是巨大的进步。但要清醒认识语言的边界:
- 语言慢、带宽低。它适合传达”做什么”,不适合实时控制”怎么精确地做”。你不可能用语言实时遥控一台正在避让的机器人。
- 语言充满歧义,要靠共享的视觉和常识来消解。”那个杯子”到底是哪个,得靠视觉配合。
纯依赖听觉会遇到的各种问题,我就不展开了。ASR 是玩了很多年的技术路线,大家可自行按业务场景查阅相关逻辑。
所以语言必须和视觉、场景理解深度融合,才能落地成具体动作。孤立的语言理解,在复杂的物理世界里,无法真正理解用户意图。
对意图理解这件事,要给不同系统分别定好位:语言负责任务层,视觉负责协调与预判,力觉负责实时接触配合。各自管好自己的一亩三分地。
多感官融合不是无限叠加
也许有人会觉得什么都有肯定更好,越多越牛13。视觉、力觉、听觉全都来一遍。不过钱也不是大风刮来的,日子不过了么?就算有钱,冗余的东西要它也没有啥用。
我们不该做无意义的叠加,而要想清楚叠加后要达成什么目标、解决什么问题。叠加的感官越多,问题越多。最典型的是时空对齐和冲突仲裁。

- 时空对齐。不同感知硬件的信息速度天差地别:力觉能到上千赫兹,视觉通常几十赫兹,语言是秒级。要把这些速度不同、坐标系不同、延迟不同的信息,拼成一个统一、连贯的”当前世界理解”,是个很难搞的工程问题。不得不说,造物主太厉害,让人天然就能把看到的、听到的、摸到的整合成统一体验。
- 冲突仲裁。当视觉说”前面没东西”,力觉说”我撞到了东西”,这时候信谁?从安全角度看,现阶段要信那个更关乎安全、物理上更确凿的感官:力觉的物理接触是确凿的,视觉的判断是推断的。我们必须参与定义这套感官优先级与仲裁规则,它决定了机器人在矛盾情况下会做什么,往往也正是机器人是否安全的关键时刻。
03 机器人的角色定位
自然的人机交互,不是机器人替代人做完一切,而是人和机器各展所长、彼此互补。
不应该让机器人变成人
人和机器擅长的事完全不同。好的交互,是让各自做各自擅长的事:
- 人擅长:理解模糊意图、应对意外、做价值判断和常识推理、处理长尾的怪异情况。
- 机器擅长:精确、重复、稳定、不知疲倦、精确控制力和位置、多任务并行处理数据。
最自然的配合往往是:人负责”判断和决定”(尤其是意外和关键决策),机器负责”精确而重复地执行”。比如协作装配中,人决定策略、处理异常,机器负责需要精度和力量的重复操作。

聊到这,肯定有读者要喷我:前面说了一堆感官配合、任务拆解,现在又说别去做意图理解了,这不是前后矛盾吗?
我想在这里破掉机器人工程师们的一个终极执念:机器人要完全自动化。我的看法是:不是自动化程度越高越好。在很多场景下,恰当的人机各展所长,比追求机器完全自主更实用、更安全、也更快落地。
我们应该不断问自己:”这个任务里,人和机器各自该干什么?”而不是一门心思思考怎么把人彻底去掉。完全自主可以是某些场景的终点,但不该是默认方向。脱离场景谈能力,纯粹是扯淡。
权责边界
人机交互中一个核心的设计决策,是决策权在什么时候、以什么方式在人和机器之间转移。我觉得一个比较好的设计是用动作的代价和是否可逆,来决定其自主程度。
- 可逆、低代价的动作(调个亮度、挪下位置):机器自主执行,错了再改,追求流畅,不要频繁打扰人。
- 不可逆、高代价的动作(把东西从高处拿下、处理贵重或危险物品):要么提高置信度门槛,要么把决策交还给人确认。
- 机器不确定时:主动降速,发问或请求人接管。这不是缺陷,而是诚实和安全的表现。
不要想用统一的自动化水平对待所有动作!那样的话琐事会太墨迹,高风险动作会过于粗鲁。要画一个动作风险vs交互摩擦的表格。代价越高、越不可逆,交互中的确认就该越多、激进度就该越低。

这种情况,自动驾驶领域展示出来的教训案例,应该够多了,我都懒得举例。如果机器突然把控制权甩给一个没准备好的人,后果可能是灾难性的。
为了避免重演那些残酷案例,产品经理一定要在交接中加一些优雅设计,保证人机交互的稳定性.
- 预告和缓冲。交接不能突然。机器要提前告知:我可能需要你接手。给人反应和进入状态的时间。
- 明确责任人。现在谁在负责,必须清晰无歧义。最怕双方都以为对方在负责,或都以为自己该等对方,这种稀里糊涂的状态,最容易翻车。
04 安全与信任
前面讲的所有东西,都建立在安全和信任这两块地基上。地基塌了,上面再漂亮,也不过是屎上雕花。
安全是第一原则。物理世界对机器人安全性的要求,是绝对的确定。不信可以后面看,随着上市机器人公司变多,哪天某个机器人搞出点安全事故,冲浪时可以立马听取股民哭声一片。
好的产品设计,是用一套独立的、简单的、确定性的安全机制兜底:硬件急停、力矩上限、速度限制、安全区域、本体柔顺等。这套机制不依赖模型的判断,模型再怎么抽风,通过这套安全机制也能把伤害限制住。安全功能要尽量简单、可验证,并独立于复杂而不可验证的智能部分。
宁可让机器人在不确定时停下来,也不要让它自信地做出可能伤人的动作。保守地失败,远好于激进地失败。不要为了自然而自然,有时候,该der一点就要der一点。

我刚做产品经理时,我的 leader 跟我说:产品经理一定要爱惜自己被信任的羽毛。你得靠很多件事,把自己做成一个可靠、可被信任的角色;但只要失误一次,就容易被贴上”不可靠”的标签。所以产品经理要爱惜自己的羽毛。
机器人也一样。机器人只要发生一次严重失误,后续做再多信任修复都很难。为了让机器人在交互中是个可靠角色,一定要做三件事:
- 前几次交互定生死:开箱和初次使用的可靠性,决定长期信任的基调,要”不惜代价”保证。
- 校准信任基线:不是让用户过度信任机器人。过度信任会导致误用和事故;信任不足,又会导致产品被闲置、拖累品牌口碑。理想状态是用户的信任恰好匹配机器人的真实能力。所以要诚实地暴露机器人的能力边界,而不是假装全能。爱装13的都没什么好下场。
- 犯错后的复盘机制:这是机器人的机格问题 [人工狗头]。机器人必然会犯错,但它犯错后是否会解释、会致歉、下次是否改进,这些做法更能影响用户是否愿意长期信任它。
机器人面对的是物理世界,物理世界可采集的数据量级远比手机app大的多。数据的采集范围、存储、使用、以及用户的知情权和控制权,不只是合规问题,更是信任的根基。一个被曝光滥用家庭数据的机器人品牌,信任会瞬间崩塌,且无法挽回。没人敢买一个收集家庭信息机放到家中。
05 结语
上面聊了很多,都是如何让机器人交互尽可能自然。但从产品角度讲,我在某些特定场景下,反而不希望机器人做得那么自然。如果真有一天,机器人与人的交互变得无比优雅、丝滑,我会很开心。因为在如何让它变自然这件事上,这篇文章留下了我的洞察和思考的痕迹。
机器人变得自然当然很好,可同时我有很担忧:当机器人真的变得无比优雅之后,它引发的社会性问题、安全性问题。我觉得这会超过历史上所有工业革命带来的影响,更会超过现在 AI 模型的影响力。因为到那时,人类的角色,升级成为了造物主。这是角色升级。而不是工业革命。角色升级后,很多东西都会被放大的,这里不再多说什么。

先不说那么远。目前大家期望的机器人自然交互标杆,大多是人与人的信息交换系统。但我们也不该忽视其他物种的信息交换能力。有些物种的信息传递方式,也许更能帮我们提升工作效率。比如工厂场景下的群体智能,就是从蚂蚁用信息素交流的能力推演出来的。
之前的文章我提过,具身智能不一定人形更好。也许四足机器人 + 机械臂的组合更容易被C端用户接受,不过这是机械结构层面的思考。从信息交互方式看,人类未必是最好的学习榜样。还是要从用户场景出发,先想清楚我们要解决什么问题,再看用什么方式做信息交换。
世界上有多种多样的信息交换形式,也许以后做交互最成功的团队,会是那些找不同领域的人交流经验的团队,人文、社科、心理、自然、哲学,等等。
作者:糊研乱宇 公众号:糊研乱宇
本文由 @糊研乱宇 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益



