为什么 AI 产品需要体验评测

0 评论 346 浏览 0 收藏 16 分钟

当大模型能力差距逐渐收窄,用户体验正成为AI产品商业化的关键变量。本文从用户研究者视角出发,系统论证了为何当下需要体系化开展AI体验评测,技术评测为何无法替代体验评测,以及互联网那套成熟框架为何不能直接照搬。

在 AI 领域内,技术评测——尤其是针对对话大模型产品的,已经相当成熟:方法丰富、迭代快、相关的讨论和文章资料多,岗位机会也不断在出现。与之形成鲜明对比的是体验评测,即真实用户用起来到底怎么样、遇到了什么问题,却很少被关注、讨论。

固然,在 AI 时代,模型能力肯定是基石,值得重点关注。但站在一个用户研究者的视角看,只要 AI 依然是要面向普通大众服务的,依然要商业变现,那就还需要看清真实用户、买单人的痛点与需求、使用感受等,据此优化业务和产品,这个逻辑不管是在互联网时代还是 AI 里都还是成立的。而且,虽然有些评测模型里包含了一部分体验指标,但也往往只是满意度、完成度这几个指标,并不能真正、全面、准确地反映用户的使用体验。

因此,AI 的用户体验评测依然值得关注,而且需要被体系化地开展:不是用几个指标,而是需要一套更完善、系统的机制,帮助看清体验水平、发现原因,并推动问题的解决。

本文想先把以下三个问题说清楚:为什么现在适合开展体验评测;为什么技术评测替代不了体验评测;以及互联网的体验评测体系能不能直接照搬。

一、为什么是现在:三个变化叠加

1、模型之间的能力差距正在收窄

斯坦福 HAI 发布的《AI Index Report 2026》显示:在竞技场(Arena)榜单上,排名最靠前的四家公司,得分差异已经在 25 分以内。而仅仅三年前,OpenAI 还领先 Google 205 分。这意味着:在模型能力上,头部模型之间的差距越来越小;

与此同时,根据 OpenAI 与哈佛等机构研究者的合作论文《How People Use ChatGPT》,多数人用 AI 处理的是日常问答和写东西,很少涉及复杂的推理任务(实用指导、信息查询、写作三类,合计占了近八成)。因此,笔者认为,当模型能力已达到一定高度,且未出现质的提升后,普通用户将很难感知到模型间能力的差异,毕竟多数用户的任务并不复杂,简单任务基本触及不到模型上限;与此同时,模型能力以外的因素,例如提问后出结果快不快,输入的方式顺不顺手,拿到答案之后是否方便微调、复制等,都更容易被用户感知到,也会实实在在地影响用户选择哪款 AI 大模型工具。

因此,模型能力不再是决定产品商业成功的唯一因素,还有别的机会点和优化方向可以考虑,要找到它们,可以开展体验研究与体验评测:拿到用户的需求与不满,据此帮助发现机会与不足。

2、用户规模已经很大,人群之间的差异也很大

QuestMobile 的数据显示:截至 2026 年 6 月,国内 AI 原生 App 的月活规模接近 5 亿,同比增长 85.4%。用户结构的变化更值得注意:截至 3 月,AI 原生 App 用户中,60 后用户规模增加 1660 万,三线及以下城市用户规模增加 9126 万。这意味着:

一是调研已经具备可行性,尤其是定量调研。而足够样本量的调研结果往往也更具说服力,更能辅助决策。

二是有丰富的用户反馈值得挖掘、整理

每天来自用户评论、咨询、产品对话、使用行为等的数据大量产生,但它们就像是一个等待开发的金矿,需要有一套统一、高效的方法「沙中淘金」:有效梳理、准确归纳,再提炼成能用的洞察,而不是各方随意各取所需。缺乏甄别、整理的信息不但不能优化产品,甚至可能误导决策。

同时也要看到,用户与用户之间的差异非常明显。就拿笔者身边的情况举例,有人只把 AI 当做搜索工具:用语音简短提问,拿到结果(不加甄别)后就结束使用了,而有的人清晰了解 AI 的优劣势,会更合理安排人与 AI 的分工,给予 AI 高质量、信息丰富的提示词,多轮追问和校验结果。因此,即使这两类人都反馈 AI 不好用,那也肯定意味着不同的原因,只有开展调研、分人群看出差异,才能给出更有针对性的优化对策。

3、商业化进入变现阶段

目前,国内的对话大模型纷纷推出付费版本,这意味着 AI 应用从「免费圈地」进入了「验证付费」的阶段。但付费的现实并不太乐观:腾讯研究院 T-ask 调研(2026 年 5 月)显示,国内 AI 用户的付费比例约 9.8%;《中国新闻周刊》的《2026 有意思生活方式报告》里,超七成人每年 AI 花费不超过 200 元,甚至为零。

企业端的情况类似:毕马威的一项调研显示,88% 的受访企业正在投资把 Agentic AI 建进系统,但只有 24% 能在多个 AI 用例中真正实现投资回报。

因此,大模型厂家要实现商业化,就得弄清楚买单人、用户的诉求与痛点,再据此去优化模型、规划产品。

综上,模型能力很关键,且仍有产品靠能力上的断层保持领先;但当模型能力差距收窄、企业又进入到商业变现阶段,用户视角的分量就上来了。因此,现在可以通过体验评测看懂用户,帮助给出更适用于用户的业务方案——也才更容易取得商业成功。

二、技术评测不能替代体验评测

本文所指的技术评测,主要是指:题库跑分、真人盲测的竞技场、模型裁判、专家人工评测等。虽然它们的做法各不相同,但都侧重回答同一个问题——模型的能力水平如何?这些方法的优势和价值明显:可复现、可比较、可长期追踪,可给出准出标准用于发布决策。但它们没办法回答:真实用户实际使用这个产品的时候,体验怎么样?所以技术评测再完善,也替代不了体验评测;反过来,体验评测也替代不了技术评测。此外,近两年也不断有文献指出这些技术评测方法存在不足,而其中一些不足恰恰是 AI 体验评测能解决的:

而且,通过与技术评测紧密合作,体验评测还能带来一些新的价值:

  • 从「看排名」变成「做迭代」——技术评测输出的是高低排名,体验评测能进一步定位问题场景、问题类型与影响人群,产出可执行的优化方案;
  • 从「单次考试」变成「持续体检」——通过长期体验监测,可得到版本体验变化趋势、风险预警等。

三、AI 产品的体验评测,为什么不能照搬互联网那一套

既然针对 AI 的体验评测有独特的价值,那很多人会自然地想:体验评测在互联网产品领域已经很成熟,有很多成型的模型、框架,直接复用到 AI 产品里不就行了?但随着对 AI 产品特点的更多了解,笔者认为需要额外针对 AI 产品搭建一套新的体验评测体系,主要原因在于:AI 产品与互联网产品的特点差异很大,互联网产品那套体验评测的研究内容和方法,要么有些不再适用 AI 产品,要么不能覆盖 AI 的新特点、新内容;AI 与互联网产品差异是个复杂宏大的话题,因此笔者仅列举一些主要的差异,以解释不能照搬的原因:

差异一:交互范式变了——从图形界面到自然语言

互联网产品的体验研究,很多方法、指标、量表是建立在图形界面上的,侧重衡量导航、点击效率、转化漏斗。而在对话式大模型里,以上这些交互方式都不存在了——没有页面可以点,没有导航层级结构可以测,这意味着,很多量表尤其是侧重衡量可用性的都不再适用 AI 产品;除此以外,基于 AI 的产品特点,在开展体验评测时还要覆盖很多新的研究内容,例如:

  • 意图链路:用户怎么表达意图,模型有没有准确理解(表面与潜在真实意图)、有没有紧密跟随住意图变化;
  • 人机交互质量:分工合理性、效率、多轮沟通的连贯与节奏等。

差异二:影响体验的因素更多了

在互联网产品里,有一条经典的原则「Don’t Make Me Think」,且大家会默认当用户抱怨产品不好用时,直接归因为产品不够好,不会去苛责用户,或者再去寻找其他因素的原因,毕竟互联网产品的体验影响因素也主要就在于产品功能、设计这些。但在 AI 时代里,体验影响因素变多了,新增了模型能力(能不能理解真实意图、生成质量稳不稳等)、用户自身的因素(能不能说清需求,AI 使用水平,对 AI 的能力有无准确的理解、期待)等。

这意味着:当用户抱怨「这个 AI 不好用」时,不能再简单地归因到产品的系统设计上,如果这些因素没有被准确评估、拆分开,就很难准确找到发力点,容易把资源投错地方。

因此,AI 的体验评测体系需要覆盖模型能力、用户侧相关的指标和内容,这些都是互联网体验评测体系里缺乏的,需要重新设计。

差异三:体验水平随时间变化更大

互联网产品的体验变化往往仅仅是伴随发版、功能更新等业务明确已知的动作而出现,但是 AI 体验变化还会因为其他原因而变化:

原因1:用户预期变化——因为 AI 是全新产品,用户对它的预期处在持续校准的过程中,用着用着才知道它到底什么水平。

原因2:模型会迭代,行为会出现漂移。

结果就是,如果延续互联网体验评测的习惯,只在「发版前后」测量,就会留下盲区——用户感知到的变化,和版本节点并不对齐。要回答「这次改动是改好了还是改坏了」,就需要长期监测,以及专门的统计分析方法来剔除误差。

除了以上三个主要特点,AI 大模型还有一些已知的典型体验问题——幻觉与编造、上下文遗忘、谄媚、不认错、输出不稳定等。这些在互联网的体验模型里都不存在,如何定义、如何衡量,都需要重新设计研究内容和测量题目。

综上,AI 产品与互联网产品差异很大。AI 产品的体验评测,需要在研究内容与方法上有针对性地设计、创新。

四、AI 体验评测可在哪里重点发力

第一,面向真实用户、真实场景测量

这是拿到用户视角的真实体验水平、产品优劣势、问题的前提。

第二,结论要能落地

满意度分低,背后原因很多:可能是首轮答案存在事实错误,也可能是等待过程不可见、用户很迷惑,不知道 AI 是卡住了还是正在思考;前者涉及模型能力,后者则跟交互设计有关,如果不能找准原因,体验评测的意义和价值都很有限。因此,AI 产品的体验评测需要给出:问题出在哪类任务里、哪个旅程环节、哪类人群中,是什么性质,改善优先级等。

第三,研究内容与方法要针对 AI 产品的特点重新设计

一是评测内容与指标要能覆盖 AI 产品特点与问题,例如人与 AI 交互、AI 素养、幻觉与编造、上下文遗忘等;

二是研究设计、统计分析也要有专门的考虑,把各个体验影响因素的作用分开,剔除时间因素带来的误差等。

本文由 @晚风 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!