大模型没有“大脑”,只有“骰子”?3分钟重塑产品经理的LLM认知

0 评论 67 浏览 0 收藏 13 分钟

大模型不是大脑,而是一张概率表。产品经理若不懂这一点,就难以掌控AI产品的稳定性与创意性。本文用客服翻车案例切入,拆解温度、Top-p等参数如何影响输出,并给出PRD写作与效果验证的实用方法,助你从“赌场荷官”视角重新定义AI产品设计。

张小龙说过,产品经理要“像上帝一样思考”。但面对大模型,这套思维得扔了——你得先学会像赌场荷官一样思考。

去年我在一个AI客服项目里踩了个坑。产品上线后,用户问“我昨天买的手机为什么还没发货”,模型有时回答“正在为您查询订单”,有时直接编一个物流单号,还有一次居然说“亲,建议您联系快递公司”。同样的输入,三次回答完全不同。业务方炸了:“这模型是不是精神分裂?”

不是精神分裂。是我根本没搞懂它到底是什么。

一、它没有“大脑”,只有一张概率表

我们被“智能”这个词骗了。

“人工智能”——这四个字让所有人下意识地把大模型当成了一个有认知、能推理的“电子大脑”。它会“理解”你的问题,“思考”之后给出“答案”。

全是错的。

大模型的核心逻辑,八个字就能说透:统计学习,概率预测

翻译成人话:它本质上是一个从海量文本里“死记硬背”出统计规律,然后根据你输入的上下文,计算下一个字最可能是什么,再一个个吐出来的机器。

它不是在想怎么回答你,它是在算:“根据人类写过的所有文本,在我现在看到的这些词后面,概率最高的下一个词是什么?”

你问“今天天气真”,它去概率表里查——在人类写过的文本里,“好”跟在后面的概率是35%,“热”是28%,“差”是12%……然后它选了“好”。再拿“今天天气真好”去查下一个字,循环往复,直到凑出一整句。

整个过程里,没有思考,没有理解,只有计算。

产品经理听懂这句话,就等于拿到了AI产品的第一把钥匙。因为所有你看到的神奇和所有你遇到的翻车,根源都在同一个地方。

二、注意力机制:它怎么“看”懂你的话

那它怎么从海量文本里“学”到规律?靠的是注意力机制(Self-Attention)

听不懂没关系,我来打个比方。

想象你在读一段话:“那只在沙发上睡着了,它蜷缩成一个毛球。”

你看到“它”的时候,会下意识联系到前面的“猫”——因为你知道“它”指代的是“猫”。大模型做的事一模一样。它给这段话里的每个词都算一个“注意力分数”,告诉“它”应该重点关注“猫”,而不是“沙发”或“睡着了”。

和人的区别在于:人靠理解,模型靠统计。

它会问:“在人类写过的所有文本里,‘猫’和‘蜷缩’同时出现的频率是多少?‘沙发’和‘蜷缩’同时出现的频率是多少?”频率高的,注意力分数就高;频率低的,就被忽略。

这就解释了产品经理最常见的翻车现场:为什么模型有时会“注意”到错误的信息?

因为它在统计上“觉得”那两个词更配,而不是从逻辑上判断它们相关。这就是幻觉(Hallucination) 的根源——模型不是在撒谎,它只是在统计概率上选了一个“看起来最合理”的词,尽管那个词在事实层面是错的。

三、温度、Top-p、Top-k:你手里握着的四个骰子

听懂这些,产品经理接下来要问的是:“既然它是概率生成,那我怎么控制它?”

答案是:用参数调概率分布。 说白了,就是决定这枚“骰子”怎么做手脚。

Temperature(温度)

这是你最重要的控制杆。

  • Temperature 调低(比如0.1):概率分布变得“尖锐”。最高概率的词被选中的几率极大。结果:输出确定、保守、重复。适合客服问答、代码生成——错一个字就完了。
  • Temperature 调高(比如0.9):概率分布变得“平坦”。次高、第三高的词也有机会被选中。结果:输出多样、有创意、但也更随机。适合写文案、做头脑风暴。

口诀记住了:Temperature 越低越“老实”,越高越“放飞”。

Top-p(核采样)

Temperature是“改概率大小”,Top-p是“划圈子”。

比如设p=0.9:把所有候选词按概率从高到低排序,累计概率达到90%就停,圈里的词才参与抽签,圈外的直接封杀。

优点:圈子大小随上下文自动伸缩。 模型对某个词很有把握时圈子小,没把握时圈子大,更灵活。

Top-k

最直白:只允许前k名入围。k=1就是“每回都选最高的”,完全确定,但容易变成复读机。

Seed

固定随机种子。设seed=42后,同样的输入永远得到同样的输出。产品经理回归测试、写演示Demo时记得用——不然录屏的时候每次都不一样,会被开发追杀。

一张表记住怎么调:

数据来源:https://cloud.tencent.com.cn/developer/article/2574164?policyId=1003

知道这些对产品经理有什么用?

很多PM设计产品时,把“不确定性”当bug。但只要你明白了模型本质是概率生成,你就会知道:不确定性不是bug,是feature。

客服场景,你要的是“稳定性”——把Temperature压到0.2,同时加RAG兜底,让模型每次回答都一样。文案生成场景,你要的是“多样性”——Temperature调到0.9,让同一个输入每次生成不同版本,供运营挑选。

需求文档里写明白这三件事,开发就不会追着你问“到底要稳定还是要创意”了。

四、产品经理的核心工作:管好这枚“骰子”

懂了“概率预测”这个底层逻辑,你就能重新理解自己所有的工作。

产品经理的日常工作,本质上都是在做同一件事:通过约束模型的概率空间,修正输出结果,让它贴合真实的业务需求

你看,你不需要懂算法公式,但你必须知道边界在哪里。

很多PM犯的错误是:把模型当“万能解题器”。觉得“我把问题丢进去就行了”,结果模型答非所问,又说“这模型不行”。

你换个思路:模型不是解题器,是一个“概率黑盒”。你的工作不是“丢问题”,而是设计一套输入规则,让这个黑盒在特定场景下输出的概率分布,恰好符合业务需要。

这就像你去餐馆点菜。你不需要知道这道菜的具体工艺,但你得清楚自己想吃什么、有什么忌口,然后说清楚。大模型也是——你不需要懂它的内部机制,但你要会“点菜”。

区别在于:人听懂你的话靠理解,模型听懂你的话靠概率计算。 所以你“点菜”的方式,决定了它“上菜”的质量。

五、给你一套可用的方法

说了这么多,回到产品经理最关心的那个问题:我明天上班能用这套认知干什么?

第一步:设计功能前,先问三个问题

1)这个场景对“确定性”要求多高?

  • 高(客服、金融、医疗)→ Temperature压低,加RAG兜底,设计“不确定时转人工”的兜底逻辑
  • 低(创意、文案、娱乐)→ Temperature调高,接受多样性,设计“不满意就重试”的交互

2)错误成本有多高?

  • 高(涉及钱、法律、安全)→ 必须设置人工审核节点,模型只出草稿,人确认后才能执行
  • 低(纯内容生成)→ 可以全自动,但要设计“用户能轻松修改”的编辑界面

3)用户能接受“不确定性”吗?

  • 能(探索类、创意类)→ 直接展示模型输出,甚至强调“AI生成”
  • 不能(工具类、决策类)→ 必须隐藏“概率感”,把模型输出包装成“确定答案”

第二步:写PRD时,补上这一节——“概率控制策略”

不少产品经理的PRD,写到AI功能部分就一句话:“调用大模型生成回答。”

这等于把设计权全部交给算法工程师。

你应该写清楚:这个功能期望的“确定性程度”是什么?Temperature该设多少?什么情况下需要人工兜底?兜底的触发条件是什么?

比如:“本功能要求模型输出的稳定性优先,Temperature控制在0.2以下;当模型置信度低于70%时,自动显示‘无法确定,建议人工处理’页面。”

第三步:验证效果时,用“概率思维”看数据

传统功能上线,你看“准确率”。AI功能上线,你看的是概率分布

  • 同样的问题,用户问10次,回答一致的比例是多少?
  • 有多少次模型输出了“低概率但高风险”的内容(幻觉)?
  • 你调整了Temperature参数之后,用户的“重试”行为有没有变化?

把“模型表现”量化成“概率可控性”,才是AI产品的评估方式。

最后说一句

我见过太多产品经理,一提到大模型就焦虑——“我不懂技术,会不会被淘汰?”

事实恰恰相反。懂算法的工程师不缺,缺的是能把“概率生成”翻译成“产品功能”的人。

工程负责让模型“能说话”。产品负责让模型“说人话”——而且每次都说同一句人话。

你不用成为算法专家,但你得成为那个知道骰子怎么掷、掷给谁、掷几次的人。因为最终用户不在乎你用的是GPT还是Claude,他们只在乎:这东西靠不靠谱。

靠谱,不是“一次准”,是“次次都能在可控范围内准”。

而这,就是产品经理的工作。

本文由 @行必将至 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!