Jev新决策模型的试用心得

0 评论 338 浏览 4 收藏 18 分钟

今天刷到一个新出的模型叫 Jev,怪在它不会写字。你给它一段话,它不回话,给的是一个分数、一个概率或者一个 yes/no 的判断。作者为了给自建的知识图谱系统补一个决策模块去充了点钱,玩了一天,聊了聊 vibe coding 为什么让人累。

今天刷到一个新出的模型叫 Jev,看完介绍我直接去 OpenRouter 充了点钱。不是为了追什么新出的 GPT 或者 Claude,就是为了试这个怪东西。

这个模型有点怪。

怪到什么程度呢,它不会写字。

你没看错。一个 AI 模型,它不会写文章,不会写代码,不会跟你聊天。你给它一段话,它不给你回一段话。它给你的是什么呢,是一个分数,或者一个概率,或者一个 yes/no 的判断。

我当时看到这个介绍的时候,第一反应是,那这玩意有啥用?

但我还是充了钱。因为我最近在搞自己的知识图谱系统,正好缺一个做流程决策的模块。我寻思,就当买个玩具玩玩。

结果玩了一天,分享下我的感触。

说真的,我不知道你们有没有这种感觉。就是你用 Cursor 或者 Claude Code 写代码,写着写着突然就累了。

不是身体累,是一种脑子转不动的累。

你明明就是在跟 AI 对话,让它帮你写代码,你只需要说几句话,为什么会累成狗?

我之前一直以为是我自己菜。直到我看到 Jev 这个模型,我突然想明白了一件事。

你以为你在让 AI 帮你干活?其实没有。

它只是在根据你的上下文,一个字一个字地往下编。编出来的东西像那么回事,但它根本不知道自己在干嘛。

所以你为什么累?因为你一直在替它做决策。

它写了一段代码,你得读一遍,判断对不对。它给了一个方案,你得想想到底靠不靠谱。它说「我觉得应该这么做」,你得琢磨琢磨,它真的觉得吗,还是它只是概率上最可能这么说。

这个成本是巨大的。

而且最恶心的是什么,你判断它靠不靠谱的时候,你也不知道自己判断得对不对。

这就是为什么 vibe coding 到后期会让人特别疲惫。你不是在创造,你是在当一个永远审不完稿的编辑。

说起来你可能不信,用免费国产模型干活,能把你气到心梗,比用 Cursor 累十倍。

上周我为了省点钱,找了个免费的国产模型帮我做数据分析。数据明明摆那儿了,趋势清清楚楚,它非说这是数据系统偏差,是采样误差,是各种外部因素导致的假象。

我跟它掰扯了一下午。从上午十点到下午三点,我一遍一遍给它喂数据,一遍一遍跟它解释这个趋势为什么是真的,不是偏差。它每一次都认错,说「你说得对,我重新分析一下」,然后下一轮又绕回去了。

等它终于认了这个规律是真的,我整个人已经精疲力竭了。

不是身体累,是那种「我为什么要跟一个 AI 吵一下午架」的荒谬感。

你说它蠢吧,它又能写出像模像样的分析报告。你说它聪明吧,它连数据里明摆着的规律都认不出来,非得你手把手教它。

这种累,比写代码累多了。

01 Jev是什么

那 Jev 是干嘛的呢?

它就是来干这个决策活的。

简单说一下它的机制。现在的大模型,不管是 GPT 还是 Claude 还是什么,说到底都是在做一件事,根据前面的文字,预测下一个字最可能是什么。

这个过程叫自回归生成。训练的时候用的是 RLHF,人类反馈强化学习。

啥意思呢,就是人类给模型打分,说这个回答好那个回答不好,模型慢慢就学会了,什么样的输出人类会喜欢。

所以你骂它,它会道歉。不是它真的觉得错了,是它从训练数据里学到了,人类骂它的时候,道歉是概率最高的回应。

这里面有很多共情的逻辑在里面。模型学会了怎么说话让人类舒服,怎么回应让人类觉得被理解。这也是为什么你跟它聊天的时候会觉得它「很懂你」。

但 Jev 不是这么玩的。

Jev 用的是 RLCD,决策强化学习。它不生成文字。你给它一个状态,比如「用户买了东西但是缺货了」,再给它几个选项,比如「取消订单」「延迟发货」「换个替代品」,它直接告诉你,每个选项的概率是多少。

它不是在编故事。它是在做判断。

你问它「这个工单紧急吗」,它不说「根据我的分析,这个工单确实比较紧急,因为用户提到了三天没收到货」。它直接给你一个数字,0.95。

意思是 95% 概率是紧急的。

就这么简单。

说到这个,我突然想到卡尼曼在《思考快与慢》里聊过的系统一和系统二。

系统一是快思考,直觉的,下意识的,不用动脑子。系统二是慢思考,理性的,需要坐下来仔细算的。

之前的大模型,不管包装成什么,其实都是系统二那一路的。它是在「思考」,在组织语言,在生成内容。虽然这个思考说到底是概率模拟,但形式上是慢的,是需要你等的。

Jev 走的是系统一这条路。它不思考,它直接反应。70 毫秒到 500 毫秒,给你一个判断结果。

这也是为什么他们管 Jev 叫「System One Model」。不是随便起的名字,是真的在对标人类的直觉决策。

你想想看,人类在公司里做的绝大多数决策,其实都是系统一的。看到一个工单,扫一眼标题,知道该转哪个部门。看到一个订单,看一眼金额,知道风险高不高。

这些决策不需要长篇大论的分析,就是一个快速的判断。

但之前的 AI 模型,做这些事的时候,都得绕一大圈。先生成一段分析文字,再写个结论,你再从结论里把判断抠出来。

绕了一大圈,还容易出错。

Jev 直接把中间那一大圈省了。

02 Jev的能力和价格

价格也便宜得离谱。

输入是 0.042 美元一百万 token,输出不要钱。

对,输出不要钱。因为它根本不输出什么文字,就输出几个数字,能有多少成本。

它只能输出三种东西。

  1. 是非题,给你一个 0 到 1 之间的概率。比如「这个用户是不是要退款」,直接告诉你 0.92。
  2. 选择题,你给它几个选项,它告诉你每个选项的概率分布。比如「这个工单该转哪个部门」,财务 87%,技术 11%,销售 2%。
  3. 评分题,你给它一个量表,它告诉你打几分,置信度多少。比如「这个客户的愤怒程度」,打 1.2 分,置信度 0.94。

就这三种。没了。

你想让它写一首诗?不行。你想让它写一段代码?不行。它就是个决策机器。

03 实际使用体验

我自己接进去之后,试了一个场景。

我在搞自己的知识图谱,本体轮的那种,就是把业务流程抽象成实体和关系。比如「订单」是一个实体,「库存」是另一个实体,它们之间有「占用」「缺货」这种关系。

之前这个系统最大的问题是什么呢,就是遇到异常情况的时候,比如缺货了,它不知道该走哪个流程。

是取消订单呢,还是跟用户商量换个东西,还是延迟发货?

之前我是写死的规则。缺货率超过多少就取消,低于多少就延迟。但这种硬编码的规则很死板,实际业务情况复杂得多。

我就把 Jev 接进去了。

具体怎么做的呢,知识图谱做多跳查询的时候,遇到缺货的节点,把当前的状态传给 Jev。状态里包括什么呢,订单金额,用户等级,缺货的商品占比,用户之前有没有投诉过,等等。

然后给 Jev 三个选项,取消订单,延迟发货,推荐替代品。

你猜怎么着。

Jev 给取消订单打了 0.87 的概率,延迟发货 0.11,替代品 0.02。

而且置信度很高,0.94。

我当时就觉得,嗯,这判断挺合理的。因为那个订单金额不高,用户等级也普通,缺货占比还挺大的。

然后知识图谱就根据 Jev 的决策,走了取消订单的 loop 流程,自动执行了退款,发了通知。

整个过程,没有人介入。

下面这个是我查询低于安全库存应该如何处理的结果

识别的结论,其中jev的处理判断

这是对多条动作链做的判断

我当时盯着屏幕看了好半天。

不是因为这个功能多酷,是因为我突然意识到,这个东西的思路跟我之前想的完全不一样。

你发现没有。

之前的 AI 模型,不管多强,它都是在输出内容。内容是给人看的。人看完内容,自己做决策。

这个过程里,AI 是个秘书,你是老板。秘书给你一堆材料,你自己拍板。

但秘书给的材料越多,你做决策的成本就越高。

Jev 不一样。它不是秘书,它是那个替你拍板的人。或者说,它是一个决策引擎。

它不给你看材料,它直接告诉你结果。

而且它给的结果是带概率的。置信度低的时候,你再人工介入。置信度高的时候,直接自动化。

这一下就把人类从无限的决策疲劳里解放出来了。

04 Jev和知识图谱的适配性

我为什么觉得这个东西跟本体论特别搭呢。

你想想看,本体论是什么,是把世界抽象成确定性的实体和关系。桌子就是桌子,椅子就是椅子,它们之间的关系是确定的。

但现实世界是模糊的。一个用户到底算高价值还是普通,这个订单到底该取消还是延迟,这些都是模糊的。

之前的知识图谱系统,模糊的部分只能靠人来填。或者靠写死的规则来硬凑。

Jev 刚好填了这个缺口。它在模糊的地方给出确定性的判断。

一个负责确定性的结构,一个负责模糊地带的决策。合在一起,就是一个能真正跑业务的系统。

虽然我们不知道 Jev 里面的核心推理链是什么,但从输出的结果来看,它一定是有决策思维链在里面的。它不是瞎猜的,它是在做加权,在做评估,在做权衡。

这种东西,才是企业真正需要的。

05 Jev为什么适合企业

这也是为什么我觉得这个模型特别适合企业用。

企业要的是什么?不是创造力,不是文采,是确定性。

你做一个客服系统,你不需要它写一首诗赞美客户。你需要它准确判断这个工单是不是紧急的,该转哪个部门,是不是要退款。

你做一个风控系统,你不需要它写一段很感人的拒贷理由。你需要它准确判断这个用户的风险是高还是低,概率是多少。

这些场景里,你要的就是一个分。一个概率。一个判断。

而不是一大段看着很有道理但其实你还得自己琢磨的文字。

之前的大模型在这些场景里用起来特别扭。为啥,因为它输出的是文字,你还得写个解析器去把文字里的判断抠出来。抠出来还不一定准。

Jev 直接给你结构化的判断。没有解析的问题,没有格式错误的问题,没有「我觉得应该是这样但我也不确定」的问题。

就是干。

06 总结与展望

当然,我也不是说 Jev 就完美了。

它现在还很早期,模型版本才 1.13,能做的事情也很有限。上下文只有 32k,也不能做多轮对话,也不能输出复杂的结构化内容。

但方向我觉得是对的。

我们之前一直在追求让 AI 更像人,能写能说能聊。但企业真正需要的,可能不是一个像人的 AI,而是一个不会犯错的决策机器。

确定性,比多样性重要。

这话说出来可能有点政治不正确。但你想想看,你做一个公司,你真的需要你的客服机器人每次用不同的方式道歉吗?你真的需要你的风控模型每次给你一段不一样的分析吗?

不需要。

你需要的是,同样的情况,给出同样的判断。而且这个判断是校准过的,80% 概率就是真的有 80% 的准确度。

这才是企业级该有的样子。

我自己玩了这几天的感受就是,Jev 的思维模式,跟我一直想做的那种知识图谱加自动化决策的系统,简直是天作之合。

它不跟你扯别的。它就给你一个分数。你拿这个分数去驱动后面的流程就行。

简单,直接,确定性。

加强了确定性,减少了多样性。听起来好像很无聊,但这恰恰是企业最需要的基本能力。

我之前在想,为什么之前的 AI 在企业里总是用着用着就卡住了。不是技术不行,是它输出的东西太软了。一段文字,一个建议,你得自己消化,自己决策,自己判断靠不靠谱。

企业要的不是建议,是结论。是那种可以直接喂给下一个系统的、结构化的、带置信度的结论。

Jev 刚好踩在这个点上。

希望后面这个模型能继续长大,能支持更复杂的决策场景,能接更多的工具,能做更长的推理链。

说不定以后,真的会出现那种,你给它一个业务流程,它从头到尾帮你把决策都做了,人只需要在置信度低的地方露个面就行。

那种感觉应该挺爽的。

至少,我不用再当那个永远审不完稿的人了。

本文由人人都是产品经理作者【产品老高】,微信公众号:【产品老高】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载

题图来自Unsplash,基于 CC0 协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!