“哑巴模型”Jev火了,会给AI产业带来什么改变?

0 评论 615 浏览 0 收藏 10 分钟

当大模型行业还在卷参数、卷榜单时,一个拒绝聊天的模型Jev却悄然走红。它只做判断,不写文章不写代码,却精准击中了Agent时代对速度与成本的焦虑。从OpenAI研究员到反向造模型,Almeida的转身背后,是模型分化趋势的加速,也是Agent入口争夺战的前奏。

Jev模型已经火了一个多星期。从花式玩法讲到底层范式,围绕它的讨论还在继续。

Jev不和人聊天,也不能帮人写文章、写代码,它只做一件事,当开发者给它一组选择和当前状态,它负责给出判断。

做出Jev的Diogo Almeida,曾是OpenAI研究员,参与过InstructGPT、ChatGPT和 GPT-4相关研究。他以前教大模型学会聊天,现在反过来,做了一个拒绝聊天的模型。

Almeida为什么要调转船头?Jev击中了当下大模型行业的哪些焦虑?将能力收窄到极致,又会成为模型行业未来的趋势吗?

有些活,不必惊动最强模型

Jev的走红,首先踩中的是Agent时代最现实的一个问题,模型调用应该要更快、更便宜。

开源项目Browser Use的创始人就拿Jev搭了一个浏览器Agent,在真实的Google Flights页面上查一趟苏黎世到伦敦的机票,整段流程跑完用了7.1 秒,单次成本 0.0039美元,Jev在循环中的中位延迟约为178毫秒。

Jev的价格也足够低,目前Vercel AI Gateway上的Jev输入价格约为每百万token 0.04美元,输出免费,所以开发者能毫无负担地调用。

慢和贵成为行业的共同焦虑,跟Agent正从代码场景向更广泛的办公场景扩散有关。

OpenAI的数据显示,从今年2月到6月,企业每周活跃Codex用户数在法律、销售和招聘、以及市场营销领域增长至原来的108倍、41倍和26倍。

当模型变成持续执行任务的基础设施,调用的频率和Token消耗也会随之增加。模型厂商一边在推高旗舰模型能力上限,另一边面对Agent大规模调用的新需求,也得思考要怎么降低模型调用的成本和延迟。

因此,模型层已经开始出现分化趋势,如今同一家厂商也会推出不同档位、不同价格的模型,出现了flash模型扎堆的现象。

Google在5月推出Gemini 3.5 Flash,瞄准日常开发和工作场景。7月31日,DeepSeek发布 V4 Flash。8月下旬,Qwen3.8-Flash-Next 和 GLM-5.3-Flash又接连亮相。

这些模型未必追求在所有benchmark上做到最高,但也不是把能力砍掉的“阉割版”。它们是为高频、简单任务专门优化出来的新档位,且价格更划算。

以DeepSeek为例,它最近把V4 Flash 更新到V4.1 Flash,还宣布在下一代Pro模型上线前,将V4 Pro的API请求路由到V4.1 Flash,并按Flash的价格计费。

过去,用户遇到任务,第一反应是去找那个最强的通用模型,能力越强越好。厂商的主线,也是把一个旗舰模型做得尽量全能。

但现在,模型厂商开始按照任务的复杂度、调用频率、响应速度和成本等等重新切分能力,推出不同档位,让不同模型承担不同的工作。

这种分化还在继续推进。从使用场景来看,代码、图像、语音这些方向,早就有了专门优化的模型。办公、游戏这些场景,也在慢慢出现更贴合自己的模型。

毕竟不同场景的任务结构、上下文和对速度、成本的要求各不相同,模型也就有了针对具体环节做取舍的空间。

Jev是分化趋势中的一个极端样本

当别的模型还在通用框架里调整能力和价格,Jev干脆把一类能力从通用模型中分离出来,单独做成一个模型。

开发者给Jev一段当前状态,再给一组预设问题,它返回的是 Choice、Score 或 Boolean,附上对应的概率。Jev不解释自己为什么这么选,程序拿到结果,直接就能往下走。

这对Agent来说很重要。在Agent里,模型的输出往往直接决定下一步行动。这时候,系统需要的可能不是一段完整的自然语言回答,而只是一个明确的信号。

这个设计背后,是Almeida对大模型训练方式 RLHF的一个反思。他认为,人类反馈会推动模型生成更符合人类偏好的回答,也容易让模型养成另一种习惯,即面对自己把握不大的问题,仍然倾向给出流畅、完整、笃定的回答。

Jev试图让模型把不确定性写进输出结果里。模型如果判断一件事有八成把握,那么放到长期统计里,它的判断结果就应该接近八成正确。系统拿到这个概率后,可以自行设门槛,把握高的任务自动放行,把握不足的任务转给人,或者转给更强的模型。

不过,让模型实现可靠的自动化决策,是Almeida想要抵达的方向,目前Jev还没走到。

有开发者测试发现,同一个判断,正着问一遍、再反着问一遍,Jev给出的两组概率加起来,有时会超过1。一个校准得当的概率系统,不应该这样。Jev不写自然语言,躲开了编造一段像样答案的风险,可它给出的概率,照样会错。

调用不同模型的Agent入口更加重要

即便Jev还有不少问题,它还是让行业看到了另一种可能性:Agent里的智能也可以被拆开,一项复杂任务不一定由一个通用大模型包办。

例如,需要复杂推理时可调用强模型,大量简单的判断和筛选,则可以交给Jev这样更快、更便宜的模型。

Jev的名字,也有弦外之音。经济学里有个“杰文斯悖论”(Jevons Paradox)的概念,意思是一种技术变得更高效、更便宜之后,使用量反而会增加。那么,当Jev让“判断”这个动作变得更快、更便宜后,Agent就越有可能在执行任务时频繁调用它,从而优化整体任务的效率和成本。

也就是说,任务本身逐渐会成为Agent的核心。按任务来调用不同模型,Agent执行的效率和性价比可能会更高。

模型之间的关系,也因此多了一种可能。模型过去比的是谁更强,一个模型能力上来了,就把上一个替换掉。现在,以任务为核心,不同模型可以各自承担自己更擅长的部分,在同一个Agent里协作。

如果这种分工继续发展,一个能根据任务调用多个模型的Agent入口将会变得更加重要。

已经有Agent产品往这个方向走。国内来看,腾讯WorkBuddy已经支持在不同主流模型之间切换。WorkBuddy还有Auto模式,系统会根据用户任务的类型、复杂度与上下文特征,自动选择当前最适合的模型进行响应。用户在不知道该选择何种模型,或者面对混合型任务时,可以交由系统来决定。

海外的Cursor也在做类似的事情。它在今年8月推出的Cursor Router,会在每个请求交给模型之前,先根据任务类型、复杂度、上下文等信息进行判断,再从多个模型中选择最合适的一个。基本原则是,简单任务交给快速、便宜的模型。困难、长周期的任务则交给前沿模型。

这些产品的思路都是一致的,就是把调度模型这件事交给系统按任务自动完成。用户只管提出任务,至于该派哪个模型上场,交给入口去安排,从而提高Agent使用的效率和降低成本。

长此以往,当模型逐渐走向各司其职,一个能灵活调配它们的Agent入口,将会越来越重要。

作者/萧樱

本文由 @深流研究所 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Pexels,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!