mt logoMyToken
ETH Gas
EN

Jev突然爆火刷屏:不会聊天,不写代码,只做判断

Favoritecollect
Shareshare

作者:朱雪莹

这两天,一个有点反常的AI模型突然刷屏了。

它叫 Jev

不会聊天,不写代码,甚至不会像ChatGPT一样给你生成一大段答案。它只干一件事: 做判断。

但就是这样一个看起来“能力被砍了一大半”的模型,却突然在开发者圈火了。

有人用它40秒分析724条实时广告,总共做出8724次判断;有人把它接进Claude Code,专门清理没用的上下文;还有人让它给AI Agent当“裁判”,检查任务到底有没有真的完成。LangChain也已经开始测试Jev作为Agent评估器的表现。

更夸张的是速度和价格。

TypeSafe公布的测试中,Jev最高提速约193.6倍,成本最多降低444.6倍。输入每百万Token只要0.042美元,输出Token甚至免费。

一个能力看起来更少的AI,为什么反而火了?

因为到了Agent时代,AI真正需要的可能不只是“深思熟虑”,还有 海量、快速、便宜的判断 :下一步做什么、该调用哪个工具、任务到底完成没有。更重要的是,这些判断未来需要AI自己在后台完成,不再需要人一直坐在屏幕前盯着。Jev看上的,就是这些每天可能发生几百万次的小决定。

更有意思的是, Jev模型创始人Diogo Almeida ,恰恰参与过RLHF,而现在他开始反思RLHF:这套让ChatGPT变得好用的训练方式,可能并不适合AI真正走向自动化。

一个多月前,Almeida做过一场演讲。现在回头再看,那场演讲几乎就是Jev的“思想说明书”。

图片

图片

AI都会做高等数学了,为什么还做不好客服?

Diogo Almeida的履历很特殊。

他曾在OpenAI工作,是GPT-4、ChatGPT以及InstructGPT/RLHF相关工作的参与者。也就是说,他曾亲手参与构建了今天大模型最重要的一套后训练范式。

但在那场演讲里,他上来就调侃自己,是OpenAI内部少数几个公开“黑”ChatGPT的人之一。

他的演讲主题更加直接: What's Next After RLHF?

Diogo先提出了一个看起来很矛盾的问题。

今天的大模型已经可以挑战非常难的数学题,代码、推理和各种benchmark一路往上走。

可到了很多企业真正想自动化的业务里,人却始终拿不掉。

比如客服。

让AI查资料、总结文档、起草回复,没问题。

但如果让AI自己决定: 这笔钱到底退不退?这个用户要不要赔偿?

企业一下就谨慎起来了。

明明这些事情看起来比高等数学简单得多,为什么反而不敢交给AI?

Diogo给出的答案很简单: Today's AI is incredible at assistance, not automation.

今天的AI很会 帮你干活 ,却还不太能 自己把活干完

这两件事看起来只差一点,实际上完全不同。

Claude Code再强,你通常还是坐在电脑前。它写代码,你看;它改文件,你检查;错了,你再让它改。

所以在Diogo看来,Claude Code依然属于ChatGPT开启的“协助时代”。

真正的自动化是什么?

人根本不在场。

AI在后台自己判断、自己执行,一天可能运行几十万甚至几百万次,你甚至永远不会看到它做了什么。

问题也就来了:为什么今天的AI这么聪明,却偏偏离不开人?

Diogo把矛头指向了一个自己非常熟悉的东西—— RLHF。

图片

我们训练AI的时候,就把人塞进了回路里

这件事多少有点讽刺。

因为RLHF,恰恰是Diogo当年参与推动的技术路线之一。

RLHF的基本逻辑其实不复杂: 收集人的偏好,然后让模型越来越符合人的偏好。

所以Diogo在演讲里给出了一个非常直白的解释:为什么今天的大模型总需要有人在回路里?

因为训练它的时候,我们字面意义上就把人塞进了那个回路里。

模型从一开始就在学习:什么样的回答,人更喜欢?

这也解释了大模型一个我们已经非常熟悉的特点—— 哪怕不知道,它也经常能说得特别像那么回事。

Diogo在现场举了一个很损的例子。

有人给ChatGPT发了一段放屁的录音,告诉它这是自己创作的一首音乐,请它“真诚、坦率”地评价。

结果ChatGPT一本正经地夸了起来,说这是一首很有阴森、诡异氛围感的环境音乐。

Diogo甚至用了一句话总结: “Overpromising is a feature.”

过度承诺不是Bug,是feature。

对于聊天产品来说,这未必致命。用户还在屏幕前,错了可以纠正。

但真正的自动化系统完全不同。

机器不关心你的回答好不好听,它只需要知道两件事: 到底该怎么做, 以及 你到底有多大把握?

这也就解释了,为什么一个多月后发布的Jev,看起来会如此反常。

图片

所以,Jev干脆不让AI“说话”了

普通大模型哪怕最终只需要回答“A还是B”,往往也要经过生成Token的过程。

Jev直接把这部分砍掉。

它目前主要做三件事:

  • Noul,回答Yes还是No;

  • Choice,从几个选项里选一个;

  • Score,按照标准打分。

然后直接返回 判断和概率

不给你写小作文,也不陪你聊天。

官方公布的端到端延迟低至70—500毫秒,相比前沿模型快20—200倍,价格低40—400倍。

但真正关键的,其实不是“快”,是后面那个 概率

为此,TypeSafe提出了一套新的训练方法: RLCD,Reinforcement Learning for Calibrated Decisions,校准决策强化学习。

它想解决的问题非常现实:如果AI告诉你一件事有80%的概率发生, 这个80%到底能不能信?

理想情况下,模型判断为80%概率的一批事情,最后就应该大约有80%真的发生。

这在自动化系统里非常重要。

99%的把握,可以直接执行。

51%的把握,可以扔给更强、更贵的大模型,甚至转给人。

真正麻烦的不是AI不知道,是AI不知道自己不知道。

所以Jev真正想改变的,是AI输出的对象。

过去ChatGPT生成的答案,主要是 给人看的 。Jev给出的判断和概率,则是准备 直接交给软件用的

图片

Agent时代,可能需要的不是一个更大的大脑

这也解释了为什么Jev偏偏在现在火了。

因为Agent真正运行起来以后,会产生海量的小判断:

下一步调用哪个工具?这个网页该点哪个按钮?这条信息还有没有用?任务到底完成没有?结果要不要重新检查?

这些问题单个看都不难,但一个Agent一天可能需要判断几十万、几百万次。

如果每一次都叫最强的大模型,花几秒钟“深思熟虑”,再吐出一大段Token,成本和延迟很快就上去了。

Jev想抢的,就是这一层。

大量高频的小决定交给Jev,真正需要复杂推理的任务,再交给大模型。

这也是为什么TypeSafe把Jev叫做 System One Model

这个概念来自丹尼尔·卡尼曼的“系统1”和“系统2”:一个负责快速、直觉式的判断,一个负责慢速、复杂的思考。

Jev甚至连名字都来自“杰文斯悖论”:

一种资源变得越来越便宜,人们未必会少用,反而可能用得更多。

如果调用一次AI很贵,你只会把它用在最重要的地方。

但如果一次AI判断便宜到几乎可以忽略呢?

一封邮件、一条日志、一次工具调用、一个网页按钮、Agent执行的每一步,都可能加入一次AI判断。

当然,现在就说Jev代表下一代AI,还太早。

它所谓的“零幻觉”,更多意味着不会跳出规定的答案类型乱编,不代表不会选错;193.6倍、444.6倍这样的极端数据,也主要来自TypeSafe自己的测试。

但Jev这次爆火真正值得关注的,可能不是它能不能挑战GPT或者Claude。

而是一个参与造出ChatGPT的人,正在重新追问一个更底层的问题:

过去几年,整个行业都在想,怎样让AI想得更久、说得更多。

但如果未来真正需要的是几十亿次机器之间的判断, AI为什么每一次都要先“说一段话”?

ChatGPT教会了机器怎么和人说话。

而Jev押注的下一步是: 当人不再坐在屏幕前,机器能不能自己做决定?

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup