节目 从零开始学AI 下一集
第 64 集

Jev:闭嘴的AI更快更便宜

2026-09-18 approximately 7 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!先问你一句,如果有个AI主动说,我不聊天了,你觉得它是变笨了,还是变聪明了?

Sarah

还真有人这么干。前OpenAI研究员Diogo Almeida,隐身两年,新公司TypeSafe推出了第一个模型Jev。它放弃了自由说话,一上线就有2400万人围观。

Mike

先把概念讲清楚。普通大模型是怎么干活的?它是一个字一个字往外写的,每个词都要等上一个词,这叫自回归。你让它做判断,它也得先写一段话。

Sarah

程序要的其实只是几个字段。比如一封用户邮件,是不是投诉,紧不紧急,转给哪个部门。大模型写完一大段,程序还得再读一遍,把答案抠出来。

Mike

Jev把写话这步砍掉了。你提前定好要哪几个字段,它直接给结构化答案,还附上每个答案的概率。比如投诉92%、退款5%、咨询3%,三个答案同时出来。

Sarah

这里有个关键概念,叫校准。打个比方,就像天气预报说明天90%下雨,报10次得有9次真下,才叫准。Jev专门练的就是这个,让它报出的概率和真实把握对得上。

Mike

对上了有什么用?程序就能写规则了。95%以上直接执行,70%交给更强的模型,40%送给人类。AI变成程序里的一个模糊if语句,随叫随到。

Sarah

概念齐了,看新闻。Almeida什么来头?2022年InstructGPT论文的共同作者之一,还参与过早期RLHF和GPT-4。可以说,今天AI会听人话会聊天,他是最早的参与者之一。

Mike

离开之后他想了四年一个问题,聊天能力真是软件自动化需要的核心能力吗?现在他的答案是,也许AI根本不需要这么爱说话。

Sarah

数字相当夸张。官方博客说,端到端响应70到500毫秒,输入价每百万Token 0.042美元,输出目前免费。自家工作流评测里,最快快了193.6倍,最省省了444.6倍。

Mike

自家评测先打个问号,好在外部实测也不差。Every的评测负责人Mike Taylor拿它查了37篇文档,一口气做777次判断,总共不到0.7秒。

Sarah

其中一项写作质量判断,Jev用了约0.35秒,Fable 5.1用了8.83秒,快了约25倍,成本低了约580倍。至少在高度结构化的判断题上,效率曲线确实惊人。

Mike

方法也值得说。TypeSafe给训练方法起了个新名字,RLCD,面向校准决策的强化学习,就是在回应RLHF。RLHF是让人类投票,训练模型生成更受人喜欢的答案。

Sarah

RLCD换了目标,不讨好人,要诚实。一个聊天助手遇到不确定的事,可以写几段很完整的回答。但每天自动跑几百万次的工作流,更想知道答案是什么,这个答案有多确定。

Mike

再说那个最有争议的宣传,零幻觉。先澄清,此幻觉非彼幻觉。我们常说的幻觉,是编出不存在的人名论文。TypeSafe说的,是模型生成了程序没定义过的输出。

Sarah

举个例子,程序只允许投诉、退款、咨询三个选项,普通模型可能突然回一个严重投诉,还加一大段解释。人看着只是啰嗦,自动化系统直接不知道怎么处理。

Mike

Jev从源头砍掉这种可能,所有输出和类型提前定好,只能三选一,不会临时创造第四个。这就是它说的类型安全。官方注明,0%不是测出来的,是靠schema匹配保证的。

Sarah

那我们熟悉的编假话问题呢?也有关系。大模型最初学的就是预测下一个词,训练数据没附真假标签,加上答错和说不知道都拿不到分,模型就学会了硬猜。

Mike

OpenAI去年专门研究过这个。更麻烦的是,模型内部有51%还是99%的把握,输出都可能变成同样一句,答案是A。Jev想把不确定本身也交出来,让系统选执行、升级还是放弃。

Sarah

不过校准不等于不犯错。OpenAI那篇研究提醒过,模型可以每次都答错,但每次都诚实地说我只有0%把握,概率很校准,答案照样全错。

Mike

质疑也来了。Hugging Face研究员Niels Rogge吐槽,一个JSON分类器有1200万浏览?我们正处在泡沫里。现在浏览量已经到2400万了。

Sarah

发布不到一天,开发者Harsha Gundala用Qwen2.5-1B做了个类似版本,多个JSON字段并行判断,直接算概率,还强调不需要任何新训练。原话很挑衅,他们隐身两年,我隐身两小时。

Mike

总结下来三点,并行结构化输出不新鲜,零幻觉偷换了定义,RLCD的训练细节、奖励函数和系统校准指标都还没公开。

Sarah

但有意思的是,这些质疑反而证明了另一件事。如果两小时加一个1B小模型就能做到,那恰恰说明这类能力根本不需要又贵又大的模型。

Mike

这就是Jev真正想聊的。过去几年我们习惯把所有任务扔给通用大模型,对有的任务来说,有点杀鸡用牛刀。它主动放弃聊天写作,只留下自动化真正需要的东西。

Sarah

它也不刷榜单,不拼能力上限,而是贴地飞行,盯着真实工作流里数量大、重复多、对延迟和成本敏感的问题,把等待时间和Token省下来。

Mike

所以一个看起来不炫的JSON分类器拿了2400万浏览。证明模型够强是一种吸引人,证明模型恰好够用、解决了每天都会遇到的问题,可能是另一种。

Sarah

教AI说话的人,最后教AI闭嘴,这反转本身就值得听一期。把这期转给那个每天被AI账单刺痛的朋友吧。

Mike

感谢收听从零开始学AI,下期见!

Sarah

下期见!

已复制