TypeSafe发布Jev:放弃文本生成的判断模型

一句话总结:前OpenAI研究员做了个不聊天的模型,只做判断,速度快20到200倍,成本最低到原来的四百分之一;你可以把它理解成民用轿车和叉车的区别,一个什么路都能开,一个只在仓库里搬货,但搬货这件事上又快又便宜。

这个人叫 Diogo Almeida,InstructGPT 的共同作者之一,早年间参与过 RLHF 和 GPT-4 相关工作。离开 OpenAI 隐身两年后,他带着 TypeSafe 的首款 System One Model Jev 回来了,观点很直接:软件自动化要的可能不是聊天,是判断。

结论:快和便宜是真的,但限定条件要先说清

官方给的数字很猛:端到端响应约70到500毫秒,输入每百万 Token 0.042 美元,输出目前免费。内部工作流评测里,最高跑出193.6倍速度优势和444.6倍成本优势

第三方实测也对得上方向。Every 的 Mike Taylor 拿它扫了 37 篇文档、777 次独立判断,总耗时不到 0.7 秒。其中一个写作质量判断任务,Jev 约0.35秒,Fable 5.1 要8.83秒,快约25倍,成本低约580倍

说真的,这组数字有点离谱,但 TypeSafe 自己也打了补丁:这接近现实工作流收益的高位,测试任务来自内部团队,设计偏差不能完全排除。你想啊,判断题越标准,Jev 越占便宜,开放式写作它根本不参赛。具体细节可以回看 TypeSafe 官方介绍Every 的实测记录 核对,引用数字时以原文为准。

它怎么做事:收到邮件不回信,直接打勾

普通模型处理一封用户邮件,流程像写小作文:先读完,再一个字一个字往外写“这封邮件属于投诉,因为……”,程序还得从这段话里把结论抠出来,转成字段才能用。

Jev 把写作文这步砍了。你提前定好要哪几个字段,比如是不是投诉、紧不紧急、转给哪个部门,它读完输入,直接给出类型确定的结构化结果,外加每个结果的概率和置信度。官方的概括是“非结构化进去,带类型的概率决策出来”。

更关键的是并行。传统大模型逐个生成 Token,后一个字要等前一个字;Jev 不写文章不讲解释,多个字段可以并行给出,不用排队等写完。说白了,一个是让 AI 当客服跟你聊天,一个是让 AI 当分诊台护士,只管打勾分流。

RLCD 想解决什么:别只讨人喜欢,要说准把握

Jev 背后的方法叫 RLCD,面向校准决策的强化学习,名字就是冲着 RLHF 去的。

RLHF 你很熟了:人类给几个答案投票,模型学着生成更讨人喜欢的回复。这套方法造出了今天的聊天助手,但 Almeida 的疑问是,讨人喜欢等于干活靠谱吗?

他换了个优化目标:校准。如果模型对一类判断长期说有 90% 把握,那这批判断最好真的对九成左右。这样程序才能写死逻辑:95%以上直接执行,70%左右交给更强模型再看一眼,40%左右直接转人工

TypeSafe 把这叫可组合智能。智能不用每次都变成一段话,它可以像代码里的模糊 if 语句,随叫随到。你可以理解成,以前 AI 是请来一个能说会道的顾问,现在是装了一个知道自己几斤几两的传感器。

零幻觉到底指什么:不是不犯错,是不自创答案

TypeSafe 说 Jev 不会幻觉,第一次看到我愣了一下,此幻觉非彼幻觉。

我们平常说的幻觉,是模型一本正经编出不存在的人名论文。Jev 说的,是另一种让程序员头疼的幻觉:你只给了三个选项,模型偏偏写出第四个。

比如分类只能选投诉、退款、咨询,普通模型理论上能冒出一句“严重投诉”再配一大段解释。人读着还好,程序直接傻眼,下游根本没写处理这个新类别的代码。Jev 的做法很粗暴:不自由生成字符串,只能从预设选项里选,程序没定义的答案,它写不出来。官方甚至注明,这个 0% 不是测出来的,是结构保证的,所以直接记成 0%。

但别误会,这不等于它不犯错。OpenAI 去年专门聊过幻觉的根子:训练只教预测下一个词,不附真假标签,答错和说不知道都拿零分的话,模型宁愿猜一个,也不愿承认不知道。普通模型心里可能是 51% 的把握,说出口却变成斩钉截铁的“答案是 A”。

Jev 想把这层不确定捞回来。它给的不是一句话结论,而是类似“投诉92%、退款5%、咨询3%”的概率分布。最高才 45% 的时候,系统可以不硬上,转给人看一眼。结构保证解决能不能处理,校准概率解决要不要执行,这是两件事。OpenAI 那篇研究也提醒过:模型可以每次答错,同时每次诚实说只有0%把握,校准好不等于答得对。

争议:两小时复刻和泡沫质疑,恰恰说中了重点

Jev 火了之后挨的吐槽也很齐。Hugging Face 的 Niels Rogge 问,一个 JSON 分类器怎么就有上千万浏览,泡沫了吧。开发者 Harsha Gundala 更直接,用 Qwen2.5-1B 做了个类似实现,还开源到了 Hugging Face,意思是不用新训练也能让多个 JSON 字段并行判断。

扒开新名词看,质疑大多落在三点:并行结构化输出不新鲜,0%幻觉换了定义,RLCD 的奖励函数和系统性校准指标还没公开。这些批评,说实话,条条都挺结实。

但有意思的地方也在这里:如果一个 1B 小模型花两小时就能做出类似的并行判断,那直接证明的不是 Jev 没用,而是这类活本来就不需要每次都叫最贵最大的模型。过去几年我们习惯了杀鸡用牛刀,什么分诊打标签路由的小事,全塞给通用大模型。Jev 是把这批数量最大、最无聊、但对延迟和成本最敏感的活单独拎出来,主动放弃聊天写作,只留判断。

怎么理解:它在贴地飞行,不拼上限拼趁手

AI 新品最常见的姿势是刷榜:推理更强、分数更高、上下文更长。Jev 反着来,不拼能力上限,拼刚好够用

它像贴地飞行,不表演高难度动作,专挑真实工作流里每天重复几百万次的小判断下手。一个看起来不炫的分类器拿到上千万围观,恰恰说明大家被又贵又慢的调用账单折磨很久了。

证明模型足够强是一种本事,证明模型在小事上又快又便宜还知道自己几斤几两,是另一种本事。 下次你看到 AI 产品,别只问它多聪明,多问一句:这事非得用大炮打蚊子吗?