ChatGPT 伤透了 Diogo Almeida 的心。
Almeida 是一名 OpenAI 研究员,他帮助构建了聊天机器人,然后发明了基于人类反馈的强化学习 (RLHF),这种建模学习技术可能对我们当前的人工智能时代负有最大的责任。但尽管他有机会,他还是感到失望。
“我们的瓶子里有电,但它没有用,”阿尔梅达告诉 TechCrunch。 “从那时起我就一直在努力解决这个问题。我花了一段时间才得出结论:问题在于我们正在针对人类语言进行优化……四年来我们一直非常擅长人类语言,但这对自动化没有用,因为计算机说的是不同的语言。”
两年前,Almeida 离开 OpenAI,创办了 TypeSafe AI,这是一家试图解决这个问题的初创公司。本周该公司发布了一个新的基于 Transformer 的模型 Jev,它不是一个大型语言模型 (LLM)。它不需要文本,而是生成概率,或者该公司所说的“校准决策”。
回避语言有几件事:它使模型极其便宜和快速,并且因为用户预先确定了结果,所以它不会产生幻觉。它的输出代币是免费的,输入代币以百万计,而不是数百万。

开发者对产品非常感兴趣;由于需求如此之高,该公司一度失去了通过其 API 为用户提供服务的能力。 Jev 似乎对软件自动化最有用。到目前为止,软件开发人员认为这是一种将智能融入到代码中的更便宜、更可靠的方法。
例如,构建代理基础设施的 Vercel 公司的软件工程师 Praneet Sharma 表示,他的公司使用 OpenAI 的 ChatGPT Luna 5.6 来管理分类,以审查订单的安全性。当 Versel 用 Jev 取代 OpenAI 的 Luna 时,它产生的速度提高了 5 到 18 倍,结果也更加准确。
另一位开发人员、Bryo AI 首席技术官 Nikhil Mudholkar 测试了 Jev 与 Gemini 的对比,以对商业电子邮件进行分类。在测试中,Gemini 的准确度稍高一些,但价格却贵了 10 到 20 倍。对 Mudholkar 来说更有趣的是 Jev 的置信度分数 – “它是唯一返回真实概率的分数,使其成为工作流程自动化的理想选择!”
除了在某些用例中取代法学硕士之外,新模型还可以增强它们并充当对不当行为的智能检查。 Almeida 表示,使用代理来监控代理可能很快就会变得昂贵,但使用 Jev 来做到这一点是有意义的。他看到用户使用 Jev 来跟踪 LLM 代理跟踪并避免池。
“归根结底,这会给用户带来一些幻觉问题,”Earendil 的首席技术官 Armin Ronacher 说道,该公司是 Pi 开源模型的制造商。 “用户必须说,好吧,如果它只有 50% 的几率返回,也许它是一枚硬币,我会忽略它。但如果它是 95%,当然,我可以用它做点什么。”
Ronacher 说,Jev 的另一个潜在用途是模型路由。预测给定负载是否需要特定模型会很有用,但使用 LLM 的操作成本会很高。 Jev 的低成本和速度使得这种实时分类成为可能。
这就是阿尔梅达的希望。该模型以 19 世纪经济学家威廉·斯坦利·杰文斯 (William Stanley Jevons) 的名字命名,他的同名悖论描述了商品价格下降如何导致更多商品被使用。在这种情况下,勘探成本的下降应该会导致其广泛扩张。
阿尔梅达说:“我们认为智能软件将会出现并传播到各地……早期互联网的普及程度超出你的想象,就像人们现在试图构建的大型应用程序一样。”
阿尔梅达对该模型的架构持批评态度,外部观察人士认为该模型是建立在开放的法学硕士之上的。该公司将 Jev 称为“系统一模型”,专注于正确的任务而不是直觉。阿尔梅达表示,杰夫仅使用一种他称之为“根据校准决策进行强化学习”的方法接受合成数据的训练。
“我们很早就打赌,我们将获得所有数据,这是我一生中做过的最好的赌注之一——在我看来,比我们的初创公司更好,比 RLHF 更好,”他告诉 TechCrunch。 “一半 [our company] 这个实验室基本上拥有统计上易于理解的合成数据的整个子领域,这就是我现在生活的乐趣。”
目前,Jev 是唯一一个这样的模型,但 Ronacher 预计,既然它的实用性众所周知,竞争对手就会出现。
他说:“我们之前应该在很多方面都看到过这一点,但可能是因为法学硕士非常便宜并且有补贴,所以你通常不需要有创造力。”
TypeSafe 本身用新方法制作了更多版本的模型。当被问及 TypeSafe 是否是边境实验室时,阿尔梅达说,“边境实验室的主要产品是恐惧或宣传。我希望我们的主要产品是情报……[but we are] 不是某种意义上的实验室,你知道,就像押注于无限的财富,或宗教,或将上帝建造成数据中心,或当今的任何东西。
当您通过我们文章中的链接进行购买时,我们可能会赚取少量佣金。这并不影响我们的编辑独立性。