人工智能的世界里,时不时地会有新的事物在新模型的不断发布中涌现。上周看到了 Jev TypeSafe AI 的第一个“System One”模型。它不像普通法学硕士那样与用户交谈,而是严格设计用于评估语句和出于编程目的做出决策。
Jev 是前 OpenAI 工程师 Diogo Almeida 的创意,他是 ChatGPT 主要训练方法的共同编写者。根据 TypeSafe 的数学计算,Jev 应该比 GPT-6 Astra 等前沿人工智能模型更快、更高效,高出几个数量级,据称速度最高可达 194 倍,成本也最高可达 445 倍。这就是为什么该公司将犹太人的每美元智力描述为“破纪录”,尽管只有实际使用才能证明这一点。
TypeSafe 表示造成这种情况的主要原因有两个。首先,System One 的模型经过校准决策自我强化学习 (RLCD) 的训练,并专注于生成结构化响应而不是生成散文。然后,可能因为不需要先前的上下文,可以在同一查询中处理各个查询 连同与法学硕士连续文本生成不同。
新视频来自汤姆的装备
当您申请常规法学硕士时,您将收到公开文本聊天; Jev 只回答具体问题,所有这些问题的回答都带有置信度。它是为代码而构建的,因此也是为使用的机器而构建的。您的代码通过提供状态(给定情况及其关联数据)并要求 Jev 评估特定语句来与 Jev 的 API 进行交互。状态是按个人提供的,没有全局数据库或缓存。
例如,公司可能会向 Jev 展示客户的信用卡交易列表、一些基本的客户帐户信息、客户最后写的内容以及问题“客户想要退款吗?”答案是“是”或“否”,并带有置信度。如果置信度高于 85%,您可以询问客户他们更喜欢哪种方法,可以选择“退货”、“商店信用”或“不清楚”。然后,Jev 提供每个回报选项的概率分布。然后,您的代码可能会尝试处理退款或要求进一步说明。
Jev 输出(以及可选的输入)采用预定义的数据格式,本质上是纯 JSON。与处理法学硕士不同,这里没有无关紧要的词语、冗长的思考,也不需要要求模型简洁。同样,不需要全局上下文查询或缓存内存来经常尝试并鼓励 LLM 表现得至少是确定性的。除了提供状态和查询之外,输入解析、日期操作或数据库读取等操作仍保留在您自己的代码中,Jev 不关心。
乍一看,这可能看起来像是 LLM 的更简单的界面,但实际上却有很大不同。 Jev 不需要甚至不想要导致该问题的所有上下文 – 提供无关信息实际上会降低准确性,并且上下文窗口仅限于区区 64,000 个字符。由于机器人总是产生一定百分比的置信度,因此它不会像聊天机器人那样凭空创建语句和信息而产生幻觉。
开发人员(而不是 Jev)负责根据响应的可靠性因素做出决策。 Jev 仍然可能对数据进行错误分类,成为对抗性攻击的受害者,或者以字面意义而非字面意义做出响应。
预计 Jev(可能还有 System One 的未来模型)最常见的用例将是围绕已发布的问题组装逻辑工作流程,因为始终拥有置信度因素可以轻松地将其集成到诸如“如果我们绝对确定用户请求退款并且他们更喜欢商店信用,并且我们看到他们也在 2008 年 9 月购物过。5090”之类的决策步骤中。文档还有其他使用模式,例如意图路由或引文测试。
Jev 的优势不在于像代理人一样行事或关注广泛的问题 – TypeSafe 明确表示开放式任务更适合 LLM,甚至可能也适合包含 Jev 的代码。一个例子是监控系统,Jev 可以使用提供的数据来评估是否存在严重的系统问题,如果存在,则提供 LLM 来调查报告、查找原因并生成报告。同样,Jev 没有接受过客户数据的培训,也不会从提供的状态(以及他自己的培训)之外的任何地方进行推断。
我绝不是人工智能工程师,但这是我的开发者观点 如果 Jev 正如承诺的那样聪明地工作,它可以解决人工智能在软件中深度集成的主要障碍之一:处理聊天机器人 LLM,出于实际目的,它们是无定形的块,可以表现或不表现并实现所需的结果 – 没关系。 正确的 产出缓慢且昂贵。拥有一个简单的评估/响应/信任界面,无需特定培训或精心设计的文本压缩即可轻松干净地集成到代码中,这更加自然且易于使用。