刚刚,近期备受瞩目的模型 Jev 正式向所有用户开放,不再需要申请候补名单。每位注册用户将自动获得价值 5 美元的额度,折合约 1.2 亿 Token。
Jev 的 Token 消耗远低于传统大模型。据网友实测,百万输入 Token 仅需 0.042 美分,因此赠送的 1.2 亿 Token 足以让用户尽情使用。
体验链接:console.typesafe.ai
在 9 月这个各大模型激烈竞争的时期,即使是 GPT 和 Claude 也无法稳居榜首。最近势头最猛、刷屏全网的模型,却是无法生成完整句子的 Jev。
Jev 的开发者 Diogo Almeida 曾是 OpenAI 的研究员,参与了 ChatGPT 的研发,并提出了基于人类反馈的强化学习算法(RLHF)。
这一算法在某种程度上定义了过去几年大语言模型的发展方向。然而,当这套方法推动整个行业走向繁荣时,Almeida 却对其产生了怀疑。
他表示:“我们有过一次成功的创新,但未能将其转化为真正实用的东西。”
他花了很长时间才意识到问题所在:我们一直在优化人类语言的处理能力……四年间,我们在处理人类语言方面表现出色,但这对于自动化来说并无实际用途,因为计算机使用的是不同的“语言”。
两年前,Almeida 离开 OpenAI,与 Erik Gafni、Sasha Sheng 共同创办了 TypeSafe AI。公司一直处于隐身状态,直到 9 月 15 日才正式亮相,同时带来了两样成果:一是由 DCVC 领投的 4000 万美元种子轮融资,二是他们的首个模型 Jev。
Jev 依然基于 Transformer 架构,但它刻意避开大语言模型路线,不会输出完整句子。
当你向它提供一段程序状态和预先定义好的问题时,它会返回一个类型化的答案,如一个选项、一个分数、一个介于 0 和 1 之间的概率,并附上置信度评分。
TypeSafe 将这种输出称为“校准后的决策”。这也是 Jev 首次进入公众视野时,许多人感到困惑的原因。
截图展示了 Jev 与大语言模型在处理相同请求时的表现对比。
要理解 Jev 的运作方式,不妨先放下大语言模型的思维习惯。以一个客服场景为例:用户发来消息称支付服务连续几天无法连接,已影响生意。此时需要判断:该交给技术还是账务团队,对方的不满程度如何,事情是否紧急。
根据 TypeSafe 的接口设计,同一请求中的问题共享一份输入,但独立并行评估。分类和紧急程度可以同时处理。
具体来说,其输出有三种基本形态。第一种是 Choice,从用户定义的列表中选出一项,最多支持 255 个选项,适用于路由和分类。第二种是 Score,将输入放在用户划定的尺度上打分,用于衡量紧迫程度、质量或风险。第三种是 Noul,本质上是一次是非判断,答案是一个数字,代表该事件为真的概率。
每次回答都会附带完整的概率分布和置信度,结果是强类型化的,无需编写 JSON 提示词、无需额外解析器,也无需担心模型突然输出 Markdown 代码块。
这种方式最直接的好处是节省时间和成本,同时减少自由生成带来的格式错误。TypeSafe 公布的数据显示,Jev 的端到端延迟在 70 至 500 毫秒之间,比同类大语言模型快 20 到 200 倍。
按当前公开价格,输入每十亿 Token 为 42 美元,即每百万 Token 0.042 美元;输出不收费。新增的问题和选项说明仍会占用输入 Token,但不再按生成答案的长度另行收费。
由于用户可以提前定义输出结果,因此模型不会产生幻觉(Jev 不会跳出预先设定的选项范围乱答,但选项范围内答错仍有可能)。
在一场公开的 Ably Pong 演示中,Jev 在 12 秒内做出了 47 次操作决策,而 Gemini、Claude 和 GPT 在同样时间内仅做出两三次,尽管后者在大多数情况下仍给出了正确判断。
在 Ably Pong 演示中,程序直接将游戏中的数字交给 Jev:球的位置、运动方向、球拍的位置,以及球预计到达球拍位置时的纵坐标。Jev 根据这些数字,从“向上、向下、保持不动”三个选项中做出选择。
想借助 Jev 构建可玩的产品,需要游戏程序和实时通信。上述项目由后端负责推进游戏、调用模型,再通过 Ably 将新状态发送给浏览器。也就是说,游戏规则、画面和联网都不是 Jev 生成的,它只被插入到那个反复执行的三选一环节中。
速度带来了应用场景的扩展。Jev 可以用作电脑操作的判断层,指导代理快速执行指令;也可以用于上下文压缩,判断哪些内容是关键信息,从而将上百万 Token 的上下文迅速收窄。
Browser Use 的公开项目 jev-ultrafast,具体实现了浏览器代理。它每访问一个网页,先读取当前可操作的页面元素,整理成带编号的清单:哪些是按钮、输入框,叫什么名字,当前填写了什么。
Jev 接收到这份结构化状态、用户目标以及操作历史。程序给它的选择空间,也由当前页面实际存在的元素动态生成。
以查机票为例,目标可以是“查找苏黎世到伦敦的单程航班,设置指定日期、人数和舱位,出现符合条件的结果后停止”。每一轮,程序会同时问几个问题:下一步应该点击、输入、选择下拉选项,还是等待?如果点击,应该点哪个编号?如果输入,应该填哪个编号?这些问题共享同一份网页状态,但分别作答。
最后程序只采用与实际操作匹配的目标:选择点击,就使用点击目标,其他答案暂时不用。碰到需要输入城市名称时,程序会另行调用一个生成文本的小模型,让它根据目标和当前输入框给出要填写的内容。浏览器执行后,再读取页面的新状态。
Vercel 公司的软件工程师 Pranit Sharma 表示,他的公司曾使用 OpenAI 的 ChatGPT Luna 5.6 运行分类器,以检查命令安全性。当 Vercel 用 Jev 替代 OpenAI 的 Luna 后,处理速度提高了 5 到 18 倍,准确性也大幅提升。
另一位开发者 Bryo AI 的 CTO Nikhil Mudholkar 也对 Jev 和 Gemini 进行了测试,评估它们在分类商业邮件方面的表现。在他的测试中,Gemini 的准确率略高,但成本高出 10 到 20 倍。
我们也可以按此思路自行搭建:先准备一张表,每行包含邮件标题、正文、收到时间和必要上下文。然后将业务拆解成几道明确的问题。例如,一封写着“订单被重复扣款,希望今天处理”的邮件,可以用 Choice 判断应进入售后、销售、合作还是其他队列;用 Noul 判断发件人是否明确要求采取行动;再用 Score 判断处理优先级。
“归根结底,这种方式将幻觉问题的处理责任稍微转移到了用户身上,”Earendil 公司的 CTO Armin Ronacher 解释道。“用户需要决定:如果这种情况出现的概率只有 50%,那或许可以忽略它。但如果概率达到 95%,那我就可以利用它了。”
Ronacher 表示,Jev 的另一个潜在应用是模型路由。预测某个任务是否需要特定模型很有用,但使用大型语言模型完成这一任务成本高昂。而 Jev 成本低廉且运行速度快,因此能够实现实时路由功能。
Jev 这个名字取自 19 世纪的经济学家 William Stanley Jevons。Jevons 提出的悖论指出,当某种商品成本下降时,该商品会被更广泛地使用。在这种情况下,智力成本下降应导致智力的广泛应用。也就是说,调用一旦变便宜,就会被用在更多原本不值得动用的地方。Almeida 显然对这个类比很满意,他设想的未来不是几个庞大应用垄断一切,而是大量微小的智能判断分散在各处运行,“更像早期互联网的样子,而不是现在人们努力搭建的那种大型应用”。
TypeSafe 至今未公开 Jev 的具体架构,外界普遍猜测它是在某个开源大语言模型的基础上改造而来。公司将其称为 System One Models,取自卡尼曼关于直觉思维的概念,强调它依靠直觉判断而非推理链条,并且是针对具体任务专门调校的。
官方建议将复杂判断拆解成几个明确问题,再由代码组合,而不是让模型包办一切。Almeida 透露,他很早就预判到自己会走上处理合成数据这条路,“这或许是我这辈子做过最明智的决定,比公司上市还明智,甚至比依赖真实人类反馈还明智。”
目前市面上采用这种路线的公司只有 TypeSafe 一家,但 Ronacher 预计,随着这种模式的实用价值逐渐被验证,跟进者会陆续出现。TypeSafe 也计划围绕不同场景推出更多版本模型。
被问到公司是否算得上一家前沿实验室时,Almeida 说:“前沿实验室的主要产物要么是恐惧,要么是炒作,我希望我们的主要产品是智慧。我们不属于那种一门心思创造无限财富,或者搞宗教式叙事,或者试图在数据中心里造神的实验室。”
Jev 上线后,需求量一度超出预期,API 短暂无法正常响应。有人用它做小众信息流的筛选,读取过去三天的相关帖子,提出八个问题,运行时间约两秒,单次成本 0.007 美元,用于剔除诱饵内容和隐藏广告。也有团队将其接入整套营销分析流程,扫描 Meta 广告库、比较不同广告格式的存活周期、在拍摄前评估创意脚本的竞争力,把原本需要人工完成的判断提速了 30 倍,成本压到 3 美元以内。AI 少说了很多话,软件却多做了几件事。如需了解更详细信息,可访问亚博官网入口。
本文来自微信公众号“APPSO”,作者:发现明日产品的 APPSO,36氪经授权发布。