一个“不能聊天”的AI模型
Diogo Almeida曾是OpenAI研究员,也是InstructGPT论文的合著者之一。那篇论文所描述的RLHF方法,正是让ChatGPT学会像助手一样回应人类的关键技术。换句话说,Almeida参与塑造了现代对话式AI的基础范式。
但9月15日,他离开OpenAI两年后首次公开亮相时,带来的却是一个完全不会生成文字的模型。
Almeida创办的公司叫TypeSafe AI,总部位于旧金山,已完成4000万美元种子轮融资,由DCVC领投,估值约2亿美元。联合创始人包括Erik Gafni和Sasha Sheng。公司从2024年成立后一直处于隐身状态,直到这次发布才正式亮相。
他发布的产品叫Jev,属于一类被他称为“System One Models”的全新模型家族。名字借自心理学家丹尼尔·卡尼曼的认知理论——系统一对应快速、直觉的决策,与聊天机器人所模仿的缓慢审慎的系统二形成对照。
不生成文本,只输出“代码能直接消费的判断”
Jev的工作方式与传统大语言模型有本质区别。
LLM接到输入后,逐token预测后续内容,最终形成一段供人类阅读的文字。即使要求它输出JSON或固定选项,底层仍在顺序生成token。这套机制适合聊天,但当一个软件系统只需要知道“这笔订单是否异常”时,先等模型写一段文字再解析,就成了不必要的中间环节。
Jev跳过了这个环节。它接收一段结构化状态和一组带类型的问题,直接返回带类型的答案——从预设选项中选择、按评分标准给出分数、或是/否概率,每个答案都附带置信度值。没有自然语言,没有解释,没有代码。
TypeSafe将这种设计称为“机器原生”的智能。Almeida的解释很直接:“大语言模型是为人类阅读而生成文本的。当你需要模型做出一个你的代码将要消费的判断时,这就造成了不匹配”。
这也意味着Jev的“零幻觉”并非训练突破,而是架构使然。所有可能的答案在模型开始工作之前就已指定,它只是在选项之间做选择,没有“生成”这件事。
速度与价格:厂商声称 vs 外部验证
TypeSafe公布的性能数据相当激进。
定价方面,Jev每百万输入token收费0.042美元,输出token免费。作为对比,当前前沿模型的输入价格在每百万0.20至10美元之间。响应时间在70至500毫秒之间,而同等任务下前沿LLM需要3至329秒。
TypeSafe自己的基准测试声称Jev最高比“可比的LLM”快200倍、便宜400倍。
但这些数字需要放在上下文中看待。架构未公开,权重未发布,支撑这些数字的基准是内部工作流评估而非公开排行榜。所有性能声明均来自TypeSafe自身。
目前唯一一项独立测试来自媒体Every。其评测负责人让Jev处理27篇已发表文章和10篇AI风格对照文章,一次性向全部37份文档提出21个问题。结果:不到0.7秒完成777次判断,成本约四分之一美分。第二项测试用12段合成文本接受四项写作检查,Jev中位耗时0.35秒,而Claude Fable 5.1在高强度模式下为8.83秒——速度约快25倍,成本约为其1/580。但准确率方面,Jev抓出了七个植入缺陷中的六个,Claude Fable 5.1七个全中。Every的结论是“不错,但不完美”。

Diogo Almeida
RLCD:教模型知道自己“不知道什么”
Jev背后的训练方法叫RLCD,全称“面向校准决策的强化学习”。
与RLHF优化“人类偏好”不同,RLCD的训练目标聚焦于一件事:让模型精确知道自己对结论应该有多自信。Almeida在发布帖中指出,传统聊天模型的一个核心缺陷是“过度自信”——模型可以95%的时候正确执行任务,却无法标记出那5%的错误。在软件自动化场景中,一个不知道自己在何时可能出错的系统,无法被安全地嵌入生产流程。
Jev能做什么,不能做什么
Jev的定位不是替代ChatGPT。Almeida自己说它“更像一个数据库,而不是一个同事”。
它可以处理的任务包括:在应用内部快速排序请求、给记录打分、筛选另一个AI的输出是否存在越狱风险、做分类和路由、从日志或工单中抽取结构化信息。适用场景是那些软件需要反复做出、但手写规则又过于脆弱的小判断。
它做不了的事同样明确:不生成文字、不解释自己、不基于提示词构建内容、不处理图像。Almeida在发布帖中直言:“不要叫Jev帮你写邮件”。
Jevons悖论与“智能即软件原语”
Jev的名字来自Jevons悖论——某种资源变得越便宜,它就会被使用得越多。TypeSafe赌的是:当一次语义判断的成本降到几乎可以忽略时,软件开发者会把它嵌入到过去根本不会考虑用AI的地方。
DCVC的James Hardiman在投资声明中表述了类似的判断:“Diogo、Erik和Sasha带来了重新思考模型如何为软件而构建的技术深度和信念。他们通往可组合智能的路径,将开启一整代全新的应用”。
Almeida自己的表述更直接:“如果AI要根本性地改变工作的完成方式,人不能是智能的唯一消费者。大部分智能最终应该生活在软件内部,在后台安静地运行”。
这个赌注能否成立,取决于一个尚未被验证的问题:当判断足够便宜时,软件世界到底需要多少个“判断”?如果答案是“很多”,Jev或许真的会成为代码里的一个标准组件;如果答案比预期少,它可能只是一款好用但小众的分类器。TypeSafe目前处于早期访问阶段,等待名单已在官网开放。
(素材来自:TypeSafe AI 智算芯能前沿网综合)
本文由智算芯能前沿网编辑整理,转载请注明出处。
