Jev 模型全面开放,新用户注册送5美金
就是刚不久, TypeSafe AI 在 X 上发布最近爆火的大模型 jev 向所有用户开放,不再需要申请后补名单,并且新用户注册还送5美金。

体验注册地址 console.typesafe.ai
Jev 模型介绍
Jev 不是又一个聊天模型,它不生成任何文字,只输出带概率的结构化判定。官方给这一类起了个名字 —— System One Model(系统一模型)。
名字和定位都挺讲究:
- Jev 取自 19 世纪经济学家杰文斯(
Jevons)。杰文斯悖论讲的是:蒸汽机效率提升让煤变便宜,结果煤的用量不降反增。TypeSafe 借它说自己的逻辑 —— 智能成本暴跌,换来的不是账单变小,而是判断次数暴涨。 - System One 借的是卡尼曼《思考,快与慢》的框架:系统一是快、直觉,系统二是慢、深思。他们想把“快判断”单独做成一类模型。
团队背景也有点意思。创始人 Diogo Almeida 是前 OpenAI 研究员,按他自己的说法,在 OpenAI 参与的那套方法“最后变成了 ChatGPT 背后的研究”。2026 年 9 月 15 日,TypeSafe 带着 Jev 走出隐身模式,同一天公布 $40M 种子轮,DCVC 领投。一个帮模型学会“讨好人类”的人,回头做了个明确放弃生成文本的模型 —— 这个反差本身就很值得琢磨。
官方给的一句话概括是:前沿智能的函数调用 —— 非结构化状态输入,类型化概率决策输出。
它跟主流大模型差在哪
| 维度 | 主流 LLM | System One + Jev |
|---|---|---|
| 训练目标 | RLHF / RLVR | RLCD(Reinforcement Learning for Calibrated Decisions) |
| 输入 | 非结构化文本,偏重连续对话消息 | 非结构化数据,偏重结构化程序状态 |
| 输出 | 字符串,还得再解析、再校验,也可能跑偏 | 类型化结构值,类型错误率 0% |
| 采样方式 | 自回归,一个 token 一个 token 顺序生成 | 自研 parallel sampler,一次前向计算并行出全部结果 |
| 价格 | 输入 $0.20~$10/百万 token,输出还要再贵约 5 倍 | 输入 $0.042/百万 token,输出免费 |
| 延迟 | 端到端 3~329 秒 | 端到端 70~500 毫秒 |
| 置信度 | 就算问了也普遍过度自信、不稳定 | 每个输出都带校准置信度 |
这里面 RLCD 是关键。RLHF 优化的是“人类更喜欢看哪个回答”,RLVR 优化的是“答案能不能被程序验证对错”,而 RLCD 优化的是两件事:判断对不对,以及模型自己报的置信度诚不诚实。翻译成人话 —— 当模型对一批任务都报 90% 把握时,里面应该差不多真有 90% 是对的。这个性质才是“按阈值自动分流”能成立的前提。
只有三种问题类型
Jev 整个 API 的输出词汇就三个,没有字符串,没有自由 JSON,也没有“说说你的推理过程”这一栏:
Choice:从你定义的选项里挑一个,最多255个。返回选中的选项、每个选项的概率(加起来等于 1),以及一个0~1的置信度。Score:按你定义的有序等级打分,支持2~10级。返回每级概率,以及按概率加权出来的分数。Noul:单个 yes/no 判断。只返回一个数 —— 答案为“是”的概率。没有单独的置信度字段,因为这个概率本身就是置信度。
这里有个容易混的点:Choice 返回的概率和置信度是两码事,概率告诉你模型倾向哪个答案,置信度告诉你模型该不该被信。一张 85% 归到“技术问题”、置信度 0.82 的工单,直接路由;同样的 85% 但置信度只有 0.31,就该转人工。
调用上就是往 POST /v1/systemone 发一个请求,带上 state(字符串、JSON 对象或文本数组)和 questions(你自定义的 id 到问题定义的映射),模型别名 jev-latest。另外注意它输入只能是文本,图片、音频、视频得先自己转成文字。
快、便宜,而且不会出类型错误
官方首页挂的数字是快 193.6 倍、便宜 444.6 倍,但得打个折看 —— 官方自己在同一条说明里就写了,这是“真实收益的偏上区间”。配套的评测方法也挺特别:他们不拿一个标准答案去考分类准确率,而是把 GPT-6 Astra 和 Fable 5.1 的平均输出当参考答案,让每个模型跑同一套工作流,比谁更接近。另外还有两个挺出圈的演示 —— 用 Jev 打《Doom》(每秒 10 次查询,成本约 $7/小时)和玩 Wikiracing。
“类型错误率 0%”这条倒是真能站住:输出被锁死在预设 schema 里,模型物理上没法吐出一个你没声明的 key 或者你列表外的选项。不过老实说,这点别的模型靠受限解码(constrained decoding)也能做到,真正拿不到的是校准。
但它不是便宜的聊天机器人
几个边界得说在前面,不然容易用错地方:
- 不会生成文本。写文案、写代码、聊天都不行,它是给代码用的,不是给人的。
- 得先想清楚问题。每次调用前你得把
state和问题 schema 定义好,自由度换的就是效率和确定性。 - 有些事它做不到。官方承认它会死抠字面意思,不会数数,也不会比较日期,提示注入照样能左右它的答案。
- 评测有自评成分。工作流是自家能力团队搭的,参考答案偏向 OpenAI 和 Anthropic 的模型,官网那两个倍数也偏乐观。
所以定位其实很清楚:贵的大模型负责规划、推理这些“慢思考”,高频、原子化的“快判断”丢给 Jev。一次请求并行回答多个独立问题,延迟不随问题数量线性增长。典型落点就是工单路由、内容预筛、风控初筛、Agent 里挑工具和判断要不要收尾这类活儿 —— 把大模型的调用量砍掉一大截。
获取 API KEY
首先打开官方平台地址,这里提供 Google 账号登录或者是邮箱地址登录

登录后,通过面板的左侧就能够看到 API Keys 入口,同时也能够看到这个首页做的也挺有趣的

创建完以后,记得把 API Key 保存下来,因为只会展示一次

在左下角的用户个人配置面板中,能够看到 5 美金到账

体验测试
需要先提前提醒的一点是,当前的 Jev 模型使用的 API 地址是跟以往的不一样的,使用的是 /v1/systemone

官方的文档中,提供了一些调用的例子,也可以看到它跟当前的主流模型的格式也是不一样的

当前最新的模型是 jev-1.13.0,每 100 万 token 收费 0.042 美元,当前是 只对输入收费,输出免费,单次请求上下文最多 64k token(其中 state 占 32k)

在 Playground 上跑一个完整例子
上面讲的是接口格式,但光看格式其实不容易体会到它到底哪里不一样。官方控制台里有个 Playground,不用写一行代码,在网页上就能把整个流程走一遍。

打开 console.typesafe.ai/playground 登录后,要填的就两块:一块放 state,一块加 questions。
第一步,填 state。
state 就是你手里那段非结构化的原材料,直接粘进去就行。这里拿一条客服留言当例子:
| |
第二步,定义 questions。
这一步是跟以前用大模型最不一样的地方 —— 你不是在写提示词,而是在定义一组“判断”。每个判断挑一个类型,三种类型可以随便混搭:
| 类型 | 你要给的 | 它回你什么 |
|---|---|---|
choice | 一组选项,每个选项说明白是什么意思 | 选了哪个 + 每个选项的概率 + 置信度 |
score | 一条有序的等级描述 | 落在第几级 + 每一级的概率 + 置信度 |
noul | 一句是非判断 | 答案为“是”的概率(0~1) |
我们一次加上三个问题,让它同时回答“该谁处理”“有多急”“要不要转人工”,转换为 json 格式如下:
| |
填写完毕的界面如下所示

第三步,看结果。
点一下运行,三个问题是一次并行出结果的,不是问完第一个再问第二个。它在 API 层返回的数据结构是这样的:
| |
(真实响应里还会带一个 usage 字段,告诉你这次消耗了多少 token,Playground 界面上没有展示。)
Playground 会把它渲染成下面这种更直观的样子:

对照着看几个细节:
department判成billing、94%,另外两个选项是 6% 和 0%。概率给的是全部选项的完整分布;同时这一条还单独带了个confidence90% —— 94% 说的是“在三个选项里更偏向哪个”,90% 说的是“这个判断整体有多可信”,是两回事。urgency直接顶到 2 of 2、置信度 100%,说明它非常确定客户已经在最愤怒那一档了。need_human返回 92% true。noul没有单独的置信度字段,因为这个概率本身就是置信度。- 右上角还标着这次调用的耗时 ——
84ms + 433ms,这正是 Jev 的卖点所在:同等级别的判断,前沿大模型通常是以秒计的。
score返回的不是“第几级”,而是按概率加权的分数。这次它 100% 落在第 2 级,所以分数就是1.0 × 2 = 2.0;如果分布变成 70% 在第 1 级、30% 在第 2 级,那算出来就是0.7×1 + 0.3×2 = 1.3,比直接取最高那一级要细腻。
到这里应该能明显感觉到它跟聊天模型的区别了:返回结果里一句话都没有,只有判定、概率和一个置信度。而这三样东西是可以直接塞进 if 语句里的:
| |
反过来,同样的事情交给聊天模型:你得先把留言发过去,等它生成一段话,再想办法从那段话里把结构化结果抠出来 —— 要么写正则,要么在提示词里求它返回 JSON,返回之后还得再校验一遍格式。中间任何一环跑偏,整条链路就断了。
这就是 System One 模型想解决的问题:它不是把模型做小,而是干脆把“生成文本”这件事从输出接口里去掉了。
最后
当然,实际项目里没人会这么笨地一条条手动去调。更常见是把它交给 AI Agent ,人只负责用自然语言描述需求,具体怎么问、怎么调,让 agent 自己去搞定。
官方也提供了一些安装教程,例如常用的 Claude Code,两条命令安装即可:
| |
使用的时候带上它就行:
| |
