Featured image of post Jev 模型全面开放,新用户注册送5美金

Jev 模型全面开放,新用户注册送5美金

TypeSafe AI 的 Jev 全面开放注册:它不生成任何文字,只输出带校准概率的类型化判定,定位为 System One 决策模型。本文讲清楚 Jev 和主流大模型的区别、Choice / Score / Noul 三种问题类型、RLCD 训练方法,以及它的价格、延迟和适用边界。

Jev 模型全面开放,新用户注册送5美金

就是刚不久, TypeSafe AIX 上发布最近爆火的大模型 jev 向所有用户开放,不再需要申请后补名单,并且新用户注册还送5美金。

体验注册地址 console.typesafe.ai

Jev 模型介绍

Jev 不是又一个聊天模型,它不生成任何文字,只输出带概率的结构化判定。官方给这一类起了个名字 —— System One Model(系统一模型)

名字和定位都挺讲究:

  • Jev 取自 19 世纪经济学家杰文斯(Jevons)。杰文斯悖论讲的是:蒸汽机效率提升让煤变便宜,结果煤的用量不降反增。TypeSafe 借它说自己的逻辑 —— 智能成本暴跌,换来的不是账单变小,而是判断次数暴涨。
  • System One 借的是卡尼曼《思考,快与慢》的框架:系统一是快、直觉,系统二是慢、深思。他们想把“快判断”单独做成一类模型。

团队背景也有点意思。创始人 Diogo Almeida 是前 OpenAI 研究员,按他自己的说法,在 OpenAI 参与的那套方法“最后变成了 ChatGPT 背后的研究”。2026 年 9 月 15 日,TypeSafe 带着 Jev 走出隐身模式,同一天公布 $40M 种子轮,DCVC 领投。一个帮模型学会“讨好人类”的人,回头做了个明确放弃生成文本的模型 —— 这个反差本身就很值得琢磨。

官方给的一句话概括是:前沿智能的函数调用 —— 非结构化状态输入,类型化概率决策输出

它跟主流大模型差在哪

维度主流 LLMSystem One + Jev
训练目标RLHF / RLVRRLCD(Reinforcement Learning for Calibrated Decisions)
输入非结构化文本,偏重连续对话消息非结构化数据,偏重结构化程序状态
输出字符串,还得再解析、再校验,也可能跑偏类型化结构值,类型错误率 0%
采样方式自回归,一个 token 一个 token 顺序生成自研 parallel sampler,一次前向计算并行出全部结果
价格输入 $0.20~$10/百万 token,输出还要再贵约 5 倍输入 $0.042/百万 token,输出免费
延迟端到端 3~329 秒端到端 70~500 毫秒
置信度就算问了也普遍过度自信、不稳定每个输出都带校准置信度

这里面 RLCD 是关键。RLHF 优化的是“人类更喜欢看哪个回答”,RLVR 优化的是“答案能不能被程序验证对错”,而 RLCD 优化的是两件事:判断对不对,以及模型自己报的置信度诚不诚实。翻译成人话 —— 当模型对一批任务都报 90% 把握时,里面应该差不多真有 90% 是对的。这个性质才是“按阈值自动分流”能成立的前提。

只有三种问题类型

Jev 整个 API 的输出词汇就三个,没有字符串,没有自由 JSON,也没有“说说你的推理过程”这一栏:

  • Choice:从你定义的选项里挑一个,最多 255 个。返回选中的选项、每个选项的概率(加起来等于 1),以及一个 0~1 的置信度。
  • Score:按你定义的有序等级打分,支持 2~10 级。返回每级概率,以及按概率加权出来的分数。
  • Noul:单个 yes/no 判断。只返回一个数 —— 答案为“是”的概率。没有单独的置信度字段,因为这个概率本身就是置信度

这里有个容易混的点:Choice 返回的概率和置信度是两码事,概率告诉你模型倾向哪个答案,置信度告诉你模型该不该被信。一张 85% 归到“技术问题”、置信度 0.82 的工单,直接路由;同样的 85% 但置信度只有 0.31,就该转人工。

调用上就是往 POST /v1/systemone 发一个请求,带上 state(字符串、JSON 对象或文本数组)和 questions(你自定义的 id 到问题定义的映射),模型别名 jev-latest。另外注意它输入只能是文本,图片、音频、视频得先自己转成文字。

快、便宜,而且不会出类型错误

官方首页挂的数字是193.6 倍、便宜 444.6,但得打个折看 —— 官方自己在同一条说明里就写了,这是“真实收益的偏上区间”。配套的评测方法也挺特别:他们不拿一个标准答案去考分类准确率,而是把 GPT-6 AstraFable 5.1 的平均输出当参考答案,让每个模型跑同一套工作流,比谁更接近。另外还有两个挺出圈的演示 —— 用 Jev 打《Doom》(每秒 10 次查询,成本约 $7/小时)和玩 Wikiracing。

“类型错误率 0%”这条倒是真能站住:输出被锁死在预设 schema 里,模型物理上没法吐出一个你没声明的 key 或者你列表外的选项。不过老实说,这点别的模型靠受限解码(constrained decoding)也能做到,真正拿不到的是校准

但它不是便宜的聊天机器人

几个边界得说在前面,不然容易用错地方:

  • 不会生成文本。写文案、写代码、聊天都不行,它是给代码用的,不是给人的。
  • 得先想清楚问题。每次调用前你得把 state 和问题 schema 定义好,自由度换的就是效率和确定性。
  • 有些事它做不到。官方承认它会死抠字面意思,不会数数,也不会比较日期,提示注入照样能左右它的答案。
  • 评测有自评成分。工作流是自家能力团队搭的,参考答案偏向 OpenAI 和 Anthropic 的模型,官网那两个倍数也偏乐观。

所以定位其实很清楚:贵的大模型负责规划、推理这些“慢思考”,高频、原子化的“快判断”丢给 Jev。一次请求并行回答多个独立问题,延迟不随问题数量线性增长。典型落点就是工单路由、内容预筛、风控初筛、Agent 里挑工具和判断要不要收尾这类活儿 —— 把大模型的调用量砍掉一大截。

获取 API KEY

首先打开官方平台地址,这里提供 Google 账号登录或者是邮箱地址登录

登录后,通过面板的左侧就能够看到 API Keys 入口,同时也能够看到这个首页做的也挺有趣的

创建完以后,记得把 API Key 保存下来,因为只会展示一次

在左下角的用户个人配置面板中,能够看到 5 美金到账

体验测试

需要先提前提醒的一点是,当前的 Jev 模型使用的 API 地址是跟以往的不一样的,使用的是 /v1/systemone

官方的文档中,提供了一些调用的例子,也可以看到它跟当前的主流模型的格式也是不一样的

当前最新的模型是 jev-1.13.0,每 100 万 token 收费 0.042 美元,当前是 只对输入收费,输出免费,单次请求上下文最多 64k token(其中 state 占 32k)

在 Playground 上跑一个完整例子

上面讲的是接口格式,但光看格式其实不容易体会到它到底哪里不一样。官方控制台里有个 Playground,不用写一行代码,在网页上就能把整个流程走一遍。

打开 console.typesafe.ai/playground 登录后,要填的就两块:一块放 state,一块加 questions

第一步,填 state

state 就是你手里那段非结构化的原材料,直接粘进去就行。这里拿一条客服留言当例子:

1
我的订单被扣了三次款,申请退款两天了还没人处理,再不解决我就去投诉。

第二步,定义 questions

这一步是跟以前用大模型最不一样的地方 —— 你不是在写提示词,而是在定义一组“判断”。每个判断挑一个类型,三种类型可以随便混搭:

类型你要给的它回你什么
choice一组选项,每个选项说明白是什么意思选了哪个 + 每个选项的概率 + 置信度
score一条有序的等级描述落在第几级 + 每一级的概率 + 置信度
noul一句是非判断答案为“是”的概率(0~1)

我们一次加上三个问题,让它同时回答“该谁处理”“有多急”“要不要转人工”,转换为 json 格式如下:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
{
  "department": {
    "type": "choice",
    "instructions": "这条留言该由哪个团队处理",
    "criteria": {
      "billing": "涉及支付、扣款、账单的问题",
      "technical": "程序报错、功能不正常",
      "complaint": "投诉、维权、要求赔偿"
    }
  },
  "urgency": {
    "type": "score",
    "instructions": "客户有多着急",
    "criteria": [
      "平和,只是在陈述情况",
      "有些不满,但还能好好沟通",
      "非常愤怒,已经提到要投诉"
    ]
  },
  "need_human": {
    "type": "noul",
    "instructions": "这条留言需要人工介入,而不是自动回复"
  }
}

填写完毕的界面如下所示

第三步,看结果。

点一下运行,三个问题是一次并行出结果的,不是问完第一个再问第二个。它在 API 层返回的数据结构是这样的:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
{
  "model": "jev-1.13.0",
  "answers": {
    "department": {
      "type": "choice",
      "choice": "billing",
      "confidence": 0.90,
      "probabilities": { "billing": 0.94, "complaint": 0.06, "technical": 0.0 }
    },
    "urgency": {
      "type": "score",
      "score": 2.0,
      "confidence": 1.0,
      "legend": {
        "0": "平和,只是在陈述情况",
        "1": "有些不满,但还能好好沟通",
        "2": "非常愤怒,已经提到要投诉"
      },
      "probabilities": { "0": 0.0, "1": 0.0, "2": 1.0 }
    },
    "need_human": { "type": "noul", "noul": 0.92 }
  }
}

(真实响应里还会带一个 usage 字段,告诉你这次消耗了多少 token,Playground 界面上没有展示。)

Playground 会把它渲染成下面这种更直观的样子:

对照着看几个细节:

  • department 判成 billing94%,另外两个选项是 6% 和 0%。概率给的是全部选项的完整分布;同时这一条还单独带了个 confidence 90% —— 94% 说的是“在三个选项里更偏向哪个”,90% 说的是“这个判断整体有多可信”,是两回事。
  • urgency 直接顶到 2 of 2、置信度 100%,说明它非常确定客户已经在最愤怒那一档了。
  • need_human 返回 92% truenoul 没有单独的置信度字段,因为这个概率本身就是置信度。
  • 右上角还标着这次调用的耗时 —— 84ms + 433ms,这正是 Jev 的卖点所在:同等级别的判断,前沿大模型通常是以秒计的。

score 返回的不是“第几级”,而是按概率加权的分数。这次它 100% 落在第 2 级,所以分数就是 1.0 × 2 = 2.0;如果分布变成 70% 在第 1 级、30% 在第 2 级,那算出来就是 0.7×1 + 0.3×2 = 1.3,比直接取最高那一级要细腻。

到这里应该能明显感觉到它跟聊天模型的区别了:返回结果里一句话都没有,只有判定、概率和一个置信度。而这三样东西是可以直接塞进 if 语句里的:

1
2
3
department = billing,confidence 90%   → 直接路由给账单组
need_human = 92% true                  → 打上“需人工介入”的标签
urgency    = 2(满分)                  → 优先级提到最高

反过来,同样的事情交给聊天模型:你得先把留言发过去,等它生成一段话,再想办法从那段话里把结构化结果抠出来 —— 要么写正则,要么在提示词里求它返回 JSON,返回之后还得再校验一遍格式。中间任何一环跑偏,整条链路就断了。

这就是 System One 模型想解决的问题:它不是把模型做小,而是干脆把“生成文本”这件事从输出接口里去掉了。

最后

当然,实际项目里没人会这么笨地一条条手动去调。更常见是把它交给 AI Agent ,人只负责用自然语言描述需求,具体怎么问、怎么调,让 agent 自己去搞定。

官方也提供了一些安装教程,例如常用的 Claude Code,两条命令安装即可:

1
2
claude plugin marketplace add typesafe-ai/skills
claude plugin install typesafe@typesafe-ai

使用的时候带上它就行:

1
2
使用 TypeSafe skill,扫描这个项目,找出那些正在用复杂解析、正则或脆弱硬编码
在硬撑的地方,看看能不能换成智能判断。
本博客所有内容无特殊标注均为大卷学长原创内容,复制请保留原文出处。
Built with Hugo
Theme Stack designed by Jimmy