product

Jev 现已登陆 Token Station

Jev 现已在 Token Station 上线,模型标识为 typesafe/jev-1.13.0,typesafe/jev-latest 则始终指向最新版本。TypeSafe 自家平台目前仍在按等待名单逐步放量;而通过 Token Station,你可以用已经在使用的同一个密钥立即调用它,无需排队。

它不生成文本

Jev 是 TypeSafe 推出的首款「System One Model」(系统一模型),这个名字借用自丹尼尔·卡尼曼(Daniel Kahneman)所说的那种快速、直觉式的思维模式。聊天模型读取一段对话并写出回复,而 Jev 读取的是一段状态(纯文本、JSON 对象,或是一组消息构成的数组)以及一组带类型的问题,然后返回带类型的答案:一个概率、一个被选中的选项,或一个分数,每个答案都附带一个置信度数值。TypeSafe 将其描述为一次前沿智能函数调用:输入非结构化的状态,输出带类型的概率性决策。这里没有需要解析的生成文本,因为它根本不生成文本。

在一次发布演示中,TypeSafe 的创始人展示了 Jev 从一个起始维基百科页面出发,仅凭沿途找到的链接一路抵达目标页面:每一跳都有数百到数千个候选链接,每一次选择都不能凭空编造出一个并不存在的链接。这正是 Jev 为之设计的那类高基数决策场景:换作聊天模型给出自由文本答案,事后还得解析并校验,而且很可能根本无法通过校验。

这也是 Token Station 对 Jev 的路由方式与平台上其他模型都不同的原因。Jev 通过自己的端点 /typesafe/v1/systemone 回答请求,而不是走 OpenAI 兼容的聊天路由。如果你把请求发往 /v1/chat/completions、/v1/responses 或 /v1/messages,网关会返回 400 错误,并提示你改用原生端点。Jev 也完全不出现在 OpenAI 兼容的 /v1/models 列表中,它自己的模型目录位于 /typesafe/v1/models。这两点都是刻意为之:一个决策模型如果恰好与聊天模型共用同一套接口格式,正是那种最容易被悄无声息地用错的情况。

三种提问方式

每个请求都会发送一个 state,以及一组带名称的 questions,每个问题都有一个 type。一共有三种类型。

Noul 以概率而非布尔值的形式回答是或否:

curl https://models.bytefuture.ai/typesafe/v1/systemone \
  -H "Authorization: Bearer TOKEN_STATION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "typesafe/jev-1.13.0",
    "state": "Every customer has been unable to sign in for 30 minutes. Please restore service immediately.",
    "questions": {
      "urgent": {
        "type": "noul",
        "instructions": "Does this incident require immediate action?",
        "criteria": {
          "true": "An ongoing service outage needs immediate action",
          "false": "A routine request that can wait"
        }
      }
    }
  }'

Choice 从最多 255 个带标签的选项中选出一个键,并在给出选择的同时,返回覆盖全部选项的概率分布:

curl https://models.bytefuture.ai/typesafe/v1/systemone \
  -H "Authorization: Bearer TOKEN_STATION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "typesafe/jev-1.13.0",
    "state": {
      "ticket": "My card was charged twice for the same invoice. Please refund the duplicate charge.",
      "account": {"plan": "business", "invoice_id": "example-invoice-001"}
    },
    "questions": {
      "team": {
        "type": "choice",
        "instructions": "Which team should handle the ticket?",
        "criteria": {
          "billing": "Invoices, charges and refunds",
          "technical": "Service outages, software bugs and integrations",
          "sales": "New purchases and plan upgrades"
        }
      }
    }
  }'

Score 依据一份包含两到十个等级的有序评分标准对状态进行评分,结果是该标准上一个按概率加权的小数位置,而不是一个整数:

curl https://models.bytefuture.ai/typesafe/v1/systemone \
  -H "Authorization: Bearer TOKEN_STATION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "typesafe/jev-1.13.0",
    "state": [
      {"role": "customer", "content": "The checkout service fails for every customer."},
      {"role": "operator", "content": "Confirmed: all purchases have failed for the last 20 minutes."}
    ],
    "questions": {
      "impact": {
        "type": "score",
        "instructions": "Rate the current operational impact described in these reports.",
        "criteria": [
          "No disruption: all functions work normally",
          "Partial disruption: some customers or functions are affected",
          "Complete outage: a critical function fails for all customers"
        ]
      }
    }
  }'

单次请求可以混合使用全部三种类型,因此对 /typesafe/v1/systemone 的一次调用,就能在一次推理中完成工单路由、严重程度评分,以及是否紧急的判断,而不必拆成三次。

规格

上下文窗口 32,000 tokens
每个问题的 Choice 选项数 最多 255 个
每个问题的 Score 等级数 2 到 10 级
延迟 端到端 70-500ms(TypeSafe 数据)
训练方式 Reinforcement Learning for Calibrated Decisions(RLCD,校准决策强化学习)

定价

输入 输出
Jev $0.042/M 免费

由于实际上没有需要生成的内容,输出端自然也就没有费用。Token Station 上已有的每一款聊天模型,仅输入端的单 token 价格就都比它高,从 GPT-6 Luna 的 $0.10/M 到 Claude Fable 5.1 的 $10/M 不等。Token Station 原价透传 TypeSafe 的费率,不加价。

它真正派上用场的地方

把分类或路由这类决策丢给一个完整的聊天模型去做当然可行,但这意味着要为一个本来就只会是少数几个选项之一的答案,去等待一连串按顺序生成的 token。这种取舍在以下几个场景中体现得尤为直接:

  • 模型路由:在决定一个请求是否真的需要前沿模型之前,先对其难度进行分类,而不是用一次完整的 Opus 级别调用,去区分「重置我的密码」和「迁移我们的计费架构」这两类请求。
  • 工具调用把关:在一次有风险的工具调用(shell 访问、一笔支出、一次删除)执行之前,对其进行批准、拦截或升级处理,并给出一个代码可以直接设阈值判断的置信度分数。
  • RAG 重排序:以足够快的速度为查询与文本块之间的相关性打分,从而对庞大的候选集合进行重排序,把聊天模型的上下文预算留给综合整理,而不是花在搜索上。
  • 工单与请求分诊:按队列、优先级或负责人对大批量、低创造性的流量进行路由,而不必为每一条都开启一次完整对话。
  • 循环与轨迹检查:判断一个智能体刚执行的那一步是否真的取得了进展,尽早叫停一个失控的循环,而不是继续在上面消耗轮次。

TypeSafe 自己的基准测试声称,在这类任务上,相比同类 LLM 最高可达 193.6 倍的速度和 444.6 倍更低的成本,对比基准是 GPT-6 Astra 与 Claude Fable 5.1 的平均水平。这两款模型都已经在 Token Station 上线,如果你想自己验证,只需换一个密钥就能对比。发布周的独立追踪数据则呈现出一个更保守的结果:在数千条用户上报的结果中,中位数大约是快 7 倍、便宜 30 倍,而不是 193 倍和 444 倍。在合适的工作负载上,这仍然是一个实实在在的优势,只是比宣传数字要小一些。

TypeSafe 还将其称为 0% 的幻觉率,在一个狭义的层面上这是准确的:choice 类型的答案会与你提供的 criteria 键进行核对,因此 Jev 不可能返回一个你没有提供过的选项。这保证的是答案有效,而不是答案正确。它本质上是一个输出约束比聊天模型更严格的分类器,仍然值得你用自己的数据,像评估其他任何模型一样去评估它。

开始使用

前往 models.bytefuture.ai 注册:无需绑卡,首次充值可获 100% 匹配、最高 $50 奖励。导出你的密钥,直接向 typesafe/jev-1.13.0 发送你的第一个请求,无需排队等待。

试用 Token Station