jev.yizhou.chat

TypeSafe AI · System One · model id typesafe-ai/jev

Decisions,
not strings.

Jev 不是聊天机器人。它吃非结构化 state,吐出类型化概率决策——Noul(是否)/ Choice(多选一)/ Score(量表)。给软件用的前沿智能函数调用:像代码,不像对话。

RLCD calibrated decisions 并行一次答完所有题 schema 内无法越界输出 命名 ← Kahneman System One · Jevons

01 · official high-end

更快、更便宜——但先看脚注。

官网英雄数字来自 TypeSafe 自建 System One 工作流评测。博客承认偏高位;落到你的任务,以实测为准。下面三格只复述可核验声明。

workflow · typesafe.ai

193.6×

更快 · 另称 444.6× 更便宜(同套工作流)

end-to-end latency · blog

70–500ms

相对 frontier LLM 常见 3–329s;同类查询约 40×–200×

input price · site / docs

$0.042

/ 百万 input tokens(=$42 / 十亿);输出价官方称 too cheap to meter

脚注:193.6× / 444.6× 为官方自建工作流高位,非「平均线上效果」。相对 Claude Fable 5.1 输入价官网另写约 238× 更低。来源:typesafe.ai 首页与发布博文(2026-09)。

02 · more like code

typed evaluate,不是 prompt 散文。

问题写进 schema:boolean / choice / score。答案带回 probability 与 confidence。代码决定阈值——敢不敢自动做,是工程问题,不是文案问题。

run.mjs · experimental_evaluate · typesafe-ai/jev
// Vercel AI Gateway · zero-data-retention 可选
import { experimental_evaluate as evaluate } from 'ai';

const result = await evaluate({
  model: 'typesafe-ai/jev',
  state: { ticket, holdings_posture },
  questions: {
    worth_research: {
      type: 'boolean',
      instructions: '是否值得开独立研究(不是下单)',
    },
    theme_bucket: {
      type: 'choice',
      criteria: { 存储: '…', AI算力: '…', 其他: '证据不足' },
    },
    confidence: { type: 'score', criteria: ['弱', '中', '强'] },
  },
});

// 低信心或冲突 → observe_only(闸门在你的代码里)

示意片段,非完整生产脚本。真实接入见 docs.typesafe.ai 与 AI SDK evaluate。

03 · complement, not replace

LLM 写与想;Jev 判与分流。

典型 LLM strings

  • 优化:RLHF / 人类偏好
  • 输出:字符串,需解析校验
  • 采样:自回归逐 token
  • 角色:对话、生成、agent 主循环
  • 风险:可能编造字段 / 格式越界

Jev decisions

  • 优化:RLCD / 校准决策
  • 输出:类型值 + 概率 + confidence
  • 采样:并行一次答完所有问题
  • 角色:代码里的智能 if / 路由 / 打分
  • 边界:schema 内无法越界(≠ 永不判错)

对比表据官方发布材料整理。诚实写法:不会越 schema,但仍可能判错——靠 confidence 升级人工。

04 · patterns

最佳实践,写短一点。

  • 01
    Speculative fan-out

    一次请求塞入所有独立问题;加题几乎不加延迟。Docs cookbook:13 问合并相对串行约 12.2× 成本 / 10× 延迟优势(长 state 时最明显)。

  • 02
    Confidence-gated routing

    答案说「是什么」,confidence 说「敢不敢自动做」。只读可低门槛;破坏性操作约 >0.85–0.9 才自动。按动作设阈值,不设万能阈值。

  • 03
    问题怎么写

    一题一判断;criteria 写情境不写程度词;Choice 留 other;state 只送决策字段;数学/计数留给代码。先 shadow 一周,再放开低风险自动化。

来源:docs.typesafe.ai Patterns / cookbooks;Flavio、LangChain、DEV 实践文一致复述。

05 · TechCrunch named only

具名引用,不编造推文。

「it is the only one that hands back a real probability which makes it ideal for automating workflows!!」

Nikhil Mudholkar · Bryo AI CTO · TechCrunch 2026-09-18

Vercel 工程师 Pranit Sharma:用 Jev 替换原安全命令分类路径后,快 5–18×,且更准。

Pranit Sharma · Vercel · 同上 TechCrunch

Armin Ronacher:50% 当抛硬币丢掉,95% 才敢用;并看好用 Jev 做 model routing。

Armin Ronacher · Earendil CTO · 同上 TechCrunch

「We have lightning in a bottle, and yet it is not useful… computers speak a different language.」

Diogo Almeida · TypeSafe 创始人 · TechCrunch 访谈

仅使用 TechCrunch 具名引用。未拉取到原文的社交帖一律不写。

06 · trend + CTA

观察:决策层正在类目化。

System One 成为 agent 环里的廉价判断层——路由、guardrail、工具风险分级。Jevons 叙事:智能单价下降 → 每用户动作背后成千上万次静默决策。评测压力仍在:区分官方 workflow Pareto 与你的业务 A/B。

去源头,或先本地 evaluate。

等待列表与文档在 TypeSafe;模型也可经 Vercel AI Gateway 以 typesafe-ai/jev 调用。本站只做中文速览,不托管密钥。

趋势便签

  • 决策模型作 LLM 旁路
  • 多模态 / 更多 System One 变体(Almeida / TC)
  • 竞品与开源零样本分类器跟进(HN)
  • SDK:官方 · AI Gateway · LangChain

硬闸门:本页无经营数据、无下单、无发帖。上传 COS 前缀前须一舟确认桶名 + 左手过闸 DNS/证。