ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大模型的理解力,用户的解空间:Jev 如何填满一个空白象限

大模型的理解力,用户的解空间:Jev 如何填满一个空白象限 本文首发于我的博客大模型的理解力用户的解空间Jev 如何填满一个空白象限 · 「东玄蟒」你在生产代码里用 LLM 做过分类或路由吗一次调用 3 到 329 秒输出 token 比输入贵 5 倍JSON 解析失败还得重试问模型你有多大把握它永远回答非常确定。这篇文章拆解 2026 年 9 月发布的 TypeSafe AI Jev——一个不生成任何文字的模型——以及它背后的 System One Models 框架。目标读完能在面试里把这条新路线讲清楚包括原理、生态、质疑和机会。问题从哪来“模型聊天早已超人自动化在哪”——这是 TypeSafe 发布博客的第一句话创始人 Diogo Almeida 的执念。他是 RLHF 的共同发明人之一InstructGPT 与 ChatGPT 背后的训练方法就出自他手TechCrunch 报道原话ChatGPT broke Almeida’s heart。他离开 OpenAI 时的判断是问题的根源在于我们优化的是人类语言。人类语言适合对话不适合软件消费——软件要的是类型安全、可校验、带不确定性的结构化输出。于是两年隐身之后TypeSafe 给出第三条后训练路线RLHF人类偏好→ 造就了聊天模型RLVR可验证奖励→ 造就了推理模型RLCD校准决策→ 造就了决策模型官方的一句话定义值得原样记住Jev 是一个frontier-intelligence function call——unstructured state in, typed probabilistic decisions out。非结构化状态进带类型的概率性决策出。命名也各有出处System One 来自卡尼曼《思考快与慢》的系统 1——快、直觉、单步判断Jev 来自经济学家 Jevons取 Jevons 悖论——蒸汽机效率提升后煤的消耗反而上升。成本每降一个数量级用例数量会涨得更多命名即愿景。API 长什么样一个请求由两部分组成state被评判的内容纯文本 / JSON 对象 / 文本数组和questions问题字典。三类问题原语对应三种答案形状原语回答什么返回ChoiceN 选一工单路由到哪个组choice 全选项probabilitiesconfidenceScore在有序等级上打分客户愤怒程度score可落在两级之间 分布 confidenceNoul是非判断消息里是否请求退款noul一个 0 到 1 的概率没有单独 confidence关键工程参数输入 $42/Btok、输出免费70–500ms 延迟限流 250k tokens/s单请求 64k 上下文仅文本输入主要训练语言是英语CJK 精度目前更低——这是官方文档自己承认的。三个设计点比参数更值得记一问一判断。官方反复强调问一个懂行的人一秒钟内能做的判断。分析这封邮件并决定最佳行动不是好问题——那是 System 2 的活该拆成原子问题再用代码组合权重。同请求内所有问题并行评估。加问题几乎不增加延迟只多花几个 token。官方 cookbook 的数据13 个问题合并成一次调用比 13 次单独调用便宜 11.5 倍、快 9.6 倍答案不变。这直接催生了 Speculative Fan-Out 模式——把可能用到的问题全部提前问代码再决定用哪个答案。instructions里用反引号路径引用 state 字段。比如 “Doesticket.messages[0].textrequest a refund?”——问题显式指向结构化状态的某一部分避免模型自己猜上下文。四个设计原理面试核心区并行采样快是结构性的不是调参调出来的自回归模型一次生成一个 token每个 token 依赖前一个——一条串行链走到底。Jev 的输出空间在请求时就定义死了N 个选项、M 个等级模型对整个输出空间做一次前向全部概率并行产出。这是 40–200 倍速度差的结构性来源不是推理框架优化是把生成这件事从任务里删掉了。RLCD校准本身作为训练目标校准的定义给 0.2 概率的答案长期统计里真的该有 20% 命中0.8 就该 80%。文档直指 RLHF 的两个副作用偏好优化会奖励听起来自信的幻觉sycophancy还会引发mode dropping——把分布压窄到单一风格上模型对其他可能的输出概率衰减偏好越强概率分布越不可信。RLCD 把目标换成概率与结果对齐模型失去的是自由文本生成换来的是概率的诚实。Confidence 是概率分布的统计量不是另一个模型输出Choice/Score 的confidence由probabilities直接计算文档交互示例里对三选项用的是(N·峰值概率−1)/(N−1)这种归一化峰值分布越平坦 confidence 越低。官方明确说你并未被锁定在我们的定义上——完整的probabilities都给你了你要更合适的度量可以自己算。这也是它和问 LLM 要置信度的本质区别后者是让模型再生成一段关于自己的文字前者是分布本身的数学性质。零类型错误是构造性保证不是训练得好幻觉是生成器在开放词表上采样的固有属性。Jev 根本没有开放词表——它在你预先定义的选项集合上输出一个分布softmax over options输出不可能落在集合之外就像骰子不可能掷出 7。所以官方敢写这在数学上不可能被证伪。注意边界“不会选错类型不等于不会选错选项”——所以才有 confidence才有置信度门控高置信自动执行、中置信复核确认、低置信转人工或换路。三种软件架构的位置官方把它放在第三种架构里传统软件是简单原理组成的复杂决策树LLM agent 是模型接管控制流、每圈都可能脱轨AI-powered software 是代码持有工作流模型只出现在需要可编程常识的窄缝里。Guard 框架的读者应该对这个定位很熟悉——这正是模型即工具调用点、循环归属代码的极端化。理解力 × 解空间一张图看懂四种技术前面四节讲的是 Jev 的零件。这一节讲我自己把零件串起来的那根线——想通它前面所有为什么会同时塌缩成同一个答案。四个我们熟悉的技术其实只有两根轴理解力能不能吃进没见过的自然语言和解空间的归属答案集合是谁定的。技术理解力解空间归属输出形态if-else无——语言进不去它的世界程序员写死分支跳转垃圾邮件过滤器传统分类器有但有限被训练数据焊死——选项跟着权重一起烧进模型两个固定标签的概率Jev大模型级encoder 的阅读力每次请求的用户——选项是 HTTP 请求发出去那瞬间才出现的用户定义的选项集合上的概率分布LLM最强模型自己放飞——通过逐 token 组合可以拼出任何内容自由文本序列用一句话给 Jev 定位大模型的理解力 用户自由决定的解空间。Jev 干的事是把 state材料和每个选项都投影到同一个语义空间里量距离距离近的选项分数高——“在用户的解空间中做投影”。这句话一旦立住前面所有结论自动成立为什么快 100 倍解空间是 3 个选项输出就只有 3 个数——没有序列要生成串行链长度从 312 步变 1 步为什么输出免费3 个数不是 token 流没有可计费的生成量为什么零类型错误答案物理上被圈死在你的选项里想错格式都没有那条通道为什么 confidence 可算分布就摊在这 3 个数上峰值多尖一眼看出不用问模型有没有把握为什么传统分类器换个选项就胡说八道它的解空间被训练时的数据焊死了新选项投影不进它唯一认得的那几个孔——所以每个新业务都要重训Jev 的选项跟着请求走训练学的是对任何给过来的映射当场算出来这个通用能力不是任何具体的映射四层楼画成一张图Jev 站的那个角落——强理解力 用户解空间——在它之前是个空白象限if-else 和分类器是旧时代在理解力纵轴上的挣扎LLM 是这个象限的错过理解力够了解空间扔了。Jev 不是更聪明的模型是第一个站进这个空象限的模型。快的账本省的是生成不是理解一次前向这四个字容易让人误会 Jev 连理解都省了。实际账本HF 复刻项目 M4 Max 实测值得摊开看串行步数耗时自回归 LLM 输出 312 token 的 JSON312 次前向1900msJev 风格编码 state 28 个字段打分1 次前向prefill 52ms 打分 18ms70ms两边读的是同一份材料材料长编码照样重——prefill 那 52ms 谁都躲不掉。省掉的只有把答案写成文字那一段。所以 Jev 的延迟结构是总耗时 ≈ 编码 state 的时间随材料长度线性涨 打分时间选项再多也几乎不涨。它的延迟天花板 你的输入长度而输入长度是你可以控制的——这就是它敢做每帧一次的实时 agent 的原因。串行到底是谁造成的写作文不能跳着写不是纸不够长是第 51 个字的语义挂在前面 50 个字上——P(t₅₁|t₁…t₅₀) 的定义里就含着前文。串行是生成这个动作的定义自带的不是计算量问题LLM 慢在写答案不在读题Jev 不是读得快是压根不写。而 LLaDA 那条扩散式路线和 Jev 的分界同样落在这两根轴上LLaDA 是把生成并行化——mask 填空位置之间无因果依赖整句同时出但它仍然在造内容Jev 是把生成消除——不造内容只对既有假设分配信念。一个是 inference 加速一个是任务改写。即便 Jev 底层真是 masked 扩散预训练fork 旁证扩散也只是它的训练遗骸不是它的运行时——选项打分一次前向即终止没有逐步去噪的对象。n² 的账本不串行但昂贵理解这层的钥匙是分清算的顺序和等的顺序。n 个 token 的 attention 矩阵有 n² 个两两关系但token_5 的分数不需要等待 token_9 的结果——scores[5][9] 和 scores[9][5]、scores[1][300] 和 scores[8000][12] 彼此都不依赖。QK^T 这一亿个格子被 GPU 切成小块撒到几千个核上同时乘加。从头到尾说的是矩阵的形状不是计算的时间顺序。真正的串行只有两处且 Jev 一处都不占便宜成本量级属性Jev vs LLM单次前向计算量n²attention 矩阵并行——GPU 同一瞬间铺开相同两边都付层间串行层数约 32串行但短相同两边都付token 间串行输出长度可到 312串行且长LLM 独有Jev 归零三种成本画在一条时间线上最直观——Jev 和 LLM 共享前两段差别全在第三段所以 n² 的问题从来不是慢串行而是三个具体瓶颈显存墙——n100k 时一层 attention 矩阵物化要 40GBH100 才 80GB。FlashAttention 不是把 n² 计算变少是不把整个矩阵物化到显存边算边用显存从 O(n²) 压回 O(n)吞吐墙——工业并发下每个请求都付自己的 n²GPU 的 FLOPs 被摊薄单请求延迟不涨但排队涨成本墙——n² 是每 token 前向的乘加量直接乘电费乘卡价串行链决定单个答案多久出来n² 决定这个生意做不做得起。这三种成本混在一起谈就会糊涂拆开看就清楚了这里还有一层对 Jev 特别要命的账KV Cache 在它的地盘上近乎失业。LLM 世界的 system prompt 字节级稳定、缓存命中Jev 世界的 state 每次请求都全新每张工单、每帧 DOM 快照都不一样缓存基本必 miss——prefill 的 n² 是它每次调用都实打实要付的过路费没有任何捷径。所以官方文档把只发相关上下文列为头号军规本质是在同时压延迟天花板和 n² 成本地板state 越短这门生意越赚。而 state 里什么是信号什么是噪声模板、寒暄、系统日志只有懂业务的人知道——这也是传统后端经验能直接平移进 Jev 时代的地方。底层结构官方没说的社区在做什么官方对架构守口如瓶。TechCrunch 的表述是tight-lipped外部观察者怀疑构建在开源权重 LLM 之上。可查的旁证typesafe-ai 组织 fork 了 LLaDA人大 ML-GSAI 的扩散语言模型官方实现和 vLLMHN 评论区有高赞指出 vLLM 的一个 PR 支持Jev 模式的 DiffusionGemma单次决策约 0.2s。扩散式语言模型天然就是并行解码器——这条社区推断官方从未确认目前证据链最完整。三个开源项目让这条路线可以摸到jevlikevinnylarouge发布 1 天后出现1k star——独立实现的入门架构每个选项编码为 query 向量 → 对上下文 token 做 attention 得到该选项专属的上下文向量 → 共享打分头算出分 → softmax 出分布。作者诚实标注Wikispeedia 下一步点击预测上 26–29% 准确率对照组 8%8 选项场景一次前向比小 decoder 快约 100 倍但未达到与 Jev 同等质量也不是 Jev 的复刻。Parallel Constrained DecodingHF Space——Apple Silicon MLX Qwen2.5-1.5B对多字段 JSON schema 并行评估M4 Max 上 5.6–7.0 倍加速、100% schema 有效、逐字段校准置信度。证明并行受约束解码用现成小模型就能做出来差距在训练。jev-ultrafastbrowser-use 官方10.5k star——最能说明用途上限的例子浏览器 agent 的动作空间做成动态索引元素表每帧 DOM 快照产出编号控件列表Jev 选操作和目标元素小 LLM 只在TYPE_TEXT时生成文字。苏黎世→伦敦航班搜索 7.1 秒完成含打字和加载等待浏览器协议调用从 1092 降到 101 次。模型的输出永远不变成选择器、坐标或可执行代码——执行器只认观察到过的 DOM 节点这是结构化输出带来的安全性质。学术谱系上它不是凭空出现的GLiNER双向编码器做零样本实体抽取3.8k star早已证明编码器 选项打分可以零样本结构化输出LLaDA 系列含 inclusionAI 的 2.0 版证明扩散式 LM 可以并行生成。HN 上还有人贴出 2025 年 3 月的 arXiv 论文PPO over 序列嵌入输出转化概率自认一年前就做了同构的事。Jev 的增量不在点子而在通用零样本 概率校准 工程化 API三件事同时做到——这正好是面试里这想法早就有人做质疑的标准答案。市场验证与质疑清单来自 TechCrunch 报道的真实案例Vercel 用 Jev 替换 OpenAI 的命令安全分类器快 5–18 倍且更准Bryo AI 对比 Gemini 做邮件分类Gemini 略准但贵 10–20 倍其 CTO 最看重的反而是唯一返回真实概率的模型。PiEarendil的 Armin Ronacher 给了两条用例——用 Jev 监控 LLM agent 轨迹防越狱用 agent 监控 agent 太贵、做模型路由的实时分诊同时给了一句最锋利的批评“它把幻觉问题部分外包给了用户”——0.5 概率是硬币用不用这个答案是调用方的责任。发布帖在 HN 拿到 1921 赞 504 评论质疑集中在四处面试时值得替面试官问出来没有论文、没有权重、没有 live demo——“RLCD 和并行采样没有任何技术支撑全是营销词汇”。对比口径——“70ms vs 329 秒拿的是推理模型满档输出拿纯分类小模型比差距没这么大。官方博客自己也承认这些是我们预期里偏高端的数字”。Benchmark 全是自建的 workflow evals参考答案是 GPT-6 Astra 与 Fable 5.1 的平均官方另发一篇《Lies, Damned Lies, and Benchmarks》自陈立场公共榜单已被 benchmaxx他们选择公开 caveat 而不是刷榜。立场可以敬验证只能靠第三方。工程约束——64k 上下文、纯文本、英语主训、invite-only、单一供应商。机会在哪把用例分三层看替换层管道里已有的零样本分类、路由、抽取、打标直接换成 Jev。收益是钱和速度一到两个数量级风险是精度——先跑 system-one-adapter-python官方出的 LLM 后端 drop-in 对比器做 A/B。增强层给现有 LLM 系统当守门员。confidence-gated routing置信度三段门控、agent 轨迹监控、越狱检测、给 LLM 输出做校验打分——用决策模型看住生成模型这是官方叙事里最符合工程直觉的一块。新交互层100ms 级 输出免费让每帧问一次模型变成可承受的交互设计——jev-ultrafast 的浏览器 agent 是第一个完整演示。同样打开的还有实时 UI 决策、搜索式重排。对我自己的场景客服工单审核工单分类路由Choice、申诉结果打分Score、退款请求识别Noul全部落在原生语区且置信度门控天然对应低置信转人工复审的客服流程——这正是申请 waitlist 时填的用例。面试速查卡QJev 和 LLM 的 JSON mode 有什么区别采样方式与约束位置都不同。JSON mode 仍是自回归逐 token 生成语法约束采样一条链走到底中途偏一个 token 前功尽弃概率分布只在词表上、不在你的 schema 上Jev 是一次前向、直接在你的选项集合上输出分布。约束前者是事后围栏后者是构造本身。Q底层架构是什么是 Transformer 吗官方未披露但 Transformer 骨架基本确认TechCrunch 报道口径 “transformer-based”社区复刻全部基于现成 Transformer 改造。社区证据指向开源权重的 encoder 选项打分头 扩散式预训练 RLCD——真正的新东西不在骨架在出口和训练目标。类比LLM 的输出头投影到全量词表Jev 的输出头投影到本次请求的选项集合同一个主干头开在哪决定了输出空间的形状。Q非自回归是 TypeSafe 发明的吗不是这是一条十年的谱系2017 NATICLR 2018 最佳论文为延迟首次提出并行解码 → 2018–2019 Mask-Predict 修补质量 → 2021 D3PM 把扩散搬上离散 token → 2024 SEDD 质量追平自回归 → 2025 LLaDA/Mercury 规模化 → 2026 Jev 产品化。四年一个台阶每个台阶主语都不同FAIR → Cornell → 人大/Inception → TypeSafe。Jev 的原创主张只剩 RLCD 和通用决策 API 这两件事。Qn² 复杂度你怎么看Jev 能躲开吗躲不开但要看清它住在哪个维度n² 是单次前向内部的并行计算量GPU 同时铺开算不增加串行步数它贵在显存物化、吞吐摊薄、每 token 成本不在慢。Jev 每次请求都是全新 state、KV Cache 必 missprefill 的 n² 是每次都要付的过路费——所以它的命门是 state 长度官方只发相关上下文的军规就是在压这个。Q理解编码这一步 Jev 比 LLM 快吗不快两边读同一份材料的 prefill 成本完全一样。Jev 省的只有把答案写成文字那一段token 间串行链。所以 Jev 的延迟天花板 输入材料长度——材料是调用方可控的输出长度是模型方不可控的这就是延迟主导权的转移。Q零幻觉怎么做到的幻觉是开放词表生成的属性Jev 没有开放词表。但要立刻补一句它仍可能选错选项所以核心配套是校准概率与 confidence——零类型错误和零错误是两件事。Q为什么 RLHF 模型的置信度不可信偏好优化奖励讨喜与自信的表述并造成 mode dropping分布压窄模型的文字概率声明与真实命中频率脱钩RLCD 直接把概率与结果对齐当训练目标。Q它是 System 1System 2 的任务怎么办拆。每个问题问一秒钟判断多因素判断拆成多个 Score 在代码里加权组合Composite Scoring 模式控制流始终归代码。Q这想法是不是早就有了单体技术上是的——GLiNER 的零样本抽取、LLaDA 的并行扩散生成、2025 年就有 RL 输出概率的工作。增量在通用零样本 校准 产品化三位一体以及把定价压到输出免费。护城河更可能在 RLCD 训练数据与分布而非架构。Q你会拿它做什么怎么验证替换层跑 adapter A/B 看精度和成本增强层先做 LLM 输出守门风险低、收益明确同时盯 CJK 精度和供应商集中度两个风险。下一步waitlist 通过后先在 Playground 用中文工单样例实测 CJK 精度——这是官方承认的短板也是自己场景的生死线用 system-one-adapter-python 对比现有 LLM 分类管道的成本/延迟/准确率想吃透架构的读 jevlike 的 option-attention head 源码一个周末的量再看 LLaDA 理解扩散式并行解码参考来源发布博客 · 官方文档AI primer、Primitives、Confidence、Models· TechCrunch 报道 · HN 讨论帖 · Antibenchmaxxing · jev-ultrafast关于我东玄蟒个人博客记录 AI Agent 开发转型笔记。觉得有用的话博客里还有整个精读系列。
返回列表