
深度解析GEV-26B-Decide24槽位决策头与单Token概率读取如何45毫秒完成一次决策【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是一个基于 Gemma-4-26B-A4B-it26B 参数、每 token 约激活 4B的开源决策模型它不生成文字答案而是通过24 槽位决策头在一次前向传播约 45 ms中直接输出每个选项的校准概率分布。再叠加自适应思考adaptive thinking机制模型只在信心不足时才慢思考。本文面向新手用最少代码讲清这两项核心机制的底层原理与使用方式 决策模型 vs 聊天大模型为什么用概率代替答案普通聊天模型要逐 token 生成文字答案埋在文字里还要靠解析。GEV-26B-Decide 走的是另一条路模式做什么输出System 1一次前向传播完成类型化决策是/否、2–256 选 1、0–5 打分支持文本和图片256K 上下文每个选项一个校准概率自适应思考thinking: auto先 System 1领先选项置信度 0.8 时System 2 推理并折回校准概率System 2未经修改的 Gemma-4 基座可逐步思考文本 / 推理关键点模型不生成任何 token。概率来自最后一层隐状态的直接读取所以快B200 上单请求中位 45 ms、64 并发 257 次决策/秒且概率经过校准ECE 仅 0.035——我说 0.9 把握就真的约 9 成对这对用置信度门控自动决策至关重要。核心机制一24 槽位决策头是怎么划分的 决策头是一个极小的线性层hidden 2816 → 24 槽位fp32权重仅 head.safetensors 一个文件proj.weight [24, 2816]proj.bias [24]。24 个槽位按题型切分布局由 judge_config.json 定义槽位范围题型kind槽位含义verbalizers0–2noul是/否false/true2–8score打分0/1/2/3/4/58–24choice多选一A–P共 16 个选项字母这种槽位制带来三个好处一次读取覆盖全部题型——同一个头切不同区间即可无需换模型未使用的槽位直接掩码——例如只问 4 选 1 时只有 A–D 四个槽位参与 softmaxlogits 做软限幅——像 Gemma 自身的 final-logit softcap 一样用30·tanh(z/30)压平极端值softcap: 30.0保证概率分布稳定不发散。此外每个题型有独立的温度系数见 calibration.jsonnoul1.003、choice1.017、score0.999。logits 除以该温度后再 softmax使输出的概率名副其实——这是校准工程也是它敢被用于自动决策门控的底气。核心机制二单 Token 概率读取全程零生成 ⚡所谓单 Token 概率读取指模型只计算最后一个 token 的隐状态从它一次性读出整个概率分布绝不进入逐 token 生成循环。transformers 直读路径原理最直观按固定模板拼提示[kind] … [state] … [question] … [options] A) … [decision]:模板bare-v1前缀bos取[decision]:后最后 token 的 final-norm 隐状态过 24 槽位线性头按题型切槽位区间 → 掩码非活跃槽位 → 除以该题型温度 → softmax即得各选项概率。vLLM 生产路径serve_decide.py更巧妙决策头被实现为一个挂在lm_head上的 LoRAadapter_vllm/ 中的lm_headLoRA 骨干 LoRA模块名jev-decision。服务端把下一个 token 的限制范围锁定在选项字母对应的词表 id 上allowed_token_ids/logprob_token_ids读回这些 token 的 logprob再加上 decision_head.json 里的槽位 bias、除以温度就精确复现了直读路径的分布——用 vLLM 的推理栈拿到与 transformers 一致的输出300 条抽检最大概率差 0.015。一句话总结choice题读的是A/B/C…这些字母 token 的下一 token 概率noul题读 false/truescore题读 0–5。选项文字本身从不被生成只作为上下文参与一次前向传播。超过 16 个选项怎么办choice最多接受 256 个选项默认strategy: tournament先按每组 ≤16 个并行读取A–P 是训练过的原生标签各组冠军 高分候补组成 ≤16 人的决赛再读一次两级概率合并归一每个选项都被读取、无一剪枝实现见 serve_decide.py。零样本意图分类实测59 选项 91.2%、150 选项 95.5%、255 选项 89.0%。自适应思考只在不确定时才慢下来 thinking: auto时执行三步serve_decide.py快速分布System 1 一次前向得到 p1不确定才思考p1 领先选项 阈值 0.8可配→ System 2 以 Gemma-4 思考模式对同一状态/问题/选项推理think_budget控制思考 token 上限折回概率思考通道关闭后答案字母分布 p2 一步读出最终p ½·p1 ½·p2。为什么要五五开p2 单独使用接近 one-hot、过度自信等权混合既保留了推理的准确性又守住了 System 1 的校准性混合后 ECE 仍为 0.035。效果1,754 题验证集数据集System 1自适应思考实际动脑比例AQuA-RAT数学应用题68.189.053.9%LogiQA逻辑推理55.380.363.7%OpenBookQA科学94.396.314.7%全部 1,754 题73.383.447.8%代价是时间不思考时零开销思考时约每秒 250 tokenB2008,192-token 的思考最长约 33 s推测解码可到 438 token/s。完整数据见 reports/decision_index_adaptive.json 与 reports/adaptive_latency_summary.json。快速上手两条命令 一个接口 git clone https://gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh # vLLM 起在 :8000需单卡 ≥80 GBserve.sh 会同时服务两套能力OpenAI 标准端点System 2与自定义的POST /v1/decideSystem 1 自适应思考。发一个决策请求curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball., question: How much does the ball cost?, options: [$0.10, $0.05, $1.00, $0.55], thinking: auto}返回即含options、probabilities、choice与思考统计GET /v1/decide/info可查默认阈值、温度与策略。关键文件速查表文件作用judge_config.json24 槽位布局、verbalizer id、softcap、读取方式head.safetensors24 槽位决策头权重2816 → 24calibration.json / calibration_gold.json各题型温度默认 / 按真值校准门控自动动作建议用 goldadapter/ · adapter_vllm/System 1 的 LoRAtransformers 版 / vLLM 版后者含 lm_head LoRAserve_decide.py · serve.sh带/v1/decide的 vLLM 服务端model-00001-of-00002.safetensors 等未修改的 Gemma-4 基座System 2支持图文reports/决策指数、延迟、思考游戏等评测明细适用边界与选型建议 开思考科学、代码、数学、逻辑等可逐步验证的推理题GPQA Diamond 42.9% → 78.6%MMLU-Pro 65.0% → 84.6%关思考分类、检索、工具路由——System 2 可能用过度自信的错答推翻正确的 System 1BANKING77 上 88.0 → 85.0 即为例证教师分布出错时 System 1 可能自信地错HLE 上无思考题仅 1.6% 正确高风险场景务必用置信度门控英文为主图像决策为零样本零样本视觉偏好判断已达 VL-RewardBench 78.4%。一句话收尾24 槽位决策头把答案变成了一次可读取、可校准的概率向量单 Token 读取让一次决策只需一次前向传播——这正是 GEV-26B-Decide 能把推理题做上 90 分、同时把普通决策压进 45 毫秒的底层原因。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考