
CLM-v0.1-8B为什么是Agent验证器黑马DeepSWE 81.6%与Terminal-Bench 87.6%的SOTA全解析【免费下载链接】CLM-v0.1-8B项目地址: https://ai.gitcode.com/hf_mirrors/Contrastive-LM/CLM-v0.1-8BCLM-v0.1-8BContrastive Language Model是一款专为 Agent 验证器verifier场景打造的对比学习模型冻结 Qwen3-8B 编码器 双投影头微调后在DeepSWE 81.6%、Terminal-Bench 2.1 87.6%双双拿下 SOTA推理速度较 Jev 快 4–6 倍。 CLM-v0.1-8B 是什么给 Agent 装上System One快思考传统大模型更像System Two逐步推理、可靠但慢。而 CLM 走的是System One 路线——不生成文本只对你给出的候选打分看状态、评动作、排优先级一步到位输出概率分布。它天然是 Agent 流水线里那层快速决策/筛选器而不是聊天机器人。️ 架构拆解冻结Qwen3-8B 状态/动作双头InfoNCE从 config.json 可以看到核心规格model_type:clm架构为state/action projection heads (InfoNCE)base_model:Qwen/Qwen3-8Blast-token pooling4096 维嵌入checkpoints: CLM_v0.1-8B.pt设计精髓在于状态头 动作头分离编码编码器整体冻结状态与动作各走一个轻量投影头用双向 InfoNCE 损失联合训练状态/动作向量互不纠缠 → 动作嵌入可缓存复用后面 13× 加速的关键微调时只训练两个小头 → 成本极低README.md 称之为cheap fine-tuning。 训练数据配方60M 问答 30M 难负样本 1M Agent轨迹阶段数据规模作用预训练~60M Nemotron 问答对打底通用理解中训练~30M 合成难负样本学会区分像对但不正确的候选后训练~1M 智能体轨迹对齐真实 Agent 决策场景难负样本是中训练的灵魂验证器最大的敌人不是明显错误而是几乎正确的干扰项。 SOTA成绩解析DeepSWE 81.6% 与 Terminal-Bench 2.1 87.6%以本检查点为起点、只微调头部后DeepSWE81.6%SOTA——软件工程 Agent 验证Terminal-Bench 2.187.6%SOTA——终端任务轨迹判别速度比 Jev快 4–6 倍零样本不微调下同样能打计算机使用、游戏、工具调用任务上与 Jev 持平延迟最高降低 9×。⚡ 快在哪里无自回归 状态/动作缓存13×加速快有两大原因无自回归解码不需要逐 token 生成一次前向即输出概率分布State Action Caching状态与动作分开编码评估上千个候选时状态向量只算一次动作嵌入直接复用——~1k 候选规模下CLM 比 Jev 快 13×。对批量轨迹筛选、best-of-N 方案优选这类高频验证场景这就是实打实的成本与延迟优势。️ 快速上手clm-serve 一键启动Playground安装contrastive-lm包后clm-serve会自动拉取 CLM_v0.1-8B.pt 权重到~/.cache/clm/并附带 Web Playgroundhttp://localhost:8700/可对状态提出 Choice/Score 类问题或对自由候选排序——具体命令见 README.md。如需完整训练/微调源码可克隆仓库git clone https://gitcode.com/hf_mirrors/Contrastive-LM/CLM-v0.1-8B⚠️ 边界与路线图了解局限再选型Encoder-locked头部依赖 Qwen3-8B 的 last-token 嵌入换编码器不可行No generation只能对给定候选打分概率是集合内相对值不能生成文本SOTA 数字来自微调后的头部并非该检查点零样本直接产出通用性CLM-8B 只是规模爬梯的一级更强的多模态CLM-35B据称 10 月初发布✅ 总结生成管想CLM管判把生成模型当裁判又慢又贵CLM-v0.1-8B 用冻结编码器 双头打分的极简设计把验证这一环做到了SOTA 精度 × 数倍速度。如果你的 Agent 系统需要高频评估轨迹、工具调用或 best-of-N 方案这套快思考验证器值得放进工具箱。【免费下载链接】CLM-v0.1-8B项目地址: https://ai.gitcode.com/hf_mirrors/Contrastive-LM/CLM-v0.1-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考