ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

实测分享:AI Agent回归的裁判费从28美元降到3毛4,判得还更准了

实测分享:AI Agent回归的裁判费从28美元降到3毛4,判得还更准了 实测分享AI Agent回归的裁判费从28美元降到3毛4判得还更准了背景我们团队给业务系统上了个测试Agent最头疼的不是让它跑而是跑完之后判分。规则断言只能查确定性的东西返回码、字段存在性一旦涉及这个回复算不算解决了用户问题这种开放行为只能上LLM-as-judge结果两个老大难贵——Claude当裁判500次判定烧了28美元飘——同一条trace判两次结论可能不一样回归结果根本没法比。更现实的是因为贵多数团队只敢抽样判一小部分生产流量剩下的全靠用户投诉兜底。这两天LangSmith把TypeSafe的Jev集成进Evals当一等公民judge9月22日上线这两天各家周报还在转我拿官方开源基准仓库完整跑了一遍值得单独开一帖。操作步骤先把Agent的一次跑批固化成LangSmith datasetfrozen trace这是前提——行为不变不同judge的对比才有意义人工标一遍oracle答案作为对照基准在tracing project的Evaluators tab里add evaluator、选TypeSafestate选trace写typed questionsdoes_pass用noul返回yes/no带概率、quality用score1-5量表多个问题并行打分离线跑dataset回归再把同一judge挂到生产tracing project做在线评测生产trace进来就自动判PII泄露这类信号还能接webhook实时告警想复现数字直接跑GitHub的jev-as-a-judge仓库Python 3.13uv sync后跑judge_reliability.py。踩坑记录低方差≠准确。Jev重放100次结论几乎不动方差0.0000149但它完全可能稳定地错第2步的人工oracle校准千万别省用LLM judge时自由文本转结构化那一步本身就是错误源跟推理对不对无关。Jev直接回类型化答案绕开了这层开放式、要写推理过程的场景别硬上Jev它只适合有界判定这类还是留给LLM judge1万条trace/天的量级大模型当在线裁判账单能顶一台服务器换Jev才有全量判的底气别一上来挂一堆typed question每个问题都是一次调用先跑通一两个关键判定再扩维度。效果对比同一基准5条frozen trace×100次重复共500个二元判定以人工标注为准Judge匹配人工方差倍数单次成本总成本Jev100%1x$0.00035$0.34GPT-5.6 Terra99.8%913x$0.00289$2.90GPT-5.6 Luna96.4%433x$0.00039$0.39Claude Sonnet 4.680.0%92x$0.02811$28.17总结Agent测试的判定环节正在从买不起的LLM裁判变成全量、便宜、可重复的在线评测。拿这次数据说话换成Jev省下的28美元预算足够把评测维度从1个扩到80个。我的建议有界判定pass/fail、量表打分、意图分类全换成Jev这类决策模型省下的预算拿去扩评测维度比死磕一个贵裁判划算。目前TypeSafe注册还送5美元额度够把自家Agent的回归判定整体迁一遍试个水。你们团队的Agent回归现在用什么当裁判欢迎评论区聊聊。
返回列表