ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Jev初体验记录

Jev初体验记录 年初的时候我分享了我的AI资讯热点捕捉器用 n8n 搭了个工作流每天自动抓 AI 资讯存进飞书多维表格。这期间每天都在正常运行截止到10月2日已经汇总了14194条数据了。其实这中间我就发现了一些问题比如分类不准确即使我的提示词里面已经说明了分类的选项但是模型因为幻觉或是降智的原因总是会出现一些我未曾给到的分类结果凌乱不堪。当然这也有我前期分类不细致的一些原因。7,673 条在「博客/研究/评论/深度报道」3,376 条叫「其他融资/社会舆论/人事变动等」2,883 条「产品发布/更新」剩下的散落在 20 多种「其他…」变体里。图中可以看到各种的其他分类。所以我很早就想要全部重新分类了但是感觉太浪费token了。就一直没有实施。Jev 是什么这次用的不是 ChatGPT 也不是 Claude这些大模型而是 TypeSafe 家的Jev官方叫它「System One 模型」——名字来自卡尼曼《思考快与慢》里的系统一/系统二。你把材料state和问题question发过去它直接返回结构化判断——选了哪个选项、各选项概率多少、置信度多少。没有废话直接返回 JSON 结果。它有三种方式Choice给固定选项让它选我做分类用的就是这个Score按有序档位打分Noul是/非判断带概率还有一个对我最重要的特性一次请求里可以塞很多个问题并行评估。这就可以批量处理数据了。怎么用先设计类目模型只负责判类目是人划的边界划不好结果就跟着歪。我让AI按内容主题重新设计了 10 个类目模型与基准、研究与技术、产品与应用、智能体与自动化、安全与事故、政策与监管、商业与市场、社会与文化、观点与评论、其他。每类都有一句判定标准另外把模糊情况的优先级规则也写进了指令比如涉及政府/立法/监管调查/诉讼的归「政策与监管」不归「安全与事故」Agent 产品的发布归「智能体与自动化」普通产品归「产品与应用」请求长什么样一次调用的核心就这三块state材料、questions问题、criteria选项。{state:[{n:1,title:英伟达确认将斥资129亿美元收购Hugging Face,summary:...},{n:2,title:FTC调查OpenAI和Anthropic的潜在消费者损害,summary:...},# ...一次塞 20 条],model:jev-latest,questions:{q1:{type:choice,instructions:根据标题和摘要判断类目...这是第1条记录。,criteria:{...10个类目...}},q2:{type:choice,instructions:...这是第2条记录。,criteria:{...}},# ...q20}}返回也很干净answers:{q1:{choice:business_market,confidence:1.0,...}}一次请求并行判 20 条实测每次响应只要 1 秒左右。14,194 条 ÷ 20 710 次请求。结果分类 14,194 条710 次请求652 秒输入 1,235 万 tokens输出 161 万总费用0.52美元。平均置信度 0.776新旧对比一眼就能看出差别原来 54% 的数据7,673 条挤在「博客/研究/评论/深度报道」一个大筐里现在按主题拆成了这样——观点与评论 2,732 条产品与应用 1,849 条商业与市场 1,808 条社会与文化 1,702 条智能体与自动化 1,427 条政策与监管 1,404 条安全与事故 1,219 条研究与技术 1,103 条模型与基准 887 条兜底的「其他」只剩 63 条0.4%。当然也有翻车的「科技爱好者周刊」是个每期主题都不同的聚合帖有的期判成「观点与评论」没问题但有一期被按当期主题判到了别的类目置信度只有 0.28。全量有 809 条置信度低于 0.4 的记录这部分可以来人工复核而不是混在里面假装正确。优缺点优点快。1 万多条 11 分钟跑完单请求 1 秒判 20 条这个吞吐对脏活累活来说非常够用返回即结构化。选项、概率、置信度都是现成字段不用写任何解析代码置信度是真有用。低置信度记录天然就是人工复核清单809 条比 14,194 条好查多了判定规则写进指令它真的遵守。我写的边界规则在实际结果里都能对上号缺点类目设计还是人的活而且占了大头。模型判得再稳边界划歪了整体就歪不做长篇推理特别模糊的题目比如「900年前的古老答案应对现代难题」这种标题党置信度会很低得有人工兜底「其他」这个兜底类目偶尔会吞掉一些其实能归类的某期周刊被判了 0.28 的「其他」其实归「观点与评论」更合适另外新用户Jev送5美元体验额度有效期一个月所以等于没要钱哈哈。整体感受是以前我做这类批量判断任务默认拿起聊天模型写 prompt、输出 JSON、写解析、处理解析失败重试。Jev 这类「判断型」模型等于把这套流程做成了标准件——尤其适合分类、打分、合规检查、意图识别这种「一万四千条里哪个是哪个」的任务。它不会帮你写文章干活但脏活累活又快又省心。
返回列表