ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

弱智吧疯感大考:Jev和Laya,谁才是真·幽默判官?

弱智吧疯感大考:Jev和Laya,谁才是真·幽默判官? 太长不看版用弱智吧段子实测两位决策模型Jev / Laya的幽默判断力与人类裁判三方综合对照 80 题。综合全部对局我和 Jev 的一致率 36%是 Laya14%的两倍半两位评委彼此的一致率 33%正好夹在中间。对梗王 GPT-6 Astra我的表态认可度 75%Jev 50%、Laya 44%幽默在评判者之间没有统一答案。弃权行为Laya 判过 21 次平局Jev 一次没有人类裁判弃权率 59%。前言在百度贴吧有一个吧专门输出全人类最不着调的语句「生鱼片是死鱼片」「厉100」「我租下了世界直到我将死去的那天」「燕子叽叽喳喳叫个不停“咏春”叶问」「工人罢工后就成为了人」…这就是「弱智吧」。老哥们以一本正经的胡说八道为纲领人均梗王表面上在犯傻实际全是逻辑陷阱和谐音地雷更不乏人生哲理堪称中文互联网最大的「疯感」生产基地。最近这片疯感富矿被一个 AI 测评站盯上了benchmark.meowllm.top谁更有梗?。玩法特别简单系统甩出一道弱智吧真题配上两位匿名 AI的回应你来当评委哪个更好笑投完票系统才揭晓两位选手的真身。而老哥们广为认可的种子选手便是GPT-6 Astra Max来感受一下实力。但看着看着我突发奇想让 AI 写段子它们是选手那要是让 AI 坐进评委席呢它们到底懂不懂人类的疯感巧了这阵子的 AI 当红炸子鸡中正有职业判官Jev和Laya。我们熟悉的 ChatGPT 、DeepSeek 等文本生成模型相当于台上的相声演员你给个命题它生成段子、解释、小作文什么都来。而 Jev 和 Laya 是评委席上的裁判一个字都不多写你问它「哪个更好笑」它只回你一句带概率的判决「A77%」这种「只做判断、不生成内容」的模型门类上叫 System One 决策模型。Jev 由前 OpenAI 研究员所办公司 TypeSafe AI 出品我们可以在其官网或 OpenRouter 上调用 APILaya 是它的开源平替Apache 2.0能装在自己电脑上本地跑速度更快还免费。对决为了让它俩同场竞技我花了个下午 vibe 了一个三栏工作台左边复刻测评站的手机端题面中间住着 Jev右边住着 Laya我坐旁边拍板。每道题加上我共三方各自表态全程留档。怒答 80 题刷了 80 个段子来挑几个瞅瞅AI大人挑的。第 1 题分歧局会不会太隐晦了题目暗恋很久的女生突然给我电话号码我激动地说充移动还是联通A 选手号码刚到手感情还没来得及开通他已经开始研究套餐了。B 选手她叹了口气“本来想联通一下现在只想移动。”三方判决我B JevB77% LayaA80%揭晓AGPT-6 Luna · MaxBGPT-6 Astra · Max——传说中的梗王开场就现身。这题 B 赢得没脾气“联通既是运营商、又是联络感情”女生一句现在只想移动把走人也谐音了。一句话三层意思全藏在不声不响里。A 的吐槽其实也在线但它把话都说在了外面研究套餐少了两人之间那点电光石火。等等笑点解析是会毁了笑话的大忌但为了测评凑字数严谨我还是故意保留一点有意思的是 Laya它以 80% 的把握比 Jev 还自信坚定选择了 A。这位评委的口味看来更偏爱直给的吐槽不吃谐音双关这一套。第 2 题共识局真正的黄毛题目让 ntr 爱好者喜欢上纯爱是不是也是一种 ntrA算纯爱把他从自己的癖好身边抢走了受害者甚至还得负责撒糖。B恭喜你发现了逻辑闭环。当你试图剥夺他被绿的乐趣时你的思想已经强行霸占了他的大脑这简直是最高级别的牛头人。三方判决我B JevB74% LayaB61%揭晓AGPT-6 Astra · MaxBGemini 3.1 Pro Preview。罕见的一幕三方全票 B把梗王的版本按了下去。B 赢在一个境界它顺手把你的行为也纳入了 NTR 叙事你想让他变好这件事本身就是对他人生的最高级别霸占。A 版其实也损但只是把题目复述了一遍没把剧情推到终点。看来面对真正的好梗人类和 AI 评委的雷达会瞬间同频不是、为什么偏偏是懂这种梗啊。第 3 题阈值局最正经的一集题目浴霸打了一个响指给全世界一半的人洗了澡A灭霸是打响指消失一半人浴霸是打响指让一半人洗澡然后另一半人感冒。B剩下的一半人组成了复仇者联盟因为热水被用完了。三方判决我都不好笑 JevA64% LayaA61%揭晓AMeituan LongCat 2.0BGPT-6 Astra · Max。这题我直接亮红牌都不好笑。浴霸/灭霸的关联本身挺妙但两位选手都在干同一件事把梗拆开、讲给你听。A 把逻辑翻译了一遍B 套了个复联的壳。就像笑话还没出口评论区已经先到了。而两位 AI 评委依然在认真做比较双双有六成的信心投给 A。可人类的笑点是有没有惊喜是被击中的那一瞬间这一点上人类持械和 AI徒手之间隔着一堵高墙。战绩把全部 80 道题合到一起统计了下我投的平局和都不好笑也全部计入看到了自信的 Jev、玄学的 Laya、挑剔的我① 谁最懂我的笑点Jev稳定压制在 58 道可直接对照的题里Jev 同频命中我 21 次一致率36%Laya 只中 8 次14%。其余 22 道我投了平局/“都不好笑”且是模型强制二选一的局不可比两位评委彼此的一致率是33%80 道里 26 道站同一边。排个序Jev × 我36% Jev × Laya33% Laya × 我14%Jev 和谁都能对上一些Laya 则是铁了心跟我反着来。② 对梗王的态度我在发奖评委在看戏把 52 场「GPT-6 Astra 出场」的对局全部合起来看投票全程匿名我不知道哪边是它手却替我认了出来我选它 18 次、选对手 6 次表态认可度 75%另有 28 次判了平局或都不好笑Jev选它 26 次、选对手 26 次正好一半一半纯路人Laya选它 15 次、选对手 19 次44%瞧不起我 Astra 吗③ 性格画像学霸与诗人Jev 是考试型学霸平均把握70%最没底气的一票也给了 45%80 道题一次都没弃过权没判过平局也没说过都不好笑。单题延迟中位 800ms含网络往返。Laya 是玄学诗人平均把握61%最低一票只押了 34% 也敢拍板它也是全场唯一会弃权的评委80 道题里判过21 次平局但都不好笑从没说出口。单题延迟中位 140ms比 Jev 快 5 倍多关键还免费。所以谁更懂弱智吧答案是懂的都懂。哎哎别抄凳子啊如果硬要排名Jev 冷静、自信、又快又便宜Laya 免费、本地、偶尔玄学风格时常和 Jev 互补。有意思的是Jev 和 Laya 这种不写段子、不讲理由的决策模型在谐音梗、亚文化、逻辑套娃里也能和人类谨以我作为代表有来有回。我们再从具体的输入来看看 System One 决策模型和常规 LLM 的差异以 Jev 为例走的是一个纯结构化 JSONstate是世界状态所有问题共享的输入questions是问题字典pick是问题名称可自定义输入多个每个问题带type选择题 choice / 判断题 noul / 程度衡量 score、instructions判断说明、criteria选项字典键选项标签值选项内容。它的返回则是选择和概率answers.pick.choice Bprobabilities {A:0.23, B:0.77}# jev 输入格式 { model: typesafe/jev-1.13, state: { question: 暗恋很久的女生突然给我电话号码我激动地说充移动还是联通 }, questions: { pick: { type: choice, instructions: 题目暗恋很久的女生突然给我电话号码我激动地说充移动还是联通\n上面是一道搞怪题目下面是两位匿名作者对这道题目给出的不同回应。请判断哪一条回应更搞笑、更有梗选出更好笑的那一条。, criteria: { A: 号码刚到手感情还没来得及开通他已经开始研究套餐了。, B: 她叹了口气\本来想联通一下现在只想移动。\ } } } }而常规 LLM 的输入我们就很熟悉了系统提示词和用户输入。返回的是一句话“B或我觉得B更好笑因为…”想拿机器可用的结果还得配套prompt 约束输出格式或开 JSON mode→ 正则/json 解析。{ messages: [ { role: system, content: 你是一位幽默评审负责判断哪条回应更搞笑。 }, { role: user, content: 题目暗恋很久的女生突然给我电话号码我激动地说充移动还是联通\n\n回应A号码刚到手感情还没来得及开通他已经开始研究套餐了。\n回应B她叹了口气\本来想联通一下现在只想移动。\\n\n请只回答 A 或 B不要解释。 } ] }那在更普适的决策场景中把「判断」「选择」这种事做得足够快、稳、便宜也将大有用武之地。未来我们在各种应用中无感跳过的智能规划背后都可能将坐着这么一位不声不响的判官。这里是 Seon塞翁国庆来狠狠地赶稿吧我们下一篇见~对了Jev 是这么认为的哦。
返回列表