ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何诚实地给本地大模型跑分?MTPLX AIME 基准与 125 tok/s 测试条件全公开

如何诚实地给本地大模型跑分?MTPLX AIME 基准与 125 tok/s 测试条件全公开 如何诚实地给本地大模型跑分?MTPLX AIME 基准与 125 tok/s 测试条件全公开【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX为什么本地大模型跑分容易“翻车”给本地大模型跑分,新手最常踩的坑不是软件难装,而是数字不诚实:风扇没拉满、缓存没清空、思考模型被 token 上限截断、预填充(prefill)混进了解码(decode)速度……MTPLX 是一款运行在 Mac(Apple Silicon)上的本地大模型引擎与命令行工具,主打 MTP 多 token 预测的精确投机解码,在 M5 Max 上跑 Qwen 3.8 Flash Next 达到 125 tok/s,并自带一套公开测量条件的基准体系,包括内置的AIME 基准测试运行器——你可以亲手给模型打分,而不是照抄别人的图表。这篇文章把 MTPLX 跑分的“诚实规则”和 125 tok/s 的测试条件完整拆开,让你既知道怎么测,也知道怎么辨别别人测的数字。MTPLX 的 AIME 基准:如何给模型出“数学卷”MTPLX 内置 AIME 2026 基准运行器,题目来自 aime_2026.jsonl,运行器实现在 aime.py。它的设计有几个关键点,新手可以直接借鉴:无引导提示(coaching-free):系统提示和用户提示固定公开,不给模型任何“提示技巧”,保证不同模型在同一份卷子下比较;只认可见答案:推理模型会把大量 token 花在reasoning_content(思考流)里,运行器只把 【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表