ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

llmfit bench:3 轮真实推理,一条命令量出你的实测 tok/s

llmfit bench:3 轮真实推理,一条命令量出你的实测 tok/s llmfit bench3 轮真实推理一条命令量出你的实测 tok/s【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit模型装好了却不知道它在你这台机器上到底跑多快估算值给不出答案——llmfit 的 bench 命令直接对正在运行的推理服务发真实请求3 轮实测就给你真实的 tok/s每秒生成的 token 数和首 token 延迟。测完的数据自动留在本地想贡献给社区再加一个参数。核显笔记本上的一条命令llmfit bench 给出 3.8 tok/s场景很具体你在一台集成显卡的笔记本上用 llama.cpp 起了个 0.8B 的小模型服务。不需要告诉 llmfit 地址和端口敲下llmfit bench几秒后终端输出 TPS、TTFT、延迟三组汇总数字。排行榜里你的硬件行直接换成实测值旁边还能看到社区其他用户在同一硬件上的成绩。5 种推理后端自动探测端口、地址一个都不用填llmfit 会依次探测 Ollama、vLLM/Ferrum、llama-server、MLX 这几类常见运行时探测成功就自动列出该端点已加载的模型。两个容易撞车的默认端口都处理好了llama-server 和 MLX 默认同占 8080llmfit 用 llama.cpp 独有的/props端点把它精确认出来vLLM 和 Ferrum 同占 8000则靠/v1/models返回的owned_by身份区分。地址想用非默认值通过环境变量如OLLAMA_HOST、VLLM_PORT或--url覆盖探测不到任何后端时会明确提示先启动服务模型没加载好同样会报错而不是跑出假数据。后端默认地址识别方式Ollamalocalhost:11434/api/tags列出已装模型vLLM / Ferrumlocalhost:8000/v1/models的owned_byllama-serverlocalhost:8080独有的/props端点MLXlocalhost:8080/v1/modelsllama-server 未占用时1 次热身 3 轮真实推理TPS、TTFT、延迟各怎么测出来每轮 bench 先发一条不计时的热身请求内容就是 Say hello.把冷启动从数据里剔除然后循环发送 4 条内置提示词——解释哈希表、写回文字检测的 Python 函数、对比 TCP 与 UDP、评审一段递归代码——每条限制 300 token 输出默认跑 3 轮。计时上分两条路Ollama 直接读它返回的eval_duration原生计时TTFT 精确到毫秒vLLM、MLX 这类 OpenAI 兼容端点目前走非流式请求只能按墙钟时间算总延迟所以 TTFT 显示 n/a——不是故障精确值依赖流式输出。最终汇总给出 TPS 均值/最小/最大、平均 TTFT、平均总延迟和平均输出 token 数逐轮明细也一并打印统计逻辑在 bench 模块。从安装到出结果的完整命令先用 uv 装好 llmfitmacOS / Linux 通用uv tool install -U llmfit以 llama.cpp 为例起一个本地推理服务看到model loaded和监听地址就表示就绪Ollama、vLLM、MLX 同理llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99服务就绪后直接跑 bench自动发现后端与模型下面几行是批量测试与分享场景llmfit bench llmfit bench --all --share llmfit bench --all --share --dry-run llmfit bench --all --share --yes llmfit bench --share常用开关--runs N调整测试轮次默认 3--provider llamacpp显式指定后端--url覆盖端点地址--json输出机器可读结果方便接脚本TUI 用户更省事在表格中选中已安装的模型按b会弹出Benchmark this model提示Enter开测、Esc让它转后台跑数据去向本地先存档分享才变 PR 每次 bench 都会先写本地Linux 下在~/.local/share/llmfit/benchmarks/pending/可用LLMFIT_BENCH_STORE改位置跳过分享也不丢数据。本地结果有两个立竿见影的效果TUI 排行榜顶部出现you (local)行你的实测 tok/s 替换理论估算可靠的实测≥1B 参数、dense 模型还会反向校准同硬件上其他模型的估算公式——测一个准一片。想贡献给社区--share让 llmfit 自动 fork 仓库、提交结果文件并开 PR全程不需要 gh CLI认证走 GitHub 设备码流程或设GITHUB_TOKEN--dry-run只预览要提交的 JSON、不碰网络--yes跳过确认适合自动化而单独执行llmfit bench --share可以把积压的本地结果一次性批量上传。被合并的数据打进下个版本同硬件用户不用自己跑就能直接看到带 ✓ 的校准值换了 CPU/GPU 配置后旧硬件上的记录会被自动忽略不会互相干扰。完整流程见 benchmarking 文档CLI 细节见 cli 文档。估算回答能不能跑bench 回答跑多快。现在起一个推理服务敲下llmfit bench让你的硬件数据替你说话。【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表