
Strata 完全指南让125B MoE大模型在12GB游戏显卡上以60-95 tok/s本地运行【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/StrataStrata 是一款免费开源的大模型本地推理引擎让 1250 亿参数的 MoE 模型Qwen3.8-Flash-Next在普通游戏电脑上跑起来一张 12GB 显存的 NVIDIA 显卡 64GB 内存Windows/Linux 一键安装写答案的速度达60-95 tok/s——比你阅读还快。它自带网页聊天界面并对外提供 OpenAI / Anthropic 兼容的本地 API。本文将带你快速搞懂Strata 为什么快、如何选模型、三步装好、以及怎么接入自己的应用。12GB 显卡真的跑得动 125B 大模型吗跑得动。官方在 RTX 507012GB Ryzen 5 7600 64GB 内存上实测模型规格写答案短对话写答案128K 上下文读取长提示Q2_093 tok/s74 tok/s2,170 tok/sIQ2_XS79 tok/s63 tok/s2,090 tok/sIQ3_XXS62 tok/s49 tok/s1,750 tok/sIQ3_S53 tok/s46 tok/s1,620 tok/sCoderIQ1_M55 tok/s43 tok/s2,180 tok/s写答案回复流式出现的速度读取长提示处理长文档、代码库的速度32K token 提示实测。显存越大越快RTX 309024GB预估可达100-140 tok/s完整数据见 docs/DETAILS.md。这个 125B MoE 大模型的能力也绝非玩具——下面是它一次性写出的体素宝塔花园网页浏览器直接可玩Strata 大模型引擎的工作原理125B MoE 模型通常需要数百 GB 显存的服务器。Strata 的秘诀是把模型24,576 个专家expert分摊到整台电脑——而每个词只需要其中 10 个显卡GPU承担每个词都要做的计算并缓存最常用的一两千个专家边用边学习哪些最常用内存RAM装下全部专家。某个词需要显卡上没有的专家时CPU 与 GPU并行处理互不等待SSD存一张大查找表每个词只读取其中几行。再叠加猜测-校验投机解码模型内置的小助手先猜接下来几个词大模型一次性批量校验保留猜对的——一步产出多个词不损失质量的情况下提速 1.6-1.8 倍。长文档以 8,192 token 为一块整块读取这就是 1,000 tok/s 的来源。完整技术细节见 docs/DETAILS.md带全部测量数据的论文见 docs/paper/Strata-Paper.pdf。如何选择模型先看内存再看显卡同一模型有不同的压缩档位模型规格内存显存需求速度质量Q2_037.6 GB最快好IQ2_XS39.2 GB快更好⭐ 推荐IQ3_XXS47.0 GB较慢很好IQ3_S54.8 GB最慢最佳与原始模型公开测试持平选型口诀看内存不只看显卡——64GB 内存四个规格全装得下48GB 选 Q2_0 / IQ2_XS只有 32GB 内存就选Coder。显卡越大越快但不会降低内存需求。另外两个值得考虑的选项CoderISTA-DASLab 精简版删掉一半专家、保留写代码最需要的29.6GB 首片32GB 内存即可运行达到原模型 91% 的 SWE-bench Verified 得分长提示读取速度全场最快Swift 1.5少思考 63% 思考 token、回答快 1.8 倍的微调版质量基本不变。拿不准选IQ2_XS主要写代码选Coder。一键安装步骤从零到跑起来只要 3 步硬件需求一览唯一要自己动手装的是 NVIDIA 显卡驱动580 及以上版本部件要求显卡NVIDIA RTX 20/30/40/50 系列12GB 显存起8GB 可跑但慢内存推荐 64GB32GB 可跑 Coder磁盘约 80GB 空闲强烈建议 SSD首次启动快得多系统Windows 10/11 或 LinuxWindows 安装下载项目解压或克隆仓库git clone https://gitcode.com/gh_mirrors/strata11/Strata双击 START-HERE.bat回答 4 个问题全部直接按回车即选推荐项模型版本与压缩档位、上下文长度、是否启用图片理解、实验性速度选项。之后自动下载模型约 70GB支持断点续传并自动启动浏览器会打开http://127.0.0.1:8080。⚠️首次启动时电脑可能卡 1-3 分钟正在把 35-55GB 加载进内存并锁定完全正常别关窗口。之后每次启动只需 30-90 秒关掉窗口即停止模型。Linux 安装同样一键运行 setup.sh./setup.sh4 种日常使用方式浏览器最推荐http://127.0.0.1:8080三个标签页——Chat流式回答、可折叠的思考过程、图片理解、Monitor模型状态 GPU/CPU/内存/磁盘实时监控如上图、About设置与 API 地址终端聊天.venv\Scripts\python chat.py支持/image 路径发图、/think low|high调思考深度代码见 chat.pyAPI 接入你自己的应用添加为 OpenAI 兼容 providerbase URL 填http://127.0.0.1:8080/v1API key 与模型名任意用 Anthropic API 的应用填http://127.0.0.1:8080/v1/messages。服务端代码在 serve/server.py手机/局域网访问START-HERE.bat --setup --host 0.0.0.0 --api-key secret即可在别的设备上使用。几个好用的细节思考深度off / low / medium / high 四档off 最快high 适合难题在聊天页菜单或/think设置请求处理一次回答一个请求会话首条消息会完整读取约每分钟 30,000 token之后的追问秒级启动。进阶玩法多显卡与性能调优双/三张 NVIDIA 显卡START-HERE.bat会自动列出你的显卡并询问是否按层分摊流水线并行。实测 RTX 5080 RTX 3090 组合读取长提示快 18-20%详见 docs/MULTI_GPU.md为你的电脑调参START-HERE.bat --calibrate花 5-10 分钟测量并保留最快的引擎配置官方测试让 Coder 提速 7%️AMD 显卡实验性Linux 下./setup.sh --backend hip支持 RX 7900 XT/XTX见 docs/AMD_HIP.md。常见问题速查现象怎么办首次启动电脑卡死正常现象等 1-3 分钟别关窗口下载/安装中断再运行START-HERE.bat自动续传很慢且磁盘灯狂闪空闲内存不足关闭其他程序或换 Q2_0 / IQ2_XS提示端口 8080 被占用Strata 已在运行找到它的窗口即可提示超出上下文长度开新对话或用SETUP.bat调大上下文引擎意外停止多为内存不足重发消息即可引擎会自动重启完整排障表见 docs/DETAILS.md。延伸阅读 全部实测与预估速度数据bench/results/ 技术细节全解API、图片、低内存模式docs/DETAILS.md 论文含全部测量数据docs/paper/Strata-Paper.pdf 官方入口README.md【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考