
先说结论在不能联网、代码不能出内网的环境里用Ollama Qwen2.5-Coder VSCode Continue这套零成本组合能把 AI 辅助编程里大约一半的工作量留在本地——代码补全、样板代码、注释文档、单测骨架这些杂活本地 7B 模型完全够用剩下需要长上下文推理的硬骨头等能联网时再丢给云端大模型。一、为什么非要本地部署我遇到的真实场景工控同行应该都不陌生产线车间没有外网出差调试时 AI 工具完全断供客户签了保密协议明确要求代码不能上传任何云端服务——而几乎所有在线 AI 编程助手都需要把代码片段发出去公司内网有审计要求用公共 API 要走审批一轮下来半个月。这三种情况下AI 提效听起来就是个笑话。但自从我把模型跑在自己电脑上这三道墙就全塌了数据不出本机断网照用不花一分钱。二、硬件门槛比你想的低很多人以为本地跑大模型得有上万块的显卡。实测下来入门线16GB 内存、无独显的轻薄本跑 1.5B 补全模型打字补全基本流畅舒适线8GB 显存的游戏本RTX 4060 级别跑 7B 代码模型生成速度大约每秒 10~20 token日常使用不憋屈不用猜显存ollama ps一看便知模型吃掉了多少满了会自动把闲置模型换出去。三、十分钟部署三条命令跑起来装 Ollama、拉模型、启动服务一共三条命令# 1. 安装Win10/Win11 均可或去官网下安装包winget install Ollama.Ollama# 2. 拉一个 7B 代码模型首次约 4.7GB建议先插电源、连好网ollama pull qwen2.5-coder:7b# 3. 再拉一个 1.5B 的小模型专做行内补全快是它的命ollama pull qwen2.5-coder:1.5b装完 Ollama 会自动在127.0.0.1:11434起一个本地 API 服务浏览器打开http://127.0.0.1:11434看到 “Ollama is running” 就是通了。四、接进 VSCodeContinue 插件配置插件市场搜Continue装上改一下配置文件~/.continue/config.json核心两段{models:[{title:Qwen2.5-Coder 7B (local),provider:ollama,model:qwen2.5-coder:7b,apiBase:http://127.0.0.1:11434}],tabAutocompleteModel:{title:Qwen2.5-Coder 1.5B (local),provider:ollama,model:qwen2.5-coder:1.5b,apiBase:http://127.0.0.1:11434}}一个关键细节对话用 7B行内补全单独用 1.5B。补全要的是快你打一个字符它就得出建议7B 模型延迟一高补全就变成累赘。很多人配错这一点然后得出本地模型没法用的结论。五、本地小模型真正能打的五类活两周实战下来我把任务分成本地能干和本地别碰两类。本地能干占我日常编码量约一半样板代码。Modbus 寄存器表转 C# 属性类、PLC 点位表生成枚举、数据库表生成实体——这类结构高度重复的活把格式示例喂给模型它比你复制粘贴快十倍注释与文档。“给这个类补 XML 注释”“把这段逻辑写成 README”小模型质量意外地好正则表达式。描述清楚输入格式和提取目标十有八九一次能用SQL 查询。表结构一贴让它写聚合统计语句改改就能跑单测骨架。针对一个方法生成测试用例框架边界条件它还会主动帮你想到几个。本地别碰老老实实等云端跨多文件的大型重构——7B 的上下文理解力撑不住复杂 bug 的定位推理——它会一本正经地给你编一个错误解释长文档分析、方案设计。六、避坑清单上下文别贪大。num_ctx默认 2048别看网上的教程无脑拉到 32K——显存直接爆速度掉到没法用。工控代码单文件喂进去够用了笔记本要插电、开独显直连。混合显卡模式下 Ollama 可能跑在核显上速度差好几倍ollama ps里看GPU列确认模型文件在 C 盘。默认下到C:\Users\你\.ollama\models想挪位置就设环境变量OLLAMA_MODELS生成的串口/网口操作代码必须人工核对超时和重连逻辑。小模型写的通信代码看起来对的概率很高但边界处理经常缺斤少两——这类代码恰恰是工控现场最容易翻车的地方。七、总结本地部署 AI 编程助手本质上不是替代云端而是把高频、低难度、涉密的那部分工作量圈在自己电脑里。Ollama 加 Continue 的组合十分钟部署、零成本、断网可用对经常泡在车间和保密现场的工程师来说这是目前性价比最高的一笔提效投资。下一篇打算写怎么给本地模型做领域微调——让 7B 模型学会你们公司自己的设备协议欢迎关注。