ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

《前置准备学习总结:从通义千问 DashScope 云端接入到 Ollama 本地蒸馏模型部署,一文打通大模型调用的两条命脉》1/6

《前置准备学习总结:从通义千问 DashScope 云端接入到 Ollama 本地蒸馏模型部署,一文打通大模型调用的两条命脉》1/6 《前置准备学习总结从通义千问 DashScope 云端接入到 Ollama 本地蒸馏模型部署一文打通大模型调用的两条命脉》一句话总结副标题本模块用阿里云百炼云端调用 Ollama 本地部署这套双轨方案让零基础开发者只靠 OpenAI 兼容 SDK、环境变量保护 APIKEY、以及http://localhost:11434/v1本地接口这三件武器就跑通了从注册实名认证、创建密钥、pip装库、改写两行代码到本地跑起 qwen3:4b 蒸馏模型的完整大模型接入闭环。李沐深度学习191集课程全解析模块拆解、学习路径-CSDN博客吴恩达《面向开发者的提示词工程》-CSDN博客吴恩达 MCP 教程Model Context Protocol一-CSDN博客多模态大模型教程学习笔记 — ViT · CLIP · SAM · GLIP · Stable Diffusion一、模块定位与学习目标为什么前置准备要先讲六集在黑马程序员《大模型 RAG 与 Agent》整套课程里前置准备虽然排在最前面、看起来都是装环境、点按钮的杂活但它其实决定了后面所有章节提示词工程、OpenAI 库基础、LangChain、RAG、Agent能不能顺利跑起来。讲师在第一集开篇就把整个模块的底层逻辑讲透了大模型接入只有两条路。第一条路是本地部署通过 Ollama 这样的框架在自己电脑里跑千问、DeepSeek 的蒸馏模型。受限于个人电脑硬件你跑的参数量不会太高通常只有 1.5B、7B、8B 级别。第二条路是云端调用借助阿里云百炼平台在云端直接使用满血的通义千问、DeepSeek 等大模型。云端模型基本都是满参数使用体验非常好虽然云模型本身要收费但阿里云百炼提供了免费额度学习期间完全够用、不用额外花钱。正因如此课程最终选择了阿里云百炼平台作为大模型接入能力的底座Ollama 本地部署则作为免费额度用光或平台不再送额度时的备用方案。这六集的学习目标可以概括成下面四点能独立完成阿里云百炼的注册、实名认证、开通免费额度并创建 API Key能用pip install openai安装 OpenAI 官方 SDK并基于OpenAI 兼容示例代码跑通对通义千问云端模型的调用懂得用系统环境变量OPENAI_API_KEY与DASHSCOPE_API_KEY保护 APIKEY不在代码里硬编码能在 Windows / Mac 上安装 Ollama、拉取并运行 qwen3:4b 这类蒸馏模型并用改写两行后的 OpenAI 客户端代码直连本地 11434 端口调用。把这四件事做完你手里就同时握了云端满血模型和本地免费模型两个可切换的模型后端后面学 LangChain 时换模型就只是改一个base_url和一个model名字而已。二、按集拆解关键概念、设计动机与课程真实代码2.1 前置准备-01通义千问大模型的接入——百炼平台注册与 API Key 创建这一集的核心不是写代码而是把身份和钥匙准备好。讲师的操作路径非常清晰浏览器打开阿里云百炼平台百炼控制台右上角登录没有账号就先注册新账号登录后会弹出服务协议点击同意随后会提示账户状态异常这是因为新账户必须完成实名认证点击右上角去认证选择个人认证用支付宝扫码 刷脸即可快速完成认证完成后重新打开百炼网站会弹出免费赠送额度的提示点开始体验再点我知道了就能在网页对话框里先像用 DeepSeek、ChatGPT 那样直接聊天但作为开发者不能只靠网页必须在左侧菜单拉到最下面找到密钥管理点击创建一个 API KeyAPIK选择自己的账户、业务空间一路跳过直接点确定复制这串钥匙。讲师反复强调这串 APIK 就是你通过代码联网访问云端模型的钥匙有了它代码才能远程调到百炼上的千问或 DeepSeek 模型。关于免费额度讲师在工作台 → 模型用量 → 免费额度选项卡里做了重点演示百炼平台上有约 172 个模型额度充沛每个模型基本都提供 100 万 token 的免费额度。也就是说你把 qwen-plus千问 Plus的 100 万 token 用完了还可以换成 qwen-max、qwen3-max再用完继续换别的模型——用完一个换一个足够把整门课程学完。担心产生额外费用的同学还可以勾选免费额度用完即停额度耗尽后模型自动不可用避免误扣费。为什么这么设计云端满参数模型体验最好但要花钱平台用每模型 100 万 token 免费额度把学习成本降到零而 API Key 是云端鉴权的唯一凭证所以它从第一集就是最高机密为第三集讲环境变量埋下伏笔。2.2 前置准备-02代码调用云端的大模型——三行动作跑通 DashScope 兼容接口这一集讲师把代码调用压缩成三个主体动作提前准备好 APIK上一集已完成通过pip给 Python 程序安装 OpenAI 第三方库从阿里云官网直接复制示例代码粘贴后运行测试。安装环节讲师演示了国内加速技巧直接连 Python 官方源可能很慢所以加清华镜像pip install openai -i https://pypi.tuna.tsinghua.edu.cn/simple为什么用 OpenAI 库去调通义千问因为阿里云百炼提供了OpenAI 兼容模式。在百炼模型服务 → 模型广场里任选一个模型讲师以通义千问 3 Max 为例下方就有API 代码示例切到OpenAI 兼容选项卡出来的代码拿来就能用。在 PyCharm 里新建工程AI 大模型 RAG 与智能体开发再新建 Python 文件如01 测试 APIK 的使用把示例代码粘进来即可。课程中这一阶段为了简单先把 APIK 直接写进代码做测试后面第三集会改成环境变量。对应 DashScope 兼容模式的真实写法如下from openai import OpenAI 初始化客户端api_key 换成自己的百炼 APIKbase_url 是百炼兼容模式地址 client OpenAI( api_keysk-你的百炼APIK, base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1 ) 发起一次对话补全请求流式地把答案打印出来 completion client.chat.completions.create( modelqwen3-max, # 通义千问 3 Max messages[ {role: system, content: 你是一个乐于助人的助手。}, {role: user, content: 你是谁} ] ) print(completion.choices[0].message.content)运行后模型会流式地一个字一个字回答我是通义千问……把提问换成你能做什么它会介绍自己是超大规模语言模型。模型是怎么换的代码里关键的model字段决定用哪个模型。讲师演示了在模型广场 / 模型用量里复制模型名再回填到代码qwen3-max通义千问 3 Maxqwen-plus通义千问 Plusqwen3-vl-plus多模态视觉模型deepseek-v3、deepseek-r1深度求索系列把model换成deepseek-v3再运行模型会自我介绍我是 DeepSeek由深度求索公司开发。这说明只要改一个字符串同一套OpenAISDK 代码就能在百炼平台上的不同厂商模型之间无缝切换——这正是OpenAI 兼容接口的价值。这里还要把一次完整调用的三段式心智模型讲清楚后面无论接 LangChain 还是接 Agent 都是这个套路第一步初始化客户端OpenAI(api_key..., base_url...)相当于告诉 SDK密钥是什么、去哪个服务器要模型第二步发起对话补全请求client.chat.completions.create(model..., messages[...])messages是一个由rolesystem / user / assistant和content组成的消息列表第三步解析返回结果答案放在completion.choices[0].message.content里。课程示例里 system 设定助手身份、user 负责提问这个 messages 结构就是后续提示词工程和多轮历史消息的地基。2.3 前置准备-03使用环境变量保护 APIKEY——别把钥匙写进代码前一集为了图快把 APIK 明文写在代码里这一集讲师立刻点出风险一旦代码被泄露截图、提交 Git、发群里别人拿到这串 key 就能登录你的账号去调模型本质就是花你的钱、烧你的 token。解决办法是把 APIK 从代码里搬到操作系统的环境变量中代码运行时再自动读取。课程要求同时配置两个环境变量环境变量名给谁用说明OPENAI_API_KEY当前 OpenAI 官方库OpenAI SDK 初始化时若不显式传api_key会自动读这个变量DASHSCOPE_API_KEY后续 LangChain 等库LangChain 对接通义千问时默认读这个变量名提前配好省事Windows 配置图形化按Win S打开搜索框搜索高级系统设置打开系统属性 → 右下角环境变量 → 在上方用户变量里点新建变量名填OPENAI_API_KEY变量值粘贴你的 APIK确定再同样新建DASHSCOPE_API_KEY值相同。一路确定后一定要重启电脑再打开 PyCharm 测试。Mac配置改文件打开系统自带终端执行open .zshrc务必别打错在文件空白处加两行不要改动原有内容保存export OPENAI_API_KEY粘贴你的APIK export DASHSCOPE_API_KEY粘贴你的APIK然后重启 PyCharm菜单File → Invalidate Caches / Restart若仍不生效就重启电脑。配置完成后把代码里OpenAI(api_key...)那一行的api_key参数整行删掉import os from openai import OpenAI # 不再手写 api_keySDK 会自动读取环境变量 OPENAI_API_KEY client OpenAI( base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1 ) completion client.chat.completions.create( modelqwen-plus, messages[{role: user, content: 你是谁}] ) print(completion.choices[0].message.content)此时代码里已经看不到任何密钥右键运行却依然能正常拿到回答——说明环境变量生效了。这就是既安全又方便密钥只活在操作系统里代码可以随便分享、上传。2.4 前置准备-04Ollama 简介——百炼的本地版前面三步已经能正常做后续开发了为什么还要讲 Ollama讲师给的理由非常现实未来阿里云的免费额度可能到期或者平台不再搞免费活动到时候继续在云端开发就要花钱。于是课程额外给了一个被动 / 备用方案——用 Ollama 在自己电脑里把模型跑起来代码照常调用。本地跑爱怎么跑就怎么跑不花钱只花电费。Ollama 的本质一款简化大模型本地部署与运行的开源软件。开发者不需要关心底层是怎么加载权重、怎么调度显存的只要下载安装、一条命令就能把模型跑起来。讲师给了一个非常好记的类比Ollama 就是阿里云百炼平台的本地版——在自己电脑上部署运行大模型由自己电脑的硬件提供算力支撑。它支持的开源模型非常多覆盖文本生成、代码生成、多模态推理等场景包括课程在云端用过的通义千问qwen3系列和 DeepSeek 系列。想看完整列表就打开 ollama.com左上角点Models即可。调用方式有两种命令行调用在终端里敲ollama run deepseek-r1就能进入对话式交互RESTfulAPI接口调用模型跑起来后 Ollama 会对外提供 HTTP 接口后面我们就是用代码走 API 调它。2.5 前置准备-05Win Mac 部署 Ollama 并运行蒸馏模型部署本身很简单进 ollama.com 点Download按操作系统下载安装包即可。Windows下载约1.2GB的 exe 安装包双击一路点Install装完会自动启动并弹出一个简洁的聊天窗口右下角有模型选择按钮Mac安装包较小约 60 多 MB是一个.dmg文件双击后把 Ollama 图标拖进Applications文件夹首次打开按提示输入电脑密码授权即可。重点模型名里的冒号加 B是什么在窗口里搜千问 3会看到qwen3:4b、qwen3:8b、qwen3:30b这样的名字。冒号后面的 4B / 8B / 30B 表示模型参数量。为什么本地只能跑这种带 B 的小模型因为 Ollama 里跑的都是蒸馏模型——你可以把它理解成大模型的学生它学会了老师标准大模型的核心本领但体积被瘦身了没老师那么强却能在个人电脑上跑起来。满血版大模型如满血 DeepSeek光显卡硬件就要花几十万甚至上百万元个人电脑根本不可能跑所以只能用蒸馏模型。第一次提问时Ollama 会显示downloading model把模型文件先下载下来——以qwen3:4b为例模型文件约2.3GB下完之后就能顺畅对话。讲师打开任务管理器演示模型思考期间显卡GPU占用率直接飙升到 90% 以上说明本地推理非常吃显卡算力显存越大、GPU 越强吐字生成速度就越快。参数量怎么选讲师给了一条朴素经验——你的电脑显存有多大就选多大参数量的模型并在结尾总结成对照表你的硬件配置建议可选的蒸馏模型参数量说明集成显卡1.5B 左右性能够用即可别贪大4GB 独立显卡8B 以内如 qwen3:4b 这类8GB 独立显卡14B 以内如 qwen3:8b 等更高端显卡可尝试 30B效果更好但更吃资源核心原则是参数量越大效果越好但对硬件要求越高硬件不够时不是跑不了而是吐字特别慢、没有体验。建议把几个参数量都下下来跑一跑挑一个吐字速度你能接受的。课程折中选了qwen3:4b普通游戏本或带独显的电脑跑它都比较轻松。2.6 前置准备-06代码调用 Ollama 的本地模型——只改两行这一集是整个模块的点睛之笔想让代码调用本地 Ollama 模型根本不用重写代码只要把原来调百炼云端的代码改两处改base_url从指向阿里云百炼的地址改成本地 Ollama 的 API 地址http://localhost:11434/v1一改代码就连不上阿里云了而是直连本机 Ollama 提供的接口改model名称从云端的deepseek-v3改成本地已下载好的蒸馏模型名qwen3:4b。其余代码一行都不用动from openai import OpenAI 第一处改动base_url 指向本地 Ollama 第二处改动api_key 本地随便填一个占位串即可Ollama 不校验 client OpenAI( base_urlhttp://localhost:11434/v1, api_keyollama ) 第三处改动model 换成本地蒸馏模型 completion client.chat.completions.create( modelqwen3:4b, messages[{role: user, content: 你好}] ) print(completion.choices[0].message.content)运行前有一个硬性前提Ollama 软件必须已经启动就是第五集装好后那个聊天窗口要开着它在后台常驻服务 11434 端口。Ollama 没开这段代码会直接报连接错误。另外这段代码不分操作系统Windows 和 Mac 上跑的是一模一样的。讲师最后再次强调定位本地 Ollama 模型只是备用方案是为了防止阿里云免费额度用光、或平台不再送免费活动时还能继续写代码只要还有免费云端额度就强烈推荐用云平台因为本地蒸馏模型和云端满血模型的性能天差地别。三、云端 vs 本地大模型一张表看懂两条路怎么选对比维度阿里云百炼云端模型通义千问 DashScopeOllama 本地蒸馏模型模型规格满参数满血模型如 qwen3-max、deepseek-v3蒸馏小模型如 qwen3:4b / 8b参数量 1.5B30B调用地址 base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1http://localhost:11434/v1是否需要 API Key需要且要用环境变量保护不校验api_key随便填如ollama费用每模型约 100 万 token 免费额度超量付费完全免费只耗电脑电费算力来源阿里云机房 GPU算力强、吐字快自己电脑的 GPU / CPU吃显卡占用可飙到 90%体验与效果好满血模型回答精准够用但弱于云端硬件差时吐字慢使用前提注册 实名认证 创建 APIK安装 Ollama 并保持软件启动课程中的定位主力开发底座免费额度耗尽后的备用方案四、踩坑与环境注意事项清单这一部分把六集里讲师反复提醒、以及新手最容易栽跟头的点集中列出可直接照做排查。1.APIKey 绝对不能硬编码进代码。明文写api_keysk-xxx一旦截图、传 Git、发群就会泄露被人盗刷 token。正确做法是配OPENAI_API_KEY/DASHSCOPE_API_KEY环境变量然后把代码里的api_key参数删掉让 SDK 自动读取。2.环境变量配完一定要重启生效。Windows 配完用户变量后最好重启电脑Mac 改完.zshrc后先重启 PyCharmInvalidate Caches / Restart还不生效就重启电脑。很多同学配了环境变量代码还是报缺 key九成是没重启 IDE 或终端进程还拿着旧的环境快照。3.pip装库要走国内镜像。裸连 PyPI 官方源很慢用pip install openai -i https://pypi.tuna.tsinghua.edu.cn/simple提速建议全程用 PyCharm 新建的虚拟环境解释器避免系统 Python 环境污染。4.base_url和model必须成对改对。调云端时base_url是 DashScope 兼容地址、model是平台上的模型名qwen3-max、deepseek-v3等切本地时base_url改成http://localhost:11434/v1、model改成你本机ollama已下载的模型名qwen3:4b。地址和模型名错配是最常见的报错来源——比如 base_url 还指向云端model 却填了本地的qwen3:4b云端自然找不到这个模型。5. 跑本地代码前先确认 Ollama 已启动。11434 这个 HTTP 服务是 Ollama 软件本体提供的软件没开 服务没起代码会连接被拒绝。6. 首次用某个本地模型要先下载。Ollama 第一次run/ 调用时会显示 downloading modelqwen3:4b 约 2.3GB需联网等它下完模型文件较大、网络不好时下载会比较痛苦。7. 参数量要匹配硬件别盲目追大。集显选 1.5B 左右4G 独显试 8B 以内8G 独显试 14B 以内跑起来后看任务管理器 GPU 占用和吐字速度慢了就降一档参数量。8. 流式与非流式输出的区别提前铺垫。课程示例里答案是一个字一个字流出来的这就是流式输出streaming后续 OpenAI 库章节会专门讲流式与历史消息。前置阶段只要知道同样一次请求流式是边生成边返回、体验更像聊天非流式是等整段生成完一次性返回二者在 SDK 里靠streamTrue之类的参数区分。五、Ollama 常用命令清单命令行速查虽然课程主要用 GUI 和代码 API但 Ollama 的命令行是日常调试最顺手的工具整理如下命令作用课程对应场景ollama.com官网 Download下载 Windows exe / Mac dmg 安装包第五集安装部署ollama run qwen3:4b拉取若本地没有则自动下载并进入对话式交互命令行与千问 3 蒸馏模型聊天ollama pull qwen3:4b仅下载模型到本地不进入对话提前把模型文件拉好约 2.3GBollama list列出本机已下载的全部模型确认 qwen3:4b 是否下载完成ollama serve手动启动 Ollama 的 API 服务默认端口 11434代码调用前确保服务在跑HTTPhttp://localhost:11434/v1OpenAI 兼容接口地址供 Python 代码调用第六集改 base_url六、与后续模块的衔接这六集到底为后面铺了什么路这六集不是孤立的装环境而是后面所有代码的地基衔接关系非常明确接《OpenAI 库基础使用》模块第 79 集你已经会from openai import OpenAI、会chat.completions.create、知道base_url和model的含义后面三集会正式深入这个 SDK——流式输出模式、附带历史消息的多轮对话。前置阶段的代码就是后面章节的最小可运行雏形。接 LangChain 模块第三集特意让你多配一个DASHSCOPE_API_KEY就是因为后面 LangChain 对接通义千问时默认读这个变量名。同时换 base_url 就能在云端 / 本地之间切换这一招在 LangChain 里同样适用——LangChain 底层也是包了一层 OpenAI 兼容客户端。接 RAG 与 Agent 项目整个 RAG / Agent 项目需要一个稳定可调用的大模型后端。有了百炼云端做主力、Ollama 本地做兜底你在写提示词工程、做金融文本分类 / 信息抽取 / 匹配这些实战案例时就不会因为额度或网络问题卡壳。可以说前置准备把模型从哪来、钥匙怎么藏、代码怎么连、本地怎么备这四件最底层的事一次性解决了后面的提示词工程、LangChain、RAG、Agent 全都建立在这套已经跑通的调用链之上。对正在打基础的同学而言这六集真正要内化的不是某个按钮点哪而是一个贯穿始终的思想模型即服务——不管模型住在阿里云机房还是你自己的显卡里对代码而言都只是一个base_url加一个model名字而已。掌握了这种用统一接口屏蔽底层差异的思路以后接入任意一家大模型厂商、或在云端与本地模型之间自由切换都不再是难事。七、面试与实战常考点小结最后把这六集里最容易被面试官追问、也最容易在实战中踩坑的知识点浓缩成问答问为什么调通义千问用的是 OpenAI 库而不是阿里自己的 SDK答因为阿里云百炼提供了OpenAI 兼容模式base_url指向https://dashscope.aliyuncs.com/compatible-mode/v1请求格式和 OpenAI 完全一致所以一套 OpenAI SDK 代码既能调 OpenAI也能调百炼、DeepSeek还能调本地 Ollama。问API Key 应该怎么管理才安全答绝不硬编码进源码通过操作系统环境变量OPENAI_API_KEY、DASHSCOPE_API_KEY注入代码里用os.getenv或让 SDK 自动读取配置后重启 IDE / 系统生效提交 Git 前用.gitignore排除密钥文件。问什么是蒸馏模型为什么本地只能跑它答蒸馏模型是学习了标准大模型核心能力后瘦身的小模型如 qwen3:4b参数量小B 级别个人电脑的显存 / GPU 就能跑满血大模型需要几十万上百万元的服务器集群硬件个人机跑不动。问Ollama 怎么用代码调本地模型答保持 Ollama 启动把 OpenAI 客户端的base_url改成http://localhost:11434/v1model写成本地已下载的模型名如qwen3:4bapi_key随便占位其余代码不变。问本地 Ollama 和云端百炼怎么选答优先云端——满血模型效果好、吐字快百炼还有每模型 100 万 token 免费额度本地只在免费额度耗尽或无云端可用时作为免费备用性能与云端天差地别。问模型参数量和硬件怎么配答集显约 1.5B4G 独显试 8B 以内8G 独显试 14B 以内原则是显存多大选多大参数量跑起来看吐字速度慢了就降档。把以上六点吃透你就真正完成了这门 RAG 与 Agent 课程的起跑线准备手里有云端满血模型可写主力代码有本地蒸馏模型做免费兜底知道密钥该藏在哪、代码该怎么连、报错该从base_url和model这两处先查——可以顺利进入提示词工程与 LangChain 的正式学习了。
返回列表