ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【AI入门】大模型介绍全解析:从模型、LLM 到提示词与嵌入

【AI入门】大模型介绍全解析:从模型、LLM 到提示词与嵌入 欢迎阅读个人主页愿旖旎专栏传送门算法专栏当前学习内容LangChain 目录一、知识前置讲解二、认识模型三、认识大语言模型四、提示词编写五、LLM 的接入方式六、嵌入式模型七、复盘附答案一、前置讲解在进入正文前先花 10 秒了解本篇会反复用到的核心概念带着印象去读正文学习效率更高。前置知识一什么是模型从数据中学习规律、能完成特定任务的数学函数是 AI 的基本单元。前置知识二神经网络与参数模型的大脑由大量参数组成的多层判断流水线规模决定能力。前置知识三自监督学习与半监督学习模型的学习方式从无标注数据自己找规律或用少量标注结合大量无标注。⌨️前置知识四语言模型与提示词模型的交互接口语言模型是自动补全器提示词是我们下指令的方式。前置知识五嵌入与向量把文字/图片翻译成数字向量以便计算机计算是语义搜索、RAG 的基础。二、认识模型模型是一个从数据中学习规律的数学函数或程序。给它喂入海量数据它就能学会预测、生成文本或图像从而增强各行各业的业务能力。打个比方可以把模型想象成一家超级加工厂训练师先给它看海量例子数据并告诉它该怎么做它看多了自己摸索出一套规则从此输入原料数据→ 输出成品结果。举个具体例子给模型输入这些数据输入输出[1, 2, 3]2[4, 5, 6]5模型学会的规律是输出中间那个数。学成之后再输入[8, 9, 10]它就能预测输出9。模型的三个关键属性属性说明特定任务一个模型通常只擅长一件事——识别图片里是不是猫、预测明天会不会下雨、判断评论是好评还是差评需要标注数据训练这类模型需要大量标准答案如成千上万张标注好是猫/不是猫的图片参数较少参数是模型从数据中学到的内部规则参数少 模型复杂度和能力相对有限模型 学出来的规则不是人写死的程序——给它数据它自己总结规律然后对新输入做预测。三、认识大语言模型3.1 什么是大语言模型大语言模型Large Language ModelLLM是基于大规模神经网络参数规模通常达数十亿至万亿级别如 GPT-3 有 1750 亿参数、通过自监督或半监督方式在海量文本上训练的语言模型。拆开来看它由四个核心概念构成① 神经网络 —— 模型的大脑神经网络模仿人脑的工作方式是一个团队工作流程。教小朋友识别猫时不会只给一条规则有胡子就是猫兔子也有胡子而是让他看很多猫的图片——视觉神经协同工作神经元分工负责识别神经元 A尖耳朵神经元 B胡须神经元 C毛茸茸的尾巴这些神经元一层层传递和组合信息最后大脑综合判断这是猫神经网络就是模拟这个过程由大量虚拟的神经元参数和连接组成前一层输出作为后一层的输入。通过海量数据训练网络自动调整每个参数的值最终形成一套复杂的判断流水线——有的参数负责识别猫的眼睛有的负责识别轮廓。② 自监督学习 —— 自己给自己当老师想象自学一门外语没有老师出题批改那就拿一本小说自己玩完形填空——随机盖住一个词根据上下文猜它是什么。一开始猜得乱七八糟但看了成千上万本书后语法、词汇搭配、上下文逻辑都了如指掌甚至能自己写出流畅文章。自监督学习就是“完形填空”的过程步骤做法面对数据海量没有标签的原始文本互联网上的文章、网页创造任务遮住一句话中间的词根据上下文预测反复练习亿万次练习后深刻学会语言规律完全不需要人工标注语法成分自监督学习 让模型从数据本身找规律自己给自己当老师。③ 半监督学习 —— 少量名师 海量自学用学做菜打比方来源相当于作用师傅教的招牌菜麻婆豆腐、宫保鸡丁少量有标注数据打下基本功尝遍天下美食、自己研究门道海量无标注数据自己摸索规律结合师傅教的基本功 自己的品尝经验最后不仅能复刻招牌菜还能创新出新菜式。半监督学习 少量标注数据 大量无标注数据共同提升学习效果。④ 语言模型 —— 超级自动补全手机打字时输入今天天气真输入法会自动提示好、不错、冷——输入法内部就有一个小型语言模型根据前文计算下一个词最可能是什么。大语言模型就是这个逻辑的超级放大版。3.2 大语言模型总结大语言模型 大规模神经网络超级团队工作流程 数百亿/万亿参数脑细胞 语言模型超级自动补全通过自监督/半监督学习从互联网海量文本中学会了语言规律。四大特点特点说明规模巨大参数数十亿至万亿级能处理更复杂全面的信息百万大军 vs 小分队通用性强学到的是语言世界的底层规律语法、逻辑、知识关联能举一反三涌现出聊天、翻译、写代码等能力训练方式不同主要靠自监督学习从无标注文本自学不依赖昂贵的人工标注所以能做很大交互方式革命不用点按钮/写代码直接用自然语言下指令Prompt说写一首关于春天的诗就能写四、提示词编写4.1 核心思想换位思考假设 AI 对你的信息一无所知你需要清晰、具体、无歧义地告诉它要素说明要什么明确目标在什么背景下提供上下文以什么方式呈现指定输出形式再配合示例、角色扮演、具体约束、迭代优化沟通效果显著提升。4.2 CO-STAR 结构化框架先看对比感受差距❌ 优化前模糊低效我该怎么吃才能更健康✅ 优化后清晰有效角色你是一个基于科学证据的 AI 营养顾问。重要约束所有建议仅为通用信息不能替代专业医疗诊断给出具体建议前必须声明免责条款。任务基于以下用户信息提供个性化每日饮食原则性建议。用户信息年龄 30 岁 · 男性 · 目标减脂增肌 · 办公室久坐每周 3 次力量训练回答要求先输出免责声明核心原则围绕控制总热量摄入确保充足蛋白质早餐/午餐/晚餐/训练加餐各给 1 条核心建议推荐 2 种适合的健康零食不推荐任何保健品或药物输出格式【免责声明】→【核心原则】→【分餐建议】→【健康零食推荐】为什么有效把角色、约束、任务、背景、输出格式全部显式化模型不再猜你的意图。4.3 少样本提示Few-shot Prompting给 AI 提供一两个输入-输出示例让它照葫芦画瓢——不是在下指令而是在教它你想要的格式、风格和逻辑。适用场景格式固定、风格独特、逻辑复杂的任务风格仿写、数据提取、复杂格式生成。示例对比方式提示词❌ 零样本2 9 等于多少?✅ 少样本根据以下示例处理问题。示例12 3 5示例24 7 11现在请分析2 9 等于多少?优势通过示例隐式传递规则比文字描述更直观尤其适合符号或自定义逻辑场景。4.4 零样本链式思考Zero-shot-CoT在提示词末尾加一句魔法短语——请一步步进行推理并得出结论强制 AI 在给出答案前先进行内部推理。适用场景任何需要一点逻辑思考的问题即使你不清楚具体步骤。示例罗杰有五个网球他又买了两盒网球每盒有3个网球请问他现在总共有多少个网球请一步步进行推理并得出结论。AI 输出罗杰最初有5个网球。 买来的网球数量2 × 3 6个。 因此总共有5 6 11个。 答案11个网球。本质这句指令相当于引导模型的注意力机制——告诉模型在生成最终答案前先在文本序列中模拟出一个缓慢、有序的推理上下文从而减少跳跃式错误。4.5 自我批判与迭代要求 AI 生成答案后从特定角度审查并优化自己的答案——把生成和评审两个步骤分离利用 AI 的批判性思维提升质量。适用场景代码审查、文案优化、论证强化、安全检查。示例编写代码后自检方式提示词❌ 优化前写一个Python函数计算列表中的最大值。✅ 优化后步骤一写一个 Python 函数find_max步骤二请从代码健壮性和可读性角度审查空列表如何处理命名是否清晰给出优化后的最终版本。五、LLM 的接入方式直接与大模型提供方交互的方式有三种方式一句话概括API 远程调用调云端现成接口最主流开源模型本地部署模型跑在自己机器上SDK 官方客户端库API 的封装写代码更顺手5.1 API 接入最主流适合快速开发、集成到现有应用、不想管理硬件资源。通过 HTTP 请求RESTful API直接调用云端的模型服务。代表厂商OpenAI (GPT-4o)、Anthropic (Claude)、Google (Gemini)、百度文心一言、阿里通义千问、智谱 AI 等。典型流程步骤做法1. 注册获取 API Key平台注册获得身份验证密钥2. 查阅 API 文档了解端点、参数模型名/提示词/温度/最大长度3. 构建 HTTP 请求用requests等库Key 放 Header提示词放 JSON 请求体4. 发送并处理响应解析 JSON提取生成文本5.2 本地部署数据安全/离线把开源 LLMLlama、ChatGLM、Qwen 等部署在自己硬件上——下载权重用推理框架加载运行再按类似 API 的方式交互。典型流程步骤做法1. 获取模型Hugging Face国外、魔搭社区国内下载权重2. 准备环境NVIDIA GPU 驱动 推理框架3. 选推理框架见下表4. 启动服务本地 API 服务器如http://localhost:8000像云端 API 一样调用推理框架特点vLLM高吞吐量推理性能极佳TGIHugging Face 出品功能全面Ollama一键拉取运行小白友好LM Studio图形化界面像用软件一样跑模型以 Ollama 为例① 下载官方地址 Ollama② 拉取模型事项说明默认存储路径C:\Users\XXX\.ollama改路径方式一配置环境变量OLLAMA_MODELS ${自定义路径}改路径方式二Ollama 界面设置查找模型Ollama下载并运行ollama run deepseek-r1:1.5b5.3 SDK 接入API 的封装本质上是对 API 的封装简化——官方 SDK 封装底层 HTTP 细节提供符合编程习惯的函数库。pip install openai from openai import OpenAI client OpenAI(api_keyyour-api-key) response client.responses.create( modelgpt-5, input介绍一下你自己。 ) print(response.output_text)六、嵌入式模型6.1 认识嵌入模型先区分两类模型模型目标大语言模型生成式理解输入并生成新文本回答问题、写文章。内部也使用嵌入技术但目标是创造嵌入模型表示式不生成文本而是为输入创建富含语义的数值表示向量嵌入Embedding的核心思想计算机擅长数字但不理解文字、图片。嵌入就是把人类符号单词、句子、产品、用户、图片转换成数字列表向量并且保留原始语义和关系——相当于把人类语言翻译成计算机的数学语言。关键结论既然是数学语言就能用数学方式比较向量相似度从而实现度量语义。6.2 嵌入模型的应用场景① 语义搜索Semantic Search方式原理优势传统搜索关键词匹配简单直接语义搜索查询和文档都转成向量算相似度即使没有确切关键词也能检索到② 检索增强生成RAG—— 当前 LLM 应用的核心模式环节说明用户提问例如今年新增的带薪育儿假政策具体怎样语义搜索嵌入模型在知识库人事制度文档、福利备忘录中找到相关条款交给 LLM将【条款】【问题】一起提交生成准确具体的摘要好处答案准确且时效性强解决知识陈旧问题而不是凭训练数据瞎编。③ 推荐系统原理用户和物品都转成向量——喜欢相似物品的用户向量接近相似物品的向量也接近算相似度即可精准推荐。案例用户 A 喜欢《盗梦空间》《黑镜》系统发现与也喜欢这两部的用户向量很接近而这些用户普遍还喜欢《星际穿越》——尽管 A 从没看过系统仍会推荐它。④ 异常检测原理正常数据的向量聚集在一起新数据向量远离聚集区 可能是异常点垃圾邮件、欺诈交易。案例信用卡反欺诈——海量正常交易的向量形成正常聚集区当一笔高额异地交易出现向量落在聚集区外系统自动标记为潜在欺诈并告警。七、复盘附答案 思考题什么是模型为什么说模型是一套从数据中学到的规则而不是人为写死的程序大语言模型与传统小模型最核心的区别有哪些提示规模、通用性、训练方式、交互方式为什么自监督学习能在不需要人工标注的情况下学会语言规律请用完形填空比喻解释。提示词为什么重要少样本提示和零样本链式思考Zero-shot-CoT分别靠什么提升效果LLM 的三种接入方式API / 本地部署 / SDK各适合什么场景嵌入模型如何实现语义搜索RAG 又为什么能解决知识陈旧 答案模型是从数据中学习规律的数学函数。训练师给它看海量例子它自己摸索出规则而不是程序员手写规则。学成后给新输入它能根据学到的规律预测输出——所以模型本质是学出来的规则/模式。四点区别规模巨大参数数十亿到万亿级通用性强学到语言底层规律能举一反三、涌现多种能力训练方式不同自监督学习无标注自学不依赖人工标注交互方式革命自然语言 Prompt 直接对话不用写代码。自监督学习 完形填空模型面对海量无标签文本自己给自己创造任务——遮住一个词、根据上下文预测它。亿万次练习后深刻学会语法、词汇搭配与逻辑因此不需要人工标注自己就能当自己的老师。提示词是模型理解需求的唯一通道清晰、具体、无歧义才能得到高质量输出。少样本提示给一两个输入-输出示例让模型照葫芦画瓢、隐式传递格式规则零样本链式思考在末尾加请一步步推理强制模型先生成有序推理过程再作答显著提升逻辑题正确率。API最主流适合快速开发、不想管理硬件本地部署适合数据敏感、需离线/高性能场景vLLM/TGI/Ollama 等框架SDK本质是 API 封装代码更符合编程习惯。嵌入模型把文本转成向量用相似度做语义匹配——没有确切关键词也能检索到RAG 先检索知识库相关内容、再连同问题交给 LLM注入实时外部知识从而解决训练数据过时的问题。 闭幕从模型是什么到大语言模型从提示词工程到LLM 接入方式再到嵌入模型与 RAG——这一篇帮你把大模型的入门地图走了一遍。如果本文对你有帮助欢迎点赞 ⭐收藏 关注作者 留言交流你的疑问或补充你的每一次互动都是我继续更新的动力我们下一篇见
返回列表