ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

人工智能70年:从学科诞生到大模型本地部署与API调用实践

人工智能70年:从学科诞生到大模型本地部署与API调用实践 今年是2026年人工智能这个学科正式走到第70个年头。1956年夏天达特茅斯学院的一场暑期研讨会第一次把“Artificial Intelligence”作为学科名称固定下来也因此被视为AI的诞生原点。但70年这个数字本身不重要。重要的是这70年里AI从一批数学家和逻辑学家脑中模糊的想法变成了今天程序员桌面上可以本地运行的模型、可以批量调用的API、可以嵌入业务系统的推理服务。这篇文章不打算写空洞的“致敬历史”而是站在2026年的技术视角把AI这70年的演进路径、当前的技术栈以及一个普通开发者如何从零开始把AI用到自己的项目里完整梳理一遍。你会看到AI的核心范式怎么从符号推理走到统计学习再到今天的预训练大模型当前本地部署一套AI服务需要什么硬件、多少显存、哪些启动方式大模型API怎么调用、批量任务怎么设计以及新手最容易踩哪些坑。1. AI 70年发展速览先给一张缩略表把70年的关键节点和当前技术状态放在一起方便对照。时期关键事件技术范式代表成果1950s图灵测试提出达特茅斯会议召开符号主义萌芽逻辑推理程序、早期搜索算法1960s-1970s感知机兴起与低谷连接主义早期尝试单层神经网络、感知机模型1980s专家系统进入商业应用知识工程、符号推理DENDRAL、MYCIN1990s-2000s机器学习走向统计化统计学习、核方法、集成学习SVM、随机森林、贝叶斯网络2012AlexNet在ImageNet夺冠深度学习的爆发起点GPU加速的卷积神经网络2017Transformer论文发表注意力机制、预训练范式Attention Is All You Need2020s大模型与多模态时代预训练微调RLHFGPT系列、LLaMA、Stable Diffusion2026年现在本地部署、小模型、智能体、科学计算高效推理、模型压缩、RAG、AgentOllama、ComfyUI、vLLM、各类端侧模型从这张表能看出一条清晰的逻辑AI并没有在某个节点突然“变聪明”而是每一次技术范式的切换都让模型从“更会推理”走向“更会学习”最后在算力和数据的推动下变成了今天这种“规模即智能”的形态。2. 为什么1956年被称为AI学科诞生年1956年之前图灵已经在1950年发表了《计算机器与智能》提出了著名的图灵测试麦卡洛克和皮茨也早在1943年就给出了神经元的数学建模。但这些成果还分散在数学、逻辑学、神经科学里面没有形成统一的学科方向。达特茅斯会议真正做的事情是把一群不同背景的学者聚到一起明确提出能不能造一台机器让它模拟人类学习、推理、使用语言、感知环境会议提案里甚至乐观地预测一个夏天就可以解决其中若干问题。事实当然没有这么快但这次会议定义了AI要解决的问题集合也催生了“人工智能”这个正式术语。所以说1956年是AI的学科诞生年不是因为之前没人研究AI而是因为从这一年开始AI有了自己的学科共同体、自己的问题域、自己的评价标准。这对后来70年的技术发展和人才培养都是源头意义上的节点。站在2026年回看历史细节已经不重要重要的是理解这种“问题域”的延续。今天的大模型做数学题、写代码、识别图像本质上还是在回答达特茅斯会议提出的那些问题机器能不能学习能不能理解语言能不能感知世界3. 从符号主义到连接主义三起两落的范式变迁AI的70年并不是一路高歌而是经历了至少两次“寒冬”每一次寒冬背后都是技术范式的局限。第一轮兴起是符号主义主导。研究者认为智能的核心是逻辑推理只要把知识规则写进程序机器就能表现出智能。专家系统在1980年代一度非常成功企业用它做化学结构分析、疾病诊断政府也投入了大量资金。但后来发现人类知识极度庞杂规则越写越多却始终无法覆盖例外情况系统变得脆弱且难以维护AI第一次进入低谷。第二轮兴起源于统计学习和连接主义。从2006年深度信念网络开始“深度学习”这个概念重新回到主流2012年AlexNet在ImageNet上的成绩让全球研究者意识到神经网络加上GPU算力可以解决传统方法无法突破的视觉识别问题。此后十年CNN、RNN、LSTM、Transformer逐步登上舞台。真正把AI推向大规模应用的转折点是2017年的Transformer架构。它用自注意力机制解决了长距离依赖问题让模型可以并行训练超大语料。随后GPT系列把“预训练微调”的范式跑通参数规模从亿级涨到千亿级Scaling Law成为新的信仰。理解这段历史对开发者有实际意义今天选择AI技术方案时不必纠结“符号主义还是连接主义”而是要看清当前范式的边界在哪里。大模型擅长统计关联和模式生成但真实的严谨推理、工具调用、长程规划仍需要外部工程手段补足比如RAG、结构化提示词、Agent框架。4. 当前AI技术栈云服务、开源模型与本地部署到了2026年AI技术栈已经高度分层。日常开发可以选择的方式大致有三类在线API服务、开源模型本地部署、以及介于两者之间的私有化托管。在线API最省事开箱即用按Token计费适合原型验证和中小流量场景。典型能力包括文本生成、图像生成、语音合成等。缺点也明显数据要出网单位成本会随调用量上升企业内部敏感数据不适合直接传上去。开源模型本地部署是过去两年热度持续上升的方向。你可以在自己的GPU服务器上跑Llama系列、Qwen系列、DeepSeek等开源模型数据不出本机推理成本可控还能针对业务做微调。门槛在于硬件和工程能力需要至少一块消费级显卡或一块专业GPU显存越大越好需要处理依赖环境、模型文件下载、推理服务启动等一系列问题。本地部署并不是正反面替代API而是互补。同一个项目里可以把简单任务交给大模型API把高频且敏感的任务放到本地模型或者先用API验证效果再迁移到本地版本。如果你打算本地跑模型最关心的问题通常是我的显卡够不够显存多少能跑什么模型有没有一键启动的整合包能不能提供HTTP接口方便接到自己的程序里支不支持批量任务下面专门展开本地部署这部分。5. 本地部署一套大模型服务的通用流程模型参数、推理框架和量化方式决定了部署策略。下面给出一套通用的本地部署检查清单和流程具体路径要按你选择的模型和框架调整。5.1 硬件检查首先看自己的设备。NVIDIA显卡优先因为CUDA生态最成熟。显存大小决定了你能加载的模型规模4GB显存适合跑7B参数模型的小量化版通常配合CPU offload速度较慢体验一般。6GB-8GB显存可以跑7B-14B参数的量化模型日常问答、代码生成基本可用。12GB-16GB显存可以跑32B左右的量化模型或者14B模型的大上下文版本效果明显更好。32GB以上可以考虑70B量化模型或者多卡推理适用质量较高的长文本任务。没有独立显卡的机器可以采用纯CPU推理但不是所有模型都能跑得动。7B模型量化后在CPU上生成速度通常只有每秒几到十几个Token体验比较勉强。5.2 推理框架选择常见的本地推理框架有Ollama安装简单命令一行就能拉模型并启动服务适合个人体验和快速原型。vLLM吞吐量高支持批量推理适合部署成内部API服务。llama.cpp轻量级跨平台CPU/GPU混合推理适合资源受限环境。Transformers PEFT灵活度最高适合做微调和研究但对工程部署要求高。如果是第一次尝试推荐Ollama。它帮你把依赖、模型目录、服务接口都打包好了比较容易跑通。5.3 安装示例以下命令以Linux环境和Ollama框架为例Windows/macOS可以直接用安装包。# 安装OllamaLinux curl -fsSL https://ollama.com/install.sh | sh # 启动服务 ollama serve # 拉取一个7B量级模型这里以常见开源模型为例 ollama pull qwen2.5:7b # 运行一次交互式对话 ollama run qwen2.5:7b启动后默认会在本机的11434端口提供HTTP服务。这个服务本身就兼容OpenAI风格接口可以在项目里直接用。如果你想换一个模型比如想用更小的4bit量化版本可以在Ollama模型库中搜索对应标签替换。5.4 检查服务状态服务跑起来后用curl快速验证curl http://127.0.0.1:11434/api/generate \ -H Content-Type: application/json \ -d { model: qwen2.5:7b, prompt: 请用一句话解释什么是人工智能。, stream: false }如果返回内容里包含了回答文本说明服务已经正常。6. 大模型接口API调用示例本地模型服务只要能提供HTTP接口就可以接入到自己的代码里。下面给出一个Python调用示例使用requests库向Ollama接口发送请求。import requests url http://127.0.0.1:11434/api/chat payload { model: qwen2.5:7b, messages: [ {role: user, content: 写一段Python代码实现文件批量重命名。} ], stream: False, options: { temperature: 0.7 } } response requests.post(url, jsonpayload, timeout120) data response.json() print(data[message][content])需要注意不同框架的接口路径和参数格式不一样。如果你用的是vLLM通常会暴露一个兼容OpenAI的/v1/chat/completions接口参数结构接近GPT接口。使用前先看对应框架的文档。7. 批量任务与工程化设计大模型接口的价值很大程度上体现在批量任务处理上。最常见的场景包括批量给文章生成标题和摘要。批量对评论做情感分类。批量把非结构化文本转成JSON。批量生成训练数据用于微调。批量任务不能简单写一个for循环直接调接口要考虑速度、失败重试和资源占用。下面是一个基础批量任务设计思路import time import requests import json def call_model(prompt, retries3): url http://127.0.0.1:11434/api/generate payload { model: qwen2.5:7b, prompt: prompt, stream: False } for attempt in range(retries): try: resp requests.post(url, jsonpayload, timeout120) if resp.status_code 200: return resp.json()[response] except Exception as e: print(fretry {attempt 1}: {e}) time.sleep(2 ** attempt) return None tasks [ 为这篇技术文章写一个摘要..., 把这句话翻译成英文..., 从这段文本中提取所有时间、地点、人物..., ] for idx, task in enumerate(tasks): result call_model(task) print(idx, result) time.sleep(1) # 避免瞬时压力过高实际生产中建议把任务列表放到队列里逐条记录成功/失败状态输出结果单独落盘。例如用Redis做任务队列用SQLite记录处理进度这样哪怕服务中断也能从断点继续处理。批量任务还要注意并发控制。如果本地显卡只有8GB显存同时并发太多请求会导致显存溢出。可以先从并发1开始调逐步试探出自己硬件的吞吐上限。8. 资源占用与性能观察方法本地部署最直观的指标是显存占用和生成速度。建议在推理时观察以下内容# 实时查看GPU占用 nvidia-smi -l 1这条命令每秒刷新一次可以看到显存使用率、GPU利用率、温度。如果显存占用接近上限模型很可能会被换到内存或报CUDA Out of Memory。影响性能的主要因素包括模型参数量7B、14B、32B、70B参数量越大显存占用和推理时延越高。量化方式4bit量化比8bit快显存占用低但输出质量可能有微小下降。上下文长度输入和输出的Token数越多显存占用和计算量越大。并发数同时请求数增加吞吐量可能提升但延迟也会变高。采样参数top_p、temperature不会显著影响速度但max_tokens限制输出长度会直接影响生成耗时。如果你发现响应很慢优先检查是否开启了超大上下文或者模型量化级别太低。可以用更小的模型、更短的上下文、更低的并发数来降低资源压力。CPU推理和GPU推理差距非常大。同一个7B量化模型在消费级GPU上可能每秒生成20到50个Token在CPU上通常只有每秒1到10个Token。所以本地部署不要指望用CPU跑大模型来做实时对话。9. 常见问题与排查方法本地部署AI服务新手容易遇到的问题集中在依赖安装、模型下载、显存不足和接口调用失败。下面列一个排查表问题现象可能原因排查方式解决方案服务启动失败端口被占用、依赖缺失检查日志、netstat -anp | grep 11434换端口或重装依赖模型拉取缓慢或失败网络问题、模型仓库不可达查看下载日志使用镜像源或手动下载模型文件显存不足报错模型过大或并发过多nvidia-smi查看显存占用换更小的量化版本降低批次/并发API返回超时模型推理太慢、prompt太长调大timeout、检查GPU占用缩短上下文使用流式返回中文回答乱码或崩坏模型本身能力不足或未适配用其他模型对比测试换合适模型或调整提示词批量任务跑到一半卡住程序崩溃、网络不稳定查看日志、数据库记录增加重试机制断点续跑输出质量不稳定温度参数过高、模型太弱多次采样对比降低temperature换强模型大部分问题都可以归为两类环境问题和参数问题。环境问题靠看日志和检查依赖解决参数问题靠对比实验解决。10. 从70年历史看当下AI开发者该怎么学习回到“人工智能70年”这个主题我更想说的是这个学科走到今天已经不只是科研人员的事。你现在学到的AI知识点和1956年那批学者脑中想象的AI已经完全不同但底层的问题还是那些怎么让机器理解人、语言和世界。如果你现在想入门AI建议按这个顺序走先理解基本概念机器学习、深度学习、大模型、Token、Prompt、微调、RAG、Agent。不要一上来就啃数学公式。动手跑通一个小模型用Ollama拉一个7B模型在本地聊几句观察显存和速度。学会调用API用Python写几个调用文本生成、图像生成的例子理解请求-响应结构。做一个完整的批量任务场景比如用大模型批量清洗数据写日志、加重试、存结果。再往深走学习Transformer结构、注意力机制、量化原理然后根据工作需要选微调还是RAG。AI训练师、提示词工程、模型微调这些岗位的出现说明这个行业已经从“研究模型”转向“应用模型”。广大开发者的机会不在于重新发明一个Transformer而在于把已有的模型能力接到真实业务里解决具体问题。这也是为什么我一直建议了解一点历史但不要停留在历史里。70年来AI每次低谷都是因为过度承诺每次爆发都是因为某一项真实能力突破。2026年的今天大模型已经是可以随手调用的工程工具下一步就是看你愿意拿它做什么。建议先从小模型、小批量、小任务开始跑通第一个AI应用。那比读十篇历史文章有用得多。
返回列表