ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从 LLM 到 Agent:一文彻底搞懂什么是 AI Agent

从 LLM 到 Agent:一文彻底搞懂什么是 AI Agent 前言你有了 ChatGPT为什么还想要一个 Agent过去几年大模型LLM彻底改变了我们与软件交互的方式。你问它问题它给你答案你让它写代码它给你代码你让它总结文章它给你摘要。但你会发现一个尴尬的事实它很会说但不会做。在没有工具接入的情况下它不能直接帮你查今天的航班不能帮你把代码提交到 Git不能帮你打开浏览器填表单不能根据中间结果自动调整策略。你只能自己把问题拆成步骤自己复制粘贴到不同工具自己判断下一步做什么自己把结果拼起来。你成了那个“人肉 Agent”。于是AI Agent 出现了。它的目标不是让模型“更会聊天”而是让模型能感知环境、在给定权限和约束下自主决策、调用工具、执行动作并根据反馈持续迭代最终完成一个目标。这篇文章会沿着一条主线讲清楚从“生成”到“行动”LLM 如何进化成 Agent。我们会层层递进先看 LLM 的能力边界再看 Agent 的定义然后拆解核心公式对比常见概念最后用一个完整例子把逻辑串起来。一、LLM 的能力边界会生成不会行动要理解 Agent必须先理解 LLM 到底能做什么、不能做什么。1.1 LLM 的本质一个条件概率生成器从建模角度看自回归语言模型的核心目标可以抽象为P(tokent∣token1,token2,…,tokent−1)P(tokent​∣token1​,token2​,…,tokent−1​)给定前面的 token预测下一个 token。它擅长的是语言理解与生成知识问答代码生成推理在某种程度上多轮对话但它有几个根本限制限制说明模型本身无状态模型本身不保存对话状态对话状态由应用层通过上下文窗口、外部记忆等管理。默认不会跨会话记住信息。无直接行动能力不能直接操作外部世界不能发 HTTP 请求、读文件、点按钮需要外部工具或运行时代执行。无实时信息知识有截止时间无法知道今天的天气、股价、航班除非接入搜索或实时数据。无长期记忆不能持续积累用户偏好、任务历史除非外部记忆系统支持。无运行时反馈闭环生成完就结束不能根据执行结果自动修正除非外部编排循环。容易幻觉会一本正经地胡说八道。所以LLM 是一个强大的推理与生成引擎但它不是一个完整的系统。1.2 把 LLM 包一层就能变成 Agent 吗很多人第一反应是“那我给它加个搜索 API不就能查实时信息了吗”没错这是第一步。但仅仅加一个工具调用还远远不够。因为真实任务往往需要多步决策先查航班再比价再选座再支付状态管理记住用户偏好、当前进度、已选航班异常处理航班售罄怎么办支付失败怎么办动态规划根据中间结果决定下一步。这些不是一次函数调用能解决的。你需要一个循环一个能持续观察、思考、行动的系统。这就是 Agent。二、从“对话”到“做事”Agent 的定义2.1 一句话定义Agent 是一个能感知环境、在给定权限和约束下自主决策、调用工具、执行动作并根据反馈迭代以达成目标的系统。注意几个关键词感知接收用户输入、API 返回、文件内容、网页状态自主决策在权限和约束内自己决定下一步做什么而不是人预先写死调用工具使用外部能力扩展自身边界执行动作真正改变环境或产出结果反馈迭代根据结果调整策略直到完成或失败。2.2 核心公式我习惯用一个公式来概括Agent LLM或策略 规划 记忆 工具 执行循环这个公式是本文的主线。后面我们会逐项拆解但先记住LLM或策略大脑负责推理和决策规划把大目标拆成小步骤记忆保存上下文、状态、经验工具与外部世界交互的手脚执行循环观察 → 思考 → 行动 → 观察 → … → 完成。缺少任何一项Agent 的能力都会大打折扣。2.3 一个更直观的循环图这个循环就是 Agent 的心跳。三、逐项拆解Agent 的五个核心部件3.1 LLM或策略Agent 的大脑LLM 是 Agent 的推理核心。它负责理解用户意图分析当前状态决定下一步动作生成工具调用参数总结结果并输出。但 LLM 不是唯一策略。在传统强化学习中策略可以是一个神经网络在简单规则系统中策略可以是 if-else。但在现代 AI Agent 语境下LLM 通常扮演策略网络 推理引擎的双重角色。3.2 规划把“大目标”拆成“小步骤”规划解决的是“我要完成 X应该先做什么再做什么”常见规划方式任务分解把“订机票”拆成“查日期 → 搜航班 → 比价 → 选座 → 支付”优先级排序先查天气再决定带不带伞路径选择如果 A 方案失败走 B 方案反思与重规划执行后发现不对重新调整。没有规划Agent 就会像无头苍蝇每一步都从零开始。3.3 记忆让 Agent 不再“金鱼脑”记忆分三层类型作用例子短期记忆当前对话上下文用户刚说的“不要转机”工作记忆当前任务状态已选航班、支付进度长期记忆跨会话知识与偏好用户常坐靠窗、喜欢早班机记忆的操作包括写入、检索、压缩、更新、遗忘。没有记忆Agent 每次都要重新问一遍用户体验极差。3.4 工具Agent 的手脚工具是 Agent 与外部世界交互的接口。常见工具类型Function Calling调用预定义函数HTTP API访问外部服务浏览器打开网页、点击、填表单代码解释器执行 Python、计算、绘图数据库查询、写入文件系统读写文件通过 MCP 接入外部工具MCPModel Context Protocol是标准化模型与工具/上下文连接的协议。工具让 Agent 从“会说”变成“会做”。3.5 执行循环Agent 的心跳执行循环是 Agent 最核心的运行时结构。一个典型的循环观察读取当前状态用户输入、工具返回、环境变化思考LLM 推理下一步行动调用工具或输出内容观察获取行动结果判断是否完成未完成则回到第 1 步或第 2 步。这个循环可以运行一次也可以运行几十次。Agent 的自主性就体现在这个循环能自己转起来。四、Agent 与普通程序、工作流、LLM 的区别很多人容易混淆这几个概念。我们用一张表说清楚维度普通程序工作流LLMAgent控制流人写死人预先编排无自主控制流在约束下自主决策输入可固定也可动态固定/半固定自然语言/多模态自然语言 环境输出固定或按逻辑产出固定/半固定文本/多模态动作 文本/多模态工具使用硬编码节点调用可生成工具调用请求但不执行动态选择并调用由运行时执行记忆变量/数据库有限状态上下文窗口短期 长期异常处理异常捕获有限分支无运行时异常捕获依赖外部编排反思重试适用场景确定性任务流程明确任务生成/问答不确定环境任务关键区别工作流步骤是人定的Agent 只是执行者Agent步骤是 Agent 自己定的人只给目标。所以Agent 不是“更复杂的工作流”而是把决策权交给模型的系统。五、一个完整例子订机票 Agent假设用户说“帮我订一张明天去北京的最早航班要靠窗。”一个完整的 Agent 会怎么做5.1 感知解析用户意图目的地北京、时间明天、偏好最早、靠窗。检查记忆用户是否存过身份证、常旅客号5.2 规划步骤 1获取明天日期步骤 2搜索明天飞北京的航班步骤 3按起飞时间排序选最早步骤 4检查靠窗座位步骤 5确认价格和退改签政策步骤 6调用订票 API步骤 7返回订单号。5.3 行动与循环调用日历工具得到明天日期调用航班搜索 API返回 10 个航班调用排序工具选出最早 3 个发现最早航班没有靠窗座位此时出现偏好冲突最早 vs 靠窗Agent 反思是换下一个有靠窗的航班还是问用户是否接受非靠窗根据策略决定询问用户。Agent最早航班 XX 没有靠窗座位。您是要“最早优先接受非靠窗”还是“靠窗优先选下一个有靠窗的航班”用户最早优先接受非靠窗。Agent继续调用订票 API完成支付返回订单号。5.4 这个例子体现了什么自主决策没有靠窗时Agent 自己决定询问用户工具调用日历、搜索、排序、订票 API记忆用户偏好、身份证信息循环多次观察-思考-行动反馈根据 API 返回调整策略。这就是 Agent 和“一次 LLM 调用”的本质区别。六、常见误解Agent 不是万能聊天机器人误解 1Agent 就是更聪明的 ChatGPT不对。ChatGPT 是对话界面Agent 是执行系统。Agent 可能用 ChatGPT 作为大脑但还需要工具、记忆、循环。误解 2Agent 一定要多智能体不对。单 Agent 也能完成很多任务。多智能体是架构选择不是必要条件。误解 3Agent 越自主越好不对。自主性越高风险越大。订机票可以自主转账付款必须人工确认。权限最小化、关键动作人工确认是落地铁律。误解 4Agent 会取代工作流不对。确定性任务用工作流更稳、更便宜。Agent 适合不确定环境、需要动态决策的任务。很多时候最佳方案是工作流 Agent 节点。七、总结Agent 的本质是“在不确定环境中持续决策并执行”回到主线LLM 解决了“生成”Agent 解决了“行动”。Agent 的核心公式Agent LLM或策略 规划 记忆 工具 执行循环它不是一个更花哨的聊天机器人而是一个能感知、会思考、能行动、可迭代的系统。如果你要构建 Agent记住三句话从工作流开始逐步增加自主性。先做可观测性再做自动化。能不用多智能体就不用多智能体。最后说一句技术成长不只是写代码职业规划和自我包装同样重要。我整理了一份简历、面试和职业规划的学习资料适合想在职场上走得更远的朋友看看。资料展示下面是我整理的AI大模型学习资料和工具包预览适合收藏后按主题逐步学习。如果你想看完整资料目录可以在评论区留言「资料」也欢迎告诉我你更关注AI大模型里的哪类内容。
返回列表