ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Agent OS:当企业拥有上千个智能体,谁来管理它们?(第7期)

Agent OS:当企业拥有上千个智能体,谁来管理它们?(第7期) Agent OS当企业拥有上千个智能体谁来管理它们第7期专栏《大模型落地之道智能体生态卷》作者Valhalla Matrix治理实验室文章类型原创技术实践与方法论总结适用读者技术负责人、架构师、AI 产品负责人、研发管理者本文讨论一种面向多智能体系统的基础设施抽象Agent Operating System简称 Agent OS。文中涉及的论文观点仅作为技术讨论背景不代表本文对其结论进行了复现实验。参考方向Towards an Agent Operating System: Lessons from Classical and Cloud OSarXiv:2607.25076Metis: Memory Foundation ModelarXiv:2607.26760Memory Decoder at Scale: A Pretrained, Parametric Long-Term MemoryarXiv:2607.27919一、问题不再是“模型够不够强”过去讨论 AI 应用时重点通常是模型参数规模推理速度上下文窗口工具调用能力单次任务成功率。但当企业开始同时运行几十、几百甚至上千个智能体时问题会发生变化。系统需要回答的不再只是这个智能体能不能完成任务而是它可以访问哪些数据它可以调用哪些工具它能运行多长时间它占用多少计算资源它失败后如何停止和恢复多个智能体之间如何共享信息哪些操作必须经过人工审批一个智能体失控后如何避免影响整个系统这与早期计算机从“程序直接运行在裸机上”转向“由操作系统统一管理进程”非常相似。操作系统解决的并不是某个程序的业务逻辑而是为大量程序提供统一的基础能力资源抽象 进程调度 权限控制 隔离运行 生命周期管理 故障恢复多智能体系统也正在遇到同一类问题。当智能体从单个应用功能变成一种可大规模运行的计算单元时系统需要一个类似操作系统的管理层。二、什么是 Agent OSAgent OS 不是一个更大的语言模型也不只是一个任务编排器。更准确地说它是一层位于智能体应用和底层计算资源之间的基础设施负责统一管理智能体的运行环境、状态、权限和资源。可以将它抽象为用户或业务系统Agent OS 管理层智能体调度权限与策略记忆与状态工具与外部服务隔离与执行环境审计、监控与恢复模型服务与计算资源它至少需要处理五类核心职责。Agent OS 职责传统操作系统类比对智能体系统的意义资源抽象文件、内存、设备统一访问数据、模型和工具调度进程调度管理优先级、并发度和资源配额隔离进程、容器、用户空间限制故障和越权影响范围生命周期启动、暂停、终止管理创建、恢复、取消和回收权限控制用户、组和系统调用权限约束智能体可以执行的操作这五项能力共同决定了一个多智能体系统能否从演示环境走向长期运行。三、Agent 与传统进程有哪些相似之处将 Agent 类比为进程并不是说二者完全相同而是因为它们都具有几个重要特征1. 都会消耗系统资源一个智能体运行时可能消耗模型推理额度CPU 和 GPU内存文件系统空间网络带宽外部 API 配额数据库连接人工审批资源。如果没有统一的资源管理少数长时间运行或高频调用的智能体就可能占满系统资源。2. 都需要明确的生命周期一个完整的智能体生命周期可能包括创建 - 初始化配置 - 分配记忆空间 - 获取任务 - 调用模型和工具 - 暂停或恢复 - 完成任务 - 保存结果 - 终止与回收如果系统只关注“启动智能体”而忽略暂停、超时、取消和回收就容易出现僵尸任务重复执行状态丢失资源泄漏失败任务不断重试。3. 都需要隔离智能体可能读取文件、运行命令、访问数据库或调用第三方服务。不同智能体之间如果共享完整权限就会形成较大的风险面。理想情况下每个智能体都应该拥有明确的运行边界可访问的项目 可读取的数据 可调用的工具 可使用的网络 可消耗的额度 可修改的资源隔离并不一定意味着每个智能体都要启动一台虚拟机。根据风险和性能要求可以采用不同层级隔离层级适用场景逻辑隔离低风险、只读任务进程隔离普通本地工具调用容器隔离需要执行代码或访问独立环境沙箱隔离处理不可信输入或高风险命令独立运行环境高敏感、高权限或强合规场景四、记忆为什么像 Agent OS 的存储层对传统程序来说文件系统和数据库用于保存状态对智能体来说记忆承担着类似作用。但智能体记忆并不只是“把聊天记录保存下来”。它至少包括用户偏好任务历史项目上下文工具使用记录已确认的事实中间推理结果失败经验跨会话的工作状态。如果所有内容都塞进当前上下文系统会面临几个问题上下文窗口有限历史信息难以检索不同任务之间容易相互污染敏感记忆难以进行权限控制信息生命周期无法管理。因此Agent OS 中的记忆层更像一个经过治理的状态系统任务输入记忆检索相关上下文模型推理工具执行结果评估记忆写入索引、权限与生命周期管理记忆层需要解决的四个问题持久化记忆应当跨越单次会话存在但不是所有内容都永久保存。可检索系统需要根据任务、用户、项目和时间范围查找相关信息而不是简单地线性加载全部历史。可治理记忆应当具备所属主体访问权限来源信息创建时间过期时间删除机制修改记录。可解释当智能体依据某条记忆作出决策时系统最好能够回答这条信息来自哪里 什么时候写入 谁可以修改 是否经过人工确认 当前是否仍然有效因此“记忆越多越好”并不是正确目标。更重要的是记忆的准确性、相关性、来源和可控性。五、一个具体场景1000 个智能体同时运行假设企业部署了一个包含 1000 个智能体的任务系统一部分负责代码分析一部分负责客户支持一部分负责数据处理一部分负责监控和告警一部分负责自动生成报告。如果没有统一的基础设施系统可能出现以下情况场景缺少统一管理有 Agent OS 管理层资源使用各任务相互争抢按优先级和配额调度文件访问权限边界模糊按项目和任务隔离工具调用每个智能体自行配置统一注册和授权失败处理任务可能持续重试超时、取消并自动回收记忆共享上下文互相污染按主体和权限检索故障影响单点故障可能扩散失败域隔离审计追踪难以还原行为记录任务、工具和权限事件一个成熟的调度器至少要考虑任务优先级 资源配额 并发上限 超时策略 重试次数 依赖关系 人工审批 故障隔离调度目标也不能只有“尽快完成”。在企业环境中还需要同时考虑成本延迟可靠性权限数据敏感等级业务优先级合规要求。六、权限不要只给 Agent 一个“能或不能”传统权限模型经常是二元判断允许 拒绝但智能体执行任务时权限通常需要更加细致。例如以下几种操作的风险并不相同读取公开文档 读取内部代码 修改测试文件 修改生产配置 发送外部邮件 删除数据库记录可以采用分层能力模型能力层典型操作默认策略L1读取文件、查询资料可自动执行L2修改非关键文件、生成补丁受限执行并保留回滚L3调用外部服务、发送消息明确授权后执行L4修改生产状态、删除数据强制审批并完整审计这里的关键不是简单地给 Agent 打一个“可信”标签而是将权限绑定到具体操作谁发起 执行什么操作 操作作用于什么资源 使用什么凭据 风险等级是多少 是否需要审批 结果如何记录即使是长期运行、历史表现良好的智能体也不应因为“信任度较高”而绕过高风险操作的审计与审批。七、Agent OS 的控制闭环一个可持续运行的系统不能只负责执行还要持续观察执行结果并调整策略。可以将这个过程表示为Monitor采集运行事件Analyze分析风险与结果Plan调整策略、配额和权限Execute应用策略并执行任务每个环节都需要有明确输入和输出。Monitor观察什么任务成功率工具调用次数权限拒绝次数异常和超时资源消耗数据访问范围人工干预次数重试与回滚情况。Analyze如何分析不能只看“任务是否完成”还要看是否通过不安全方式完成是否访问了不必要的数据是否频繁触发权限边界是否产生高成本调用是否出现异常重试是否与历史行为明显偏离。Plan调整什么降低或提高资源配额收紧工具权限增加人工审批暂停某类任务更新检索范围调整重试和超时策略。Execute如何落地将策略应用到下一次任务记录策略变更原因保留原有审计信息支持撤销错误调整避免调整逻辑本身失去监督。八、三个容易踩中的误区误区一把 Agent OS 做成一个超大的总控服务如果所有功能都集中在一个服务中短期看起来便于管理长期可能导致权限边界混乱单点故障部署和升级困难不同团队无法独立演进任何变更都影响全局。更合理的方式是明确划分调度层 策略层 执行层 记忆层 协议层 审计层模块可以独立演进但通过稳定的接口和事件协议协作。误区二把记忆等同于向量数据库向量检索只是记忆系统的一种实现方式并不能解决全部问题。一个可用的记忆系统还需要考虑原始来源文档版本时间有效性冲突信息访问权限删除请求事实确认召回结果排序。“能检索出来”不代表“应该被使用”。误区三把成功率当成唯一评价指标如果只奖励任务完成率智能体可能倾向于选择风险更高的捷径跳过必要审批忽略数据权限反复尝试高成本操作隐藏失败原因。更完整的评价体系应同时关注任务结果 安全性 可解释性 成本 延迟 资源使用 权限合规 人工干预次数九、从工程角度如何开始建设不建议一开始就建设完整的“智能体操作系统”。更现实的路径是从最小可用闭环开始。第一阶段统一任务和工具协议先统一以下对象Agent Task Tool Resource Permission Memory AuditEvent每个对象都需要有明确的标识、状态和生命周期。第二阶段建立执行边界为每个任务定义工作目录可访问资源可调用工具最大运行时间最大资源额度是否允许网络是否需要人工审批。第三阶段补充审计和恢复至少记录谁创建了任务使用了哪个模型调用了哪些工具修改了哪些文件使用了哪些凭据任务何时开始、结束或失败是否发生重试、回滚和人工接管。第四阶段再建设统一记忆层记忆层应先解决正确性和权限问题再追求复杂的检索和学习能力。建议从以下字段开始memory_id owner source content created_at updated_at expires_at sensitivity access_policy verification_status第五阶段引入策略自动调整当系统积累足够的运行事件后再考虑根据数据调整任务优先级工具权限资源配额审批阈值检索范围自动恢复策略。自动调整必须保留人工覆盖和回滚机制。十、如何判断一个 Agent OS 是否成熟可以从以下四个问题开始评估1. 资源是否可管理系统是否知道每个智能体消耗了多少模型、计算、存储和外部服务资源2. 权限是否可解释系统是否能够说明某次操作为什么被允许使用了哪条策略3. 状态是否可恢复任务中断后能否从明确的检查点继续而不是从头开始或重复执行4. 故障是否可隔离一个智能体出现异常时系统能否限制其影响范围并保证其他任务继续运行如果这四个问题无法回答即使单个智能体表现良好整个多智能体系统仍然可能不具备稳定运行能力。十一、结语Agent OS 的核心价值不是把智能体变得更聪明而是让大量智能体能够被可靠地运行、观察、限制和恢复。它需要从传统操作系统和云基础设施中吸收已经验证的工程思想资源抽象 统一调度 权限控制 运行隔离 状态管理 故障恢复 行为审计与此同时智能体又带来了新的挑战行为具有概率性工具调用路径动态变化记忆会影响后续决策任务目标可能存在歧义模型输出不等于安全计划成功结果不一定代表过程合规。因此未来的智能体基础设施不会只是“模型调用平台”也不会只是“工作流编排器”。它更可能是一套围绕任务、资源、权限、记忆和审计建立的系统级运行环境。单个智能体解决的是一个任务Agent OS 解决的是一群智能体如何长期共存。参考资料Towards an Agent Operating System: Lessons from Classical and Cloud OSarXiv:2607.25076Metis: Memory Foundation ModelarXiv:2607.26760Memory Decoder at Scale: A Pretrained, Parametric Long-Term MemoryarXiv:2607.27919
返回列表