ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

generative-ai-for-beginners 第14课:生成式 AI 应用生命周期——从 MLOps 到 LLMOps 的范式迁移与落地实践

generative-ai-for-beginners 第14课:生成式 AI 应用生命周期——从 MLOps 到 LLMOps 的范式迁移与落地实践 generative-ai-for-beginners 第14课生成式 AI 应用生命周期——从 MLOps 到 LLMOps 的范式迁移与落地实践【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners对于任何 AI 应用而言AI 能力的有效性都是关键问题AI 是一个快速演进的领域要确保你的应用保持相关、可靠和稳健就必须持续地监控、评估并改进它——这正是生成式 AI 生命周期要解决的问题。本文基于 generative-ai-for-beginners 课程第 14 课《The Generative AI Application Lifecycle》系统讲解生成式 AI 生命周期框架你将理解 MLOps 到 LLMOps 的范式迁移、LLM 应用的三大阶段构思/探索、构建/增强、运营化及其外围管理循环掌握以质量、伤害、诚实、成本、延迟为核心的五维评估指标并了解 PromptFlow、Azure AI 平台等生命周期工具链的分工与用法。为什么需要生成式 AI 生命周期生成式 AI 生命周期是一个指导你完成生成式 AI 应用开发、部署、维护全流程的框架。它的价值在于帮助开发者完成四件事定义目标明确应用要解决的业务问题度量表现用可量化的指标持续衡量模型与应用的质量识别挑战在迭代中尽早暴露质量、成本、合规等方面的短板落地方案将改进措施提示词优化、RAG、微调等工程化地实施。同时遵循该生命周期有助于将应用与所在领域的伦理和法律标准、与利益相关方的期望对齐从而确保应用持续交付价值。本课涵盖四个主题理解从 MLOps 到 LLMOps 的范式迁移Paradigm ShiftLLM 生命周期The LLM Lifecycle生命周期工具链Lifecycle Tooling生命周期指标化与评估Lifecycle Metrification and Evaluation。从 MLOps 到 LLMOps范式迁移大语言模型是 AI 工具箱里的新工具。它们在分析与生成任务上极其强大但这种能力也改变了我们流水化 AI 与经典机器学习任务的方式。要在新动态下以正确的激励机制驾驭 LLM就需要一个新范式。课程给出了一个直观的命名把旧一代 AI 应用归类为ML Apps新一代 AI 应用归类为GenAI Apps或简称 AI Apps这反映了各阶段的主流技术与方法论。围绕这一转变MLOps 与 LLMOps 的差异可以从四个维度对比对应上图中 Traditional MLOps 与 LLMOps 两列维度Traditional MLOpsLLMOps受众AudiencesML 工程师、数据科学家ML 工程师、应用开发者共享资产Assets to share模型、数据、环境、特征LLMs、agents、plugins、prompts、chains、APIs指标/评估Metrics/evaluations准确率Accuracy质量accuracy、similarity、伤害bias、toxicity、诚实groundedness、成本token per request、延迟response time、RPS模型来源ML models从零构建Build from scratch预构建、微调后以 API 提供MaaS可以注意到三点关键变化重心转向应用开发者LLMOps 更多面向 App Developers集成integrations成为关键点模型以模型即服务Models-as-a-Service, MaaS的方式消费而不是像传统 MLOps 那样由 ML 工程师从零构建并托管模型。共享资产变了传统流水线共享的是模型、特征、训练环境与数据LLMOps 时代团队共享的核心资产变成了提示词prompts、工具链chains、插件plugins与 API 端点。评估指标从单一准确率扩展为五维这正是下一节的核心。LLMOps 的五维评估指标在 LLMOps 语境下好不好不再只是一个 accuracy 数字而是五个维度Quality质量响应质量Harm伤害负责任 AIResponsible AI关注偏见与毒性等风险Honesty诚实响应的有据性groundedness——说得通吗正确吗这直指幻觉问题Cost成本解决方案的预算约束Latency延迟单 token 响应的平均时间。这五个指标贯穿课程的其他章节可以在本仓库中找到对应的深入展开关于Harm参见 第 3 课负责任地使用生成式 AI其中系统讨论了幻觉、有害内容、公平性等风险类别关于Quality/Honesty 的改进手段提示词工程见 第 4 课 与 第 5 课进阶提示RAG 见 第 15 课微调见 第 18 课关于运营期的安全护栏参见 第 13 课保护生成式 AI 应用其中讨论了数据投毒等威胁与缓解实践。LLM 生命周期三大阶段与外围管理循环先看一下 LLMOps 生命周期信息图与 MLOps 的传统生命周期相比LLM 生命周期多了许多新要求提示词工程Prompting、多样的质量提升技术Fine-Tuning、RAG、Meta-Prompts、负责任 AI 的评估与责任以及前面提到的新评估指标Quality、Harm、Honesty、Cost、Latency。以构思Ideate环节为例我们会用提示词工程在各种 LLM 上做实验探索可能性、检验假设是否成立。需要特别注意的是LLM 生命周期不是线性的而是相互集成的循环integrated loops——迭代进行并被一个更大的外围循环overarching cycle所统摄。下面是生命周期各阶段的详细工作流这张图看起来可能有点复杂先聚焦三大步骤。阶段一Ideating / Exploring构思与探索按图中蓝色泳道这一阶段包含四个动作Identify business use case识别业务用例按业务需求展开探索Connect to your data连接你的数据源Build your basic prompt flow构建基础提示词流PromptFlow 原型Develop flow based on prompt to extend the capability基于提示词扩展能力开发完整的提示词流。目标是快速构建原型Prototype验证它是否足以支撑你的假设Hypothesis。阶段二Building / Augmenting构建与增强对应图中粉色泳道核心是两轮评估 一个不满足就回退的迭代结构Run flow against sample data在样本数据上运行提示词流Evaluate prompt flow评估提示词流的表现Modify flow (prompts and tools, etc.)若不满足Satisfied? No修改提示词、工具或流程结构重新评估Run flow against larger dataset在更大规模的数据集上运行Evaluate prompt flow / Satisfied?再次评估。不满足则回退到修改流程满足则进入下一阶段。这一阶段意味着开始实施 Fine-tuning、RAG 等技术来验证解决方案的鲁棒性。如果指标不达标重新实现、在流程中增加新步骤、或重构数据都可能有帮助。当流程与规模都通过测试、指标Quality、Harm、Honesty、Cost、Latency也达标时即可进入下一步。阶段三Operationalizing运营化对应图中紫色泳道包含三个动作Deploy endpoint部署服务端点Add monitoring and alerts为系统添加监控与告警体系Integrate into application将端点集成到你的应用。完成这三步你的 AI 应用就真正进入可运行operational状态了。外围循环Management管理在三大阶段之上还有一个统摄性的管理循环聚焦于安全Security合规Compliance治理Governance。它像图中每个泳道顶部的环形一样罩住整个生命周期意味着安全、合规与治理不是一次性关卡而是持续贯穿探索、构建与运营各阶段的横向约束。生命周期指标化与评估Metrification and Evaluation原文将Lifecycle Metrification and Evaluation列为本课四大主题之一。结合前文的五维指标可以把它理解为为生命周期的每个阶段选择合适的度量方式并让指标驱动迭代决策。从课程脉络可以这样把指标落到具体环节部分为基于原文的整理归纳指标探索/构建阶段关注点运营化阶段关注点Quality样本数据上响应的准确率、相似度更大规模数据上的稳定表现Harm提示词流输出的偏见、毒性评估线上输出的持续监控与告警Honesty响应是否有据、是否正确groundedness幻觉率的可观测性通常依赖 RAG 类手段Cost单次请求 token 成本、方案预算规模化后的总预算控制Latency单 token 平均响应时间响应时间、RPS 等服务级指标原文给出的关键判断标准是After testing our flow and our scale, if it works and check our Metrics, it is ready for the next step.即指标同时是是否进入下一阶段的准入门槛。这一指标即门禁的思路正是 LLMOps 区别于以离线 accuracy 为唯一出口的传统 MLOps 的核心。生命周期工具链工具层面微软提供了Azure AI 平台Azure AI Platform与PromptFlow用于让生命周期易于实现并快速投产。Azure AI 平台与 AI StudioAzure AI 平台提供 AI StudioWeb 门户它允许你探索模型、示例与工具管理你的资源使用 UI 开发流可视化流程使用 SDK/CLI 选项进行 Code-First 开发。此外Azure AI 支持使用多种资源来管理你的运营、服务、项目、向量检索vector search与数据库需求——这与本仓库 第 15 课 RAG 与向量数据库中用向量数据库存储嵌入、构建检索索引的实战场景直接呼应。PromptFlow从 POC 到大规模应用用 PromptFlow 可以从概念验证POC一路构建到大规模应用Design and Build在 VS Code 中设计并构建应用提供可视化与功能性工具Test and fine-tune轻松测试与微调应用以获得高质量 AI 效果Integrate and Iterate借助 AI Studio 在云上集成与迭代通过 Push 与 Deploy 快速完成集成。将上述工具与三大阶段对照可以得到一个粗略的职责映射此为基于原文的归纳PromptFlow 主要覆盖探索/构建阶段的原型与评估循环AI Studio 的资源管理与部署能力则支撑运营化阶段的端点部署、监控与集成。小结本课建立了一个贯穿生成式 AI 应用全生命周期的框架范式层面LLMOps 相对 MLOps 的重心从从零建模型转向以 MaaS 方式消费模型、由应用开发者驱动、以集成资产prompts/chains/plugins/APIs为核心流程层面构思/探索 → 构建/增强 → 运营化三大阶段配以外围的安全、合规、治理管理循环且整体是迭代循环而非线性流程指标层面Quality、Harm、Honesty、Cost、Latency 五维指标既是评估体系也是阶段准入的门禁条件工具层面PromptFlow 负责原型到生产提示词流的开发与迭代AI Studio 负责资源管理与云端集成部署。掌握这套生命周期后建议继续学习 第 15 课检索增强生成RAG与向量数据库——理解 RAG 与向量数据库如何影响生成式 AI、如何为应用注入你的私有数据从而构建更具吸引力的生成式 AI 应用。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表