
自动重试到多模型兜底Portkey AI Gateway 网关配置完整指南【免费下载链接】gatewayA blazing fast AI Gateway with integrated guardrails. Route to 1,600 LLMs, 50 AI Guardrails with 1 fast friendly API.项目地址: https://gitcode.com/GitHub_Trending/ga/gateway调用 LLM API 时429 限流、高峰宕机、重复请求重复计费是生产环境最常见的三类故障。Portkey AI Gateway 是开源 LLM 网关用一份 JSON 配置即可开启自动重试、多模型 fallback、负载均衡与缓存。这份网关配置教程按「故障现象 → 配置思路 → 关键配置 → 验证」展开读完能落地第一份重试与兜底配置。网关站在哪一层直连 provider 与走网关的差异Portkey AI Gateway 部署在应用与模型 provider 之间请求以 OpenAI 兼容格式进入网关读取配置后路由到 1600 模型响应原路返回。它解决两类问题AI 服务可用性重试、兜底、分流与成本缓存。配置经 SDK 的config参数或x-portkey-config请求头注入与业务代码解耦。对比项直连 provider经过 LLM 网关429/5xx 重试应用层手写循环retry自动重试模型故障多套 client 手动切换fallback自动切备流量分配手动轮询账号loadbalance按权重分流重复请求每次都计费缓存命中直接返回观测各 provider 后台分散统一日志与 trace核心场景实战被限流时LLM 自动重试怎么配现象高峰时段 provider 返回 429用户直接看到请求失败。思路网关按状态码决定是否重试。不写on_status_codes时默认覆盖 429/500/502/503/504写入则只按列表执行用于精确控制重试边界。{ retry: { attempts: 3, // 最大重试次数 on_status_codes: [429] // 仅在限流时重试 } }注入SDK 实例化时传config或裸 HTTP 请求加x-portkey-config头控制台可保存配置后用 ID 引用改配置不用改代码。验证Logs 页能查看该请求的状态码与重试记录重试成功后最终状态码为 200。主模型不可用时多模型兜底链路怎么配现象主模型 5xx 或超时接口整体不可用。思路targets按顺序声明目标fallback策略让网关在前一个目标失败后切换到下一个。不同 provider 的参数要求不同用override_params逐目标适配。{ strategy: { mode: fallback }, targets: [ { virtual_key: openai-key }, { virtual_key: azure-key, override_params: { max_tokens: 512 } } ] }验证请求时附traceID在 Logs 页按该 trace 过滤即可看到实际命中的目标模型与成本。想省钱时缓存与负载均衡怎么开缓存cache: { mode: simple }对完全相同的 prompt 直接返回旧响应semantic按语义相似度匹配近似问题命中后不再调用模型适合 FAQ 类高重复场景。负载均衡strategy.mode设为loadbalance各 target 用weight声明流量占比权重设为 0 即停发该目标可当一键开关用。常见组合是「主模型负载均衡 失败后 fallback 备用模型」写在同一份配置里。从单份配置到整体架构配置是树状的根节点可挂cache、retrytargets内每个目标可再递归声明strategy与targets形成「根 → loadbalance → fallback → 终端模型」的多级结构。配置变复杂后建议在控制台维护并以 ID 引用调权重、换模型不用重新部署。网关支持自托管部署方式见 installation-deployments.md字段示例参考 conf.example.json。验证与常见坑✅ 验证三件套Logs 页看状态码、重试次数与缓存图标Analytics 页看缓存命中率与成本traceID定位单条请求。三个易错的配置裸 HTTP 调用漏掉x-portkey-provider头网关不知道该路由到哪个 provider。以为不写on_status_codes就不重试实际默认就对 429 与 5xx 重试写它是为了收窄范围。兜底目标参数不兼容如 Anthropic 必须带max_tokens忘了override_paramsfallback 触发时反而报错。小结网关配置的价值在于把重试、兜底、分流从业务代码挪进一份声明式 JSON策略调整不再动代码。建议从 自动重试教程 和 负载均衡与 fallback 教程 起步给生产流量加上第一份 retry 配置。【免费下载链接】gatewayA blazing fast AI Gateway with integrated guardrails. Route to 1,600 LLMs, 50 AI Guardrails with 1 fast friendly API.项目地址: https://gitcode.com/GitHub_Trending/ga/gateway创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考