ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

3步跑通keep:新手友好的AIOps告警管理实战

3步跑通keep:新手友好的AIOps告警管理实战 3步跑通keep新手友好的AIOps告警管理实战【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨三点手机把你吵醒。同一个数据库连接池打满的故障二十分钟里群里刷了 30 条几乎一样的告警。第 30 条的时候没人知道该点哪一条。告警聚合是这类场景里最该先做的事。keep 是一个开源的智能运维平台把散落在各处的告警收进一个口子去重、关联、值班这些事都替你做。用一句话定义 keep告警界的总机keep 告警的统一入口。Prometheus、Datadog、Grafana 的告警全部汇进同一张列表。keep 告警的降噪器。按指纹判断同一个故障自动合成一条不再刷屏。keep 工作流自动化引擎。「告警来了 → 条件命中 → 执行动作」用一段 YAML 写完。Alertmanager 做到「分组转发」就停了Grafana OnCall 做到「排班通知谁」就停了。keep 额外解决两个问题跨源的告警聚合、去重和关联以及告警进来之后「干什么」的自动化。速览 keep 的五大核心能力统一告警视图左侧按严重度、状态、来源筛选右侧表格列出每条告警的状态和最近接收时间。支持批量操作一个视图看全量。告警去重基于指纹字段做判断选哪些字段参与合并都在界面里配。同一个故障后续再报多少条都折进同一条里。AI 关联分析用 Transformer 模型从你历史的告警和事件里学习关联关系新告警进来自动归组根因浮出来的速度比人快。自动化工作流工作流用 YAML 写界面也能点点点拼出来。触发、步骤、动作、条件全部可组合仓库里就有上百个现成例子。多源接入工具把告警推给 keepkeep 也可以反过来主动从监控源拉。推送和拉取两个 tab各家的流量一眼看清。 用 docker-compose 5 分钟跑起 keep不需要任何配置三步克隆仓库并进入目录。git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep一键拉起容器。docker-compose up -d浏览器打开 http://localhost:3000。看到的就是告警 Feed 页左边筛选面板右边告警列表数据实时刷新。后端 API 在 8080 端口。默认 compose 里数据库用的 SQLite数据落在 state 目录重启不丢。认证方式、数据库连接这些参数细节直接看 README.md不用在这里展开。 接 Prometheus 只需改 3 行配置打开 prometheus/prometheus.yml加一个 alerting 段核心就是指向 keep 后端的那几行alerting: alertmanagers: - static_configs: - targets: - keep-backend:8080Prometheus 的告警触发后会以 Alertmanager 格式发给 keep 后端自动出现在列表里。如果你的 Prometheus 不在同一个 compose 里把 keep-backend 换成 keep 的实际域名或 IP 就行。告警规则照旧写在 Prometheus 的 rule 文件里keep 不改变你的监控侧只负责收。动手写一条 服务宕机发 Slack 的工作流三步触发条件 → 绑定动作 → 保存。触发条件告警名称匹配 highload 时执行也可以改成任意字段过滤。绑定动作接上 Slack provider写好消息模板。保存界面里点 Create a workflow把 YAML 贴进去即可。workflow: id: service-down-to-slack name: 服务宕机通知 triggers: - type: alert filters: - key: name value: highload actions: - name: notify-slack provider: type: slack config: {{ providers.slack }} with: message: {{ alert.name }} down完整语法在 docs/workflows/overview.mdx上百个跑通的例子在 examples/workflows/照着抄最快。想接 LLM 做分析把 provider 类型换成 openai 或 anthropic 就行结构不用动。进阶让 keep 替你值班的 3 个玩法告警分组防风暴按 provider 写去重规则一个故障只出一条风暴变滴答。LLM 根因初判工作流步骤里挂 LLM provider告警先让它读一遍、给出初判人来确认。生产部署K8s 部署方式在 docs/deployment 目录数据库换成 PostgreSQL 做持久化再打开认证。这些都只是冰山一角。源码就摆在明面keep/workflowmanager/ 是执行引擎keep/providers/ 是所有集成读源码比读文档更快。把 keep 放进你的值班流程如果你是被多源告警淹没的小团队或个人keep 最适合你。建议先拿测试环境跑一周看看能合并、去掉多少噪音。平时定期看一眼 CHANGELOG.md追新特性不费劲。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表