开源 AI 运维 Agent,告警来了不用半夜扒面板
做运维的朋友,应该都体会过那种崩溃时刻。
凌晨两三点,手机告警疯狂轰炸。从睡梦中爬起来,打开一堆系统面板:Prometheus 看指标、Loki 查日志、Grafana 看图表、Jaeger 追踪调用链路。
窗口来回切换,在一堆零散信息里面拼凑故障线索。等把根因定位出来,大半宿已经过去了。
市面上运维工具越堆越多,监控组件一套又一套,但真正出事的时候,大部分工作依旧靠人肉翻数据、拼线索。人变成了各个监控系统之间的 “数据搬运工”。
最近看到一个开源项目 Ongrid,主打 AI‑Native 运维 Agent,目标就是把运维工程师从重复排查工作里解放出来,把人从采集信息的角色,变回做最终决策的决策者。
![]()
一句话运维排查
传统运维平台,一打开扑面而来全是图表、指标、各种配置项。
Ongrid 的交互思路完全反过来。进入工作台,你直接用自然语言下达指令,中文就可以。
![]()
比如直接输入:找出当前 CPU、内存压力最大的三台机器,给出指标和判断依据。
Agent 会自动完成整套动作:并行拉取多维度指标,如果接口拿不到数据,会自动切换查询方式;
发现指标异常,主动追加更多查询,核对进程、告警、负载基准。
它不是一问一答的聊天机器人,而是会自己规划排查路径,遇到阻碍主动换方案,看到疑点主动深挖。
内部还可以调度 SRE、网络、数据库方向的子智能体协同处理。每一步调用工具都会留下完整记录,方便事后审计复盘。
平台顶部直观展示集群整体状态:在线设备数量、未确认告警、会话统计、LLM 消耗 Token。
同时提供快捷卡片,点一点就能完成常见查询,上手门槛很低。
零入站端口,浏览器直接 SSH 连内网机器
运维最头疼的一块,就是机器访问权限与安全平衡。
很多环境里,为了 SSH 登录,需要开放 22 端口,配置跳板机,分发密钥,每多开一个端口,就多一份攻击风险。
Ongrid 的 Edge Agent 走反向隧道模式。机器上的 Agent 主动向外建立加密连接,本机不需要开放任何入站端口,22、80、443 全部可以关闭。
所有命令、SSH 会话、文件传输,全部走主机向外发起的隧道反向传输。
在 Web 界面点一下终端按钮,浏览器直接拉起真实 SSH 会话,直接操作内网服务器。
不用跳板、不用密钥分发,所有操作全程审计留痕。安全层面的设计,对私有化环境非常友好。
部署方式
支持 Ubuntu22.04+、Debian12+、RHEL/Rocky9。
按服务器架构下载最新 release(linux-amd64 或 linux-arm64),解压后运行安装脚本(Ubuntu 22.04+、Debian 12+、RHEL/Rocky 9):
按服务器架构选择对应命令:
AMD64
wget https://github.com/ongridio/ongrid/releases/download/v0.14.0/ongrid-v0.14.0-linux-amd64.tar.xz
tar -xf ongrid-v0.14.0-linux-amd64.tar.xz && cd ongrid-v0.14.0-linux-amd64
sudo ./install.shARM64
wget https://github.com/ongridio/ongrid/releases/download/v0.14.0/ongrid-v0.14.0-linux-arm64.tar.xz
tar -xf ongrid-v0.14.0-linux-arm64.tar.xz && cd ongrid-v0.14.0-linux-arm64
sudo ./install.sh中国大陆用户 — GitHub 较慢时,选择对应架构的 CDN 镜像地址下载:
# AMD64
wget https://ongrid.cloud/dl/ongrid-v0.14.0-linux-amd64.tar.xz# ARM64
wget https://ongrid.cloud/dl/ongrid-v0.14.0-linux-arm64.tar.xz
普通告警,大多只是冷冰冰阈值通知:Swap 使用率超过 50%、磁盘占用过高。
收到告警之后,怎么定位根因,依旧要工程师手动去翻日志、查指标。
![]()
Ongrid 的 RCA 根因分析,就是补齐这最后一公里。
当告警触发,AI Agent 自动启动故障分析,调用多类工具,输出完整根因报告。会写明故障根因、精确到设备 ID、PID、服务名称,附带完整证据链,关联相关告警,给出优先级明确的处理建议,同时算出故障的业务影响范围。
举个原文里的例子:swap 高告警触发,34 秒完成分析,调用 14 个工具,置信度 90%,直接定位是 Milvus 向量数据库内存吃满,大量占用 Swap。
不用人工在指标日志之间来回比对,指标异常窗口和日志事件,Agent 自动对齐,把证据链整理完毕给到工程师。
内置运维知识库
光靠大模型本身的知识,做运维故障排查很容易纸上谈兵。
Ongrid 内置 96 篇运维知识库,其中 70 篇是现成诊断 Playbook。覆盖大量线上高频故障:OOMKilled、DNS 解析失败、文件句柄耗尽、Node 异常、路由丢包、NFS 卡死等等。
![]()
Agent 做故障排查的时候,会自动检索这套知识库,把真实 SRE 排障经验融入诊断流程。企业也可以上传自己内部文档,md、txt、pdf、docx 都支持,也可以对接私有仓库,让 AI 熟悉自家业务系统的特有问题。
整套 Agent 一共封装 33 个技能工具,一部分运行在设备端,一部分运行在平台侧,包含多事件关联、业务拓扑影响面计算、主机只读 shell、文件快照、网络命名空间检查等。
注意:主机 shell 默认是只读沙箱策略,只做诊断,每一次调用全部留审计日志,避免 AI 随意修改线上环境。大模型自由切换
项目不绑定特定大模型厂商。
OpenAI、Anthropic、智谱 GLM、DeepSeek、Kimi、Gemini,填入对应 API Key 即可使用。
![]()
切换模型不需要重启服务,大概 60 秒自动生效,聊天界面下拉直接切换,RCA 根因分析、对话、翻译全平台同步生效。不想用某个厂商,不填 Key 就不会出现在选项里。
同时支持飞书、钉钉、企业微信、Slack、Telegram 五大 IM 双向通道。告警消息可以推送过来,也可以直接在群聊里面下发运维指令,手机上看到告警,直接在 IM 群下达排查指令,不用登录后台。
Apache2.0 开源
这是这个项目最有分量的一点:完全开源,Apache2.0 协议,支持完整自托管部署。
一条 docker compose 命令,就可以拉起整套栈,Prometheus、Loki、Tempo、Grafana 整套可观测组件一并部署在自己服务器。
指标、日志、SSH 会话记录、告警、对话记录全部保存在自己机房,不会流出。金融、政企等对数据隔离要求高的场景非常适配。
没有黑盒,Agent 每一步决策逻辑、工具调用都可以看源码。如果担心 AI 在生产环境乱操作,可以直接修改源码,裁剪、限制 AI 可用工具,权限规则自己说了算。
开发者也可以源码编译部署,复制示例环境变量文件,执行make compose‑up,浏览器访问本地地址即可打开工作台。
最后
现在很多 AI 运维产品,大多停留在 “基于已有监控数据做聊天问答”。
Ongrid 的思路不一样:把对话交互、Agent 智能调度、服务器远程访问、完整可观测栈、运维知识库、IM 联动全部整合到一套开源系统。
把翻面板、查指标、拼凑线索这些重复体力活交给 Agent,工程师专注做判断、做决策。
当然它也不是万能银弹,AI 给出的根因报告依旧需要运维人员复核。
但不可否认,这类 AI‑Native 运维 Agent,会是未来运维一个很重要的发展方向。
项目还在快速迭代,官方也在呼吁社区开发者参与贡献,感兴趣的同学可以去 GitHub 体验一下。
⭐ GitHub:https://github.com/ongridio/ongrid
文末小提示:开源工具上生产环境,务必做好权限管控,充分测试之后再落地。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.