AI-Powered Oncall Agent

让 AI 替你值班 不再被凌晨电话叫醒

80% 的告警不值得叫醒人。AI 自动诊断、自动修复,人只需审批关键操作。从告警到恢复,秒级响应。

0%
MTTR 降低
0%
P4 自动处理率
<30s
告警到响应
7×24
全天候在线
Pod CrashLoopBackOff OOMKilled 磁盘使用率 >90% SSL 证书即将过期 数据库连接池耗尽 CPU 持续 >85% 慢查询堆积 服务 5xx 率飙升 Nginx 502 Bad Gateway 内存泄漏 OOM Pod CrashLoopBackOff OOMKilled 磁盘使用率 >90% SSL 证书即将过期 数据库连接池耗尽 CPU 持续 >85% 慢查询堆积 服务 5xx 率飙升 Nginx 502 Bad Gateway 内存泄漏 OOM
On-call 的真相

告警不是问题,人工处理才是瓶颈

凌晨 3 点被叫醒,一看——Pod OOMKilled,restart 就好。这类告警占 60%,每次都消耗一个工程师的睡眠。

60% 告警不值得叫醒人
Pod 重启、磁盘清理、证书更新——标准 SOP,AI 完全可以自动完成
人工处理平均 30 分钟
起床 → 开机 → 查日志 → 定位 → 修复。同样的流程 AI 30 秒完成
初创公司没有专职 SRE
开发兼任 on-call,白天写代码晚上值班。AI on-call 是 7×24 SRE 能力的平价替代
oncall_timeline.log
03:14 [告警] payment-svc CrashLoopBackOff
03:16 [人工] 被电话叫醒,打开电脑
03:19 [人工] kubectl logs --tail=100
03:23 [人工] 定位根因:数据库连接超时
03:25 [人工] 重启 Pod,恢复正常
03:45 [人工] 写复盘,睡不着了
总耗时 31 分钟 · AI 可以在 30 秒内完成
工作原理

告警 → 诊断 → 安全执行

三步闭环,从告警到恢复全自动。权限闸门 + 运行时保护,确保 AI 只做对的事。

Step 1
告警接入 & AI 诊断

对接 Prometheus / Grafana / PagerDuty / Datadog。AI 自动查日志、拉指标、比对近期变更,秒级定位根因。

 支持所有主流监控平台 webhook
 并行诊断:日志 + 指标 + 变更记录
 匹配历史告警库,秒级命中已知故障
Step 2
权限闸门

AI 诊断后提出修复方案,但不是所有操作都能自动执行。分级策略决定:自动执行、人工审批、还是立即升级。

 P4 低级告警 → AI 自动修复
 P3 中级告警 → AI 提出方案,人工审批
 P2/P1 高危 → 立即通知人工值班
Step 3
安全兜底

这是 oncall.ren 与所有其他 AI on-call 的根本区别。即使 AI 判断错误,也破坏不了生产环境——进程级白名单,默认拒绝。

 进程白名单:不在白名单的命令无法执行
 文件保护:关键配置和数据文件只读
 K8s 管控:删除命名空间等操作物理阻断
Unified Platform
统一运营面板
告警、诊断、操作、复盘,全部数据一目了然
实时告警中心
活跃告警列表,AI 诊断进度,处理状态一目了然
审批工作流
P3 操作推送审批,一键 approve/reject,全链路审计
成本 & 效率分析
MTTR 趋势、AI 处理率、token 成本、人工时间节省
核心壁垒

为什么 oncall.ren 敢让 AI 执行

其他 AI on-call 只能「建议」。我们敢「执行」——因为有权限闸门和运行时保护。

权限闸门
DeepGate — 每个操作都经过验证

AI 的每一次操作都经过权限引擎检查。RBAC + ABAC + JIT 动态授权。高危操作自动拦截并推送人工审批。

RBAC 权限模型JIT 临时授权高危操作审批全链路审计
运行时保护
DeepCore — 即使 AI 失控也破坏不了

进程级白名单,默认拒绝、按需授权。不管 AI 输出什么命令,不在白名单的无法执行。这是最后一道物理防线。

进程白名单文件保护K8s 管控攻击链阻断
系统架构

Hermes + DeepGate + DeepCore
三层防线,安全可控

从告警接入到安全执行,每一层各司其职。AI 的每一次操作都经过权限验证和运行时保护。

Hermes Agent
AI Oncall Brain · 值班大脑
告警接入 + AI 诊断 + 决策执行
Prometheus / Grafana 告警接入 P1–P4 智能分级 并行日志/指标/变更诊断 历史故障匹配 修复方案生成
DeepGate
AI Bastion · 权限闸门
操作请求 ↓ 权限验证 → 放行 / 审批 / 拒绝
P4 低危 → 自动放行 P3 中危 → 人工审批 P2/P1 高危 → 锁定升级 RBAC + JIT 动态授权 全链路操作审计
DeepCore
Runtime Security · 运行时保护
最后一道防线 — 即使 AI 失控也破坏不了
进程级白名单 默认拒绝,按需授权 文件 & 配置保护 K8s 操作管控 攻击链自动阻断
价值量化

把 SRE 时间还给真正重要的事

01
时间
每月节省 180+ 小时

50 人团队月均 140 次告警,90 次可自动处理。SRE 只需关注真正严重的问题。

02
速度
MTTR 从 30 分钟降至 30 秒

AI 不需要起床,不需要开机,不需要回忆昨天改了什么。告警到达即诊断,秒级定位修复。

03
安全
AI 执行,人不背锅

权限闸门 + 运行时保护双重兜底。AI 的每一个操作都可追溯、可审批、可阻断。即使误判也不会造成生产事故。

不在凌晨被叫醒,把 on-call 变成 oncall.ren

AI 处理 80% 的低级告警,你的团队只需关注真正需要人类判断的 20%。从此 on-call 不再是惩罚。

预约演示 →
立即开始

让 AI 替你值班

AI 诊断,安全执行,人工兜底。on-call 从未如此轻松。

7×24 全天候 · 秒级响应 · 安全可控 · 零代码接入