Better Stack 是一个集正常运行时间和基础设施监控、事件管理、值班安排、错误跟踪和状态页面于一体的平台。我们的 AI SRE 代理不仅会告诉您哪里出了问题,还能帮助您直接通过手机找出原因。
事件警报
通过您偏好的渠道接收事件警报:推送通知、短信、电话、电子邮件、Slack 或 Teams 消息。只需在手机上单击一下即可确认事件,让团队其他成员知道您正在处理。
事件报告
每个事件都会被记录下来,包括屏幕截图、错误消息以及事件发生的逐秒时间线。问题已解决?撰写一份简短的事件回顾,以便整个团队从中学习。
AI SRE
发生事件时,您无需独自调查。点击 AI SRE 选项卡,我们的代理将深入分析您的日志、指标和跟踪记录,梳理最近的部署和指标变化,并精确定位根本原因。它可以发起包含修复的拉取请求,并且始终会先征求您的批准。
值班安排
设置值班轮换、请求替补以及添加值班覆盖。值班同事睡着了?如果无人响应,智能升级机制会自动唤醒下一位值班人员或整个团队。将您的值班安排同步到 Google 日历或 Outlook,以便每个人都知道自己何时值班。
正常运行时间监控
通过来自多个区域的可靠 HTTP(S) 和 ping 检查来监控正常运行时间,频率最高可达每 30 秒一次。
心跳监控
使用我们的心跳监控功能来监控您的 CRON 脚本和后台作业,再也不用担心数据库备份丢失。
错误跟踪
使用与 Sentry 兼容的错误跟踪功能来跟踪整个堆栈中的异常。请求 AI SRE 调查任何错误并将其追溯到引入该错误的变更。
状态页面
当系统出现故障时,您的团队并非唯一需要了解情况的人。创建品牌化的公共状态页面,让您的客户随时了解最新动态,增强他们对您产品的信心。最棒的是,您只需 3 分钟即可完成所有设置!
丰富的集成功能
可与 100 多个应用程序集成,并连接您的所有基础架构服务。与 Heroku、Datadog、New Relic、Grafana、Prometheus、Zendesk 等众多工具同步。
使用 AI SRE 管理值班、接收事件警报并解决问题