创建您的第一个仪表板和告警
仪表板应保留经过审查的答案。告警应识别具有所有者和有用响应的状况。不要仅仅因为其图表看起来合理而推广未经验证的查询。
本演练从 编写第一个 Telemetry SQL 查询 中的请求量和错误率 SQL 开始。
创建一个面向决策的小部件
在 Telemetry 中运行查询,选择与结果匹配的图表,然后选择“添加到仪表板”。
对于 API 错误率结果:
- 当时间是主要维度时,请使用折线图。
- 比较一小组路线模板时使用条形图。
- 当精确值、数量阈值和多个度量必须保持可见时,请使用表格。
在决定之后命名小部件,而不是实施。 “按路由划分的 API 服务器错误率”比“查询 7”更清楚。
保持分母可见。在一个请求中出现 1 个错误的路由不应默默地超越在 10,000 个请求中出现 500 个错误的路由。包括请求量和错误百分比,或在 SQL 中强制执行最小量条件。
保持第一个仪表板较小
有用的第一可靠性仪表板可能包含:
- 随着时间的推移请求量。
- 随着时间的推移,服务器错误百分比。
- 按路线划分的 p95 延迟。
- 主要错误类别或指纹。
- 仅当访问获得批准时才会显示受影响帐户的表。
每个小部件应链接回可检查的行或保存的 SQL。避免在多种图表样式中重复相同的指标。
请参阅 创建仪表板 了解布局和所有权指南。
创建有界告警
从一根时间序列线开始:x 轴上的时间,y 轴上的一个数字指标,并且没有分组或拆分。 Telemetry 仅为这一狭窄图表形状提供创建告警,因为阈值、最近点窗口、状态和通知均涉及一个有序信号。分组图表会让人不清楚是否有任何一条线、每条线或每条线独立控制告警。
在仪表板上保留多行比较。对于告警,过滤到一个群体,故意聚合组,或者在组需要不同的阈值或所有者时创建单独的告警。请参阅 告警 了解完整的原理和示例。
打开经过验证的单线图或查询结果,然后选择“创建告警”。定义:
- 聚合和测量。
- 最后评估的数据点数量。
- 比较和阈值。
- 评估区间。
- 是否忽略不完整的最新存储桶。
- 拥有响应的接收者。
对于综合开发表,从非寻呼电子邮件告警开始。生产示例可能是:
p95 of the last 5 completed data points is greater than 850 ms
或:
server_error_pct is greater than 5% and requests is at least 100
确切的阈值取决于服务目标、流量模式和响应策略。复制的数字不能替代基线。
测试两边的条件
发送受控合成事件应该:
- 将告警保持在阈值以下。
- 将结果移至阈值以上。
- 向预期收件人发出通知。
- 恢复后返回阈值以下。
记录查询、阈值、收件人和响应链接。然后从生产报告中删除或明确隔离合成行。
定义响应
每个告警都需要一个简短的操作:
- 打开相关仪表板。
- 检查受影响的路由、版本和帐户。
- 与请求或工作流标识符关联。
- 决定是否缓解、回滚或继续观察。
- 分别记录恢复时间和客户影响。