API reliability monitoring:从实施到决策
完整的 api reliability monitoring 测量循环连接一个拥有的工作流程、一个有界事件契约、一个受控装置和一个有人可以采取行动的问题。
- 1
设定边界
记录来自服务器处理程序的已完成和失败的 API 请求。
- 2
捕捉结果
Begin with api_request_started, api_request_completed, api_request_failed and document the grain of each event.
- 3
证明行数
创建错误率、p95 延迟和最失败路由的仪表板和警报。
- 4
做出决定
哪些路由的 p95 延迟最慢?
用例与模板
选择要衡量的内容
使用用例指南来选择结果、事件边界和分析问题。当您准备好接受较短的复制粘贴实施简介时,请打开匹配的模板。
代理提示
将其粘贴到您的编码代理中
更换 YOUR_API_KEY 注册后,然后要求智能体运行产品流程并验证第一个事件。
API reliability monitoring 设置提示
添加 Telemetry 仪器以确保 API 可靠性。
使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY
请使用 route_template、method、status_code、status、latency_ms、user_id 或 team_id(如果可用)、request_size_bytes、response_size_bytes 和 error_type 记录每个重要的 API 端点。
创建:
1. API请求事件表。
2. 请求量、错误率、p50 和 p95 延迟以及排名靠前的失败端点的图表。
3. 5xx 速率升高、p95 延迟缓慢和流量突然下降的警报。
不要记录请求正文、身份验证标头、cookie、机密或原始用户内容。设置步骤
- 1记录来自服务器处理程序的已完成和失败的 API 请求。
- 2使用路由模板而不是原始 URL 来保持基数干净。
- 3捕获状态、延迟、方法、功能、团队和错误类型。
- 4创建错误率、p95 延迟和最失败路由的仪表板和警报。
要捕获的事件
由此解锁的问题
- 哪些路由的 p95 延迟最慢?
- 哪些客户帐户会受到错误的影响?
- 哪里的流量突然下降或激增?
事件模式示例
此工作流的事件模式
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 告警
将经过审查的可靠性查询提升到拥有的阈值和响应工作流程中。
相关 SQL 查询示例
更多 SQL 示例
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
按路由计算 API 请求吞吐量
哪些 API 路由每分钟处理的请求最多?
打开查询示例测量 API 429 速率限制恢复
收到 HTTP 429 的请求重试后能否成功恢复?
打开查询示例计算事件检测和恢复时间
每项服务需要多长时间来检测事件并从事件中恢复?
打开查询示例按路由计算API错误率
在至少有 20 次请求的 API 路由中,哪些路由的 5xx 错误率最高?
打开查询示例计算 p50、p95 和 p99 API 延迟
哪些端点的尾部延迟最差?
打开查询示例按路由计算API超时率
哪些 API 路由超时的频率足以影响用户?
打开查询示例比较依赖性 p95 延迟
哪些下游依赖项的尾部延迟和故障率最差?
打开查询示例根据 SLO 衡量 API 可用性
每项服务是否达到其每日可用性目标?
打开查询示例计算 API 错误预算消耗率
API 消耗其 99.9% 可用性预算的速度有多快?
打开查询示例按版本比较 API 可靠性
哪些版本会出现更严重的 API 错误或尾部延迟?
打开查询示例按客户影响对错误指纹进行排名
哪些错误组影响最多的客户帐户?
打开查询示例比较功能推出错误率
功能标志的推出是否不如其对照群体可靠?
打开查询示例按计划衡量事件对客户的影响
每个计划中有多少个账户受到该事件的影响?
打开查询示例客户案例
相关客户案例
相关页面