Sidekiq Job Telemetry:从边界到验证行
在受控应用程序边界使用 Sidekiq Job Telemetry,保持事件契约较小,并在构建聚合视图之前验证已知结果。
- 1
选择结果
Sidekiq 重试监控
- 2
定义合同
job_id、job_name、queue_name、状态和尝试
- 3
埋点边界
将收益包装在服务器中间件中,以便每次执行尝试都有一个结果;使用 jid 作为逻辑标识符,并使用 retry_count 加一作为尝试。
- 4
核实证据
Exercise a known fixture, then inspect job_attempt_completed for one correctly typed terminal row.
开始之前
先决条件和界限
- 具有显式打开和读取超时的可重用 Ruby HTTP 包装器
- Sidekiq 服务器中间件在每个工作进程中注册
- 稳定的作业类和队列名称以及批准的错误分类法
交货设置
安装并初始化服务器端
使用带有服务器端密钥以及显式打开和读取超时的小型 Net::HTTP 包装器。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。
- 1准备一个具有有限网络行为的可重用服务器端交付客户端。
- 2在成功、失败、重试或超时边界处添加结果事件。
- 3在启用警报之前发送受控装置并检查存储的行。
片段
从一个结构化事件开始
在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。
Sidekiq Job Telemetry事件
class TelemetryOutcomeMiddleware
include Sidekiq::ServerMiddleware
def call(_job_instance, job, queue)
started_at = Process.clock_gettime(Process::CLOCK_MONOTONIC)
status = "success"
error_type = nil
begin
yield
rescue => error
status = "failed"
error_type = classify_error(error)
raise
ensure
TelemetryHttp.log(
table: "job_attempt_completed",
data: {
job_id: job["jid"],
job_name: job["class"],
queue_name: queue,
attempt: job.fetch("retry_count", -1) + 2,
status: status,
duration_ms: ((Process.clock_gettime(Process::CLOCK_MONOTONIC) - started_at) * 1000).round,
error_type: error_type,
release: ENV["APP_RELEASE"]
}
)
end
end
end活动合约
job_id、job_name、queue_name、状态和尝试
queue_wait_ms、duration_ms、error_type、retry_exhausted 和释放
item_count 或由作业派生的批准帐户上下文,从不序列化参数
实施检查点
检查站 1
将收益包装在服务器中间件中,以便每次执行尝试都有一个结果;使用 jid 作为逻辑标识符,并使用 retry_count 加一作为尝试。
检查站 2
不要在没有重新加注的情况下救援,因为 Sidekiq 必须遵守异常才能应用其重试政策。
检查站 3
如果每次尝试都会发出事件,请明确构建终端成功和重试耗尽指标,以便重试不会增加作业总数。
验证
证明事件已到达
在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。
Sidekiq Job Telemetry 验证查询
SELECT *
FROM job_attempt_completed
ORDER BY timestamp_utc DESC
LIMIT 20;实施参考
在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。
生产边界
保持结果事件小且可恢复
该模式提供了
- 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
- 用于仪表板、警报和跨事件关联的稳定字段。
- 用于验证成功、失败、重试和超时行为的夹具驱动路径。
该模式不提供
- OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
- 仅因为有效负载包含事件 ID,所以仅传送一次。
- 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。
事件架构起点
此工作流程的事件契约
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 告警
将经过审查的可靠性查询提升到拥有的阈值和响应工作流程中。
相关 SQL 查询示例
用 SQL 回答下一个问题
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
测量后台作业重试和失败率
哪些后台作业消耗的重试次数最多或仍然失败?
打开查询示例按作业测量队列等待时间
哪些工作在工人开始之前等待的时间最长?
打开查询示例使用 SQL 查找停滞的后台作业
哪些作业已启动但从未产生终止事件?
打开查询示例测量死信队列增长
哪些队列添加死信作业的速度比解决死信作业的速度快?
打开查询示例检测后台作业重试风暴
目前哪些工作类型在重试上花费的工作量最多?
打开查询示例按实施系列浏览
比较相关集成模式
与此集成配对的模板
更多集成