Background job failure monitor:实施到决策
将提示视为实施概要。有用的工件不仅仅是复制的代码,而是经过审查的事件契约,可以产生值得信赖的答案。
- 1
设定边界
Instrument the point where job_started becomes final.
- 2
创建合同
Start with job_started, job_completed, job_failed and keep every field typed, bounded, and privacy-reviewed.
- 3
运行夹具
在依赖汇总结果之前,先练习已知的成功、失败、重试和空结果案例。
- 4
回答问题
哪些工作屡屡失败?
模板与用例
使用此模板添加事件
当测量目标已经明确时,复制此模板。使用匹配的用例指南来查看事件边界、成功定义以及生成的 SQL 应支持的决策。
模板
将其粘贴到您的编码代理中
更换 YOUR_API_KEY,在本地运行流程,然后验证生成的事件和仪表板。
后台作业失败监视器
使用 Telemetry 进行仪器后台作业。
使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY
记录 job_started、job_completed、job_failed、job_retried 和 dead_letter_created:
job_name、queue_name、attempt、status、duration_ms、scheduled_at、started_at、completed_at、item_count、retry_count、worker_name 和error_type。
创建查询和仪表板,以显示按作业列出的吞吐量、按作业列出的故障、p95 持续时间、重试量、停滞的作业和最新的死信事件。
请勿记录原始作业负载、凭据、Webhook 正文或客户内容。要捕获的事件
验证清单
完整的埋点通行证留下了什么
活动
综合事件以稳定的名称和字段类型到达预期的表。
查询
第一个 SQL 查询返回具有明确时间窗口的合理行。
意见
仪表板使用真实字段并包含足够的上下文来解释更改。
安全
检查提示、正文、凭据、签名和私人内容是否经过编辑。
事件模式示例
此工作流的事件模式
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 告警
将经过审查的可靠性查询提升到拥有的阈值和响应工作流程中。
相关 SQL 查询示例
更多 SQL 示例
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
测量后台作业重试和失败率
哪些后台作业消耗的重试次数最多或仍然失败?
打开查询示例使用 SQL 查找停滞的后台作业
哪些作业已启动但从未产生终止事件?
打开查询示例测量死信队列增长
哪些队列添加死信作业的速度比解决死信作业的速度快?
打开查询示例检测错过的 Cron 计划
哪些预定作业的运行时间晚于记录的时间间隔?
打开查询示例检测后台作业重试风暴
目前哪些工作类型在重试上花费的工作量最多?
打开查询示例更多模板