Background job monitoring:从实施到决策
完整的 background job monitoring 测量循环连接一个拥有的工作流程、一个有界事件契约、一个受控装置和一个有人可以采取行动的问题。
- 1
设定边界
记录 job_started、job_completed、job_failed 和 job_retried。
- 2
捕捉结果
Begin with job_started, job_completed, job_failed and document the grain of each event.
- 3
证明行数
添加针对停滞作业、重复失败和死信创建的警报。
- 4
做出决定
哪些作业最常失败或重试?
用例与模板
选择要衡量的内容
使用用例指南来选择结果、事件边界和分析问题。当您准备好接受较短的复制粘贴实施简介时,请打开匹配的模板。
代理提示
将其粘贴到您的编码代理中
更换 YOUR_API_KEY 注册后,然后要求智能体运行产品流程并验证第一个事件。
Background job monitoring 设置提示
使用 Telemetry 检测后台作业和异步工作人员。
使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY
请使用 job_name、queue_name、attempt、status、duration_ms、scheduled_at、started_at、completed_at、item_count 记录 job_started、job_completed 和 job_failed 事件, retry_count 和 error_type。
创建一个仪表板,显示按作业列出的吞吐量、按作业列出的故障、p95 持续时间、重试量、最旧的挂起作业和死信事件。添加针对停滞作业和重复失败的警报。设置步骤
- 1记录 job_started、job_completed、job_failed 和 job_retried。
- 2包括队列、作业名称、尝试、持续时间、项目计数和错误类型。
- 3构建吞吐量、故障、重试和 p95 持续时间的仪表板。
- 4添加针对停滞作业、重复失败和死信创建的警报。
要捕获的事件
由此解锁的问题
- 哪些作业最常失败或重试?
- 哪些队列落后了?
- 哪些客户会受到后台工作失败的影响?
事件模式示例
此工作流的事件模式
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 告警
将经过审查的可靠性查询提升到拥有的阈值和响应工作流程中。
相关 SQL 查询示例
更多 SQL 示例
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
测量后台作业重试和失败率
哪些后台作业消耗的重试次数最多或仍然失败?
打开查询示例使用 SQL 查找停滞的后台作业
哪些作业已启动但从未产生终止事件?
打开查询示例按作业测量队列等待时间
哪些工作在工人开始之前等待的时间最长?
打开查询示例测量死信队列增长
哪些队列添加死信作业的速度比解决死信作业的速度快?
打开查询示例检测错过的 Cron 计划
哪些预定作业的运行时间晚于记录的时间间隔?
打开查询示例检测后台作业重试风暴
目前哪些工作类型在重试上花费的工作量最多?
打开查询示例客户案例
相关客户案例
下一步
创建您的智能体将使用的 API 密钥
免费计划足以运行提示、发送测试事件和查看第一个仪表板。
相关页面