跳转到内容
Telemetry
适用于运行队列、cron 作业、导入和异步工作人员的团队

后台作业监控

使用结构化事件查看作业吞吐量、重试、失败、死信、队列运行状况和 p95 持续时间。

审阅者 Telemetry产品团队 . 我们检查了事件字段、建议查询和要排除的数据. 谁负责审核此页面

为什么这有效
  • 按作业名称、队列、工作人员和客户帐户查找重复的失败。
  • 在停滞的作业成为客户问题之前捕获并重试循环。
  • 提供支持并设计一份可查询的异步工作历史记录。
用例证据路径

Background job monitoring:从实施到决策

完整的 background job monitoring 测量循环连接一个拥有的工作流程、一个有界事件契约、一个受控装置和一个有人可以采取行动的问题。

  1. 1

    设定边界

    记录 job_started、job_completed、job_failed 和 job_retried。

  2. 2

    捕捉结果

    Begin with job_started, job_completed, job_failed and document the grain of each event.

  3. 3

    证明行数

    添加针对停滞作业、重复失败和死信创建的警报。

  4. 4

    做出决定

    哪些作业最常失败或重试?

用例与模板

选择要衡量的内容

使用用例指南来选择结果、事件边界和分析问题。当您准备好接受较短的复制粘贴实施简介时,请打开匹配的模板。

打开 后台作业失败监视器

代理提示

将其粘贴到您的编码代理中

更换 YOUR_API_KEY 注册后,然后要求智能体运行产品流程并验证第一个事件。

代理提示

Background job monitoring 设置提示

text
使用 Telemetry 检测后台作业和异步工作人员。

使用 /skill.md 和此 Telemetry API 密钥:YOUR_API_KEY

请使用 job_name、queue_name、attempt、status、duration_ms、scheduled_at、started_at、completed_at、item_count 记录 job_started、job_completed 和 job_failed 事件, retry_count 和 error_type。

创建一个仪表板,显示按作业列出的吞吐量、按作业列出的故障、p95 持续时间、重试量、最旧的挂起作业和死信事件。添加针对停滞作业和重复失败的警报。

设置步骤

  1. 1记录 job_started、job_completed、job_failed 和 job_retried。
  2. 2包括队列、作业名称、尝试、持续时间、项目计数和错误类型。
  3. 3构建吞吐量、故障、重试和 p95 持续时间的仪表板。
  4. 4添加针对停滞作业、重复失败和死信创建的警报。

要捕获的事件

job_startedjob_completedjob_failedjob_retrieddead_letter_createdcron_tick_failed

由此解锁的问题

  • 哪些作业最常失败或重试?
  • 哪些队列落后了?
  • 哪些客户会受到后台工作失败的影响?

事件模式示例

在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。

相关产品功能

继续此工作流程 告警

将经过审查的可靠性查询提升到拥有的阈值和响应工作流程中。

相关 SQL 查询示例

更多 SQL 示例

针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。

浏览所有查询示例
查询示例合集后台任务 SQL

客户案例

相关客户案例

下一步

创建您的智能体将使用的 API 密钥

免费计划足以运行提示、发送测试事件和查看第一个仪表板。

相关页面