跳至主要內容
Telemetry
事件追蹤範本

後台作業失敗監視器

從第一次執行到重試和失敗,捕獲佇列、cron、匯入、計費同步和 webhook 作業執行狀況。

審閱者 Telemetry產品團隊 . 我們檢查了事件名稱、建議欄位、查詢要回答的問題和要排除的資料. 誰負責審查此頁面

由此解鎖的問題
  • 哪些工作屢屢失敗?
  • 哪些佇列落後了?
  • 哪些職位名稱的 p95 持續時間最短?
範本證據路徑

Background job failure monitor:實施到決策

將提示視為實施概要。有用的工件不僅僅是複製的程式碼,而是經過審查的事件契約,可以產生值得信賴的答案。

  1. 1

    設定邊界

    Instrument the point where job_started becomes final.

  2. 2

    建立合約

    Start with job_started, job_completed, job_failed and keep every field typed, bounded, and privacy-reviewed.

  3. 3

    執行夾具

    在依賴彙總結果之前,先練習已知的成功、失敗、重試和空結果案例。

  4. 4

    回答問題

    哪些工作屢屢失敗?

範本與用例

使用此範本加入事件

當測量目標已經明確時,複製此範本。使用匹配的用例指南來檢視事件邊界、成功定義以及生成的 SQL 應支援的決策。

讀取 後台作業監控

範本

將其貼上到您的編碼代理中

更換 YOUR_API_KEY,在本地執行流程,然後驗證生成的事件和儀表板。

job-failure-monitor

後台作業失敗監視器

text
使用 Telemetry 進行儀器後台作業。

使用 /skill.md 和此 Telemetry API 金鑰:YOUR_API_KEY

記錄 job_started、job_completed、job_failed、job_retried 和 dead_letter_created:
job_name、queue_name、attempt、status、duration_ms、scheduled_at、started_at、completed_at、item_count、retry_count、worker_name 和error_type。

建立查詢和儀表板,以顯示按作業列出的吞吐量、按作業列出的故障、p95 持續時間、重試量、停滯的作業和最新的死信事件。

請勿記錄原始作業負載、憑據、Webhook 正文或客戶內容。

要捕獲的事件

job_startedjob_completedjob_failedjob_retrieddead_letter_created

驗證清單

完整的埋點通行證留下了什麼

活動

綜合事件以穩定的名稱和欄位型別到達預期的資料表。

查詢

第一個 SQL 查詢返回具有明確時間視窗的合理行。

意見

儀表板使用真實欄位幷包含足夠的上下文來解釋更改。

安全

檢查提示、正文、憑據、簽名和私人內容是否經過編輯。

事件結構描述範例

在將查詢或程式碼片段適應生產之前,請檢查行粒度、發出邊界、所需型別、隱私類、範例有效負載和驗證清單。

相關產品功能

繼續此工作流程 警示

將經過審查的可靠性查詢提升到擁有的閾值和回應工作流程中。

相關 SQL 查詢範例

更多 SQL 範例

針對此工作流程中的結構化欄位執行查詢,檢查範例結果,並將有用的答案轉換為儀表板或警示。

瀏覽所有查詢範例
查詢範例集背景工作 SQL

更多範本