BullMQ Queue Monitoring:從邊界到驗證行
在受控應用程式邊界使用 BullMQ Queue Monitoring,保持事件契約較小,並在建置聚合檢視之前驗證已知結果。
- 1
選擇結果
BullMQ 工人健康狀況
- 2
定義合約
job_id、job_name、queue_name 和狀態
- 3
埋點邊界
使用 BullMQ 的作業 ID 作為邏輯 ID,並單獨記錄 attemptsMade。
- 4
核實證據
Exercise a known fixture, then inspect job_completed for one correctly typed terminal row.
開始之前
先決條件和界限
- 伺服器端TELEMETRY_API_KEY
- 穩定的作業名稱和佇列名稱
- 重試時保留作業時間戳
交貨設定
安裝並初始化伺服器端
在僅伺服器程式碼中匯入 telemetry-sh 並使用 process.env.TELEMETRY_API_KEY 對其進行一次初始化。 將攝取憑據保留在瀏覽器包、客戶端可見的環境變數、原始碼控制、日誌和異常訊息之外。
npm安裝
npm install telemetry-sh- 1準備一個具有有限網路行為的可重用伺服器端交付客戶端。
- 2在成功、失敗、重試或超時邊界處新增結果事件。
- 3在啟用警示之前傳送受控裝置並檢查儲存的行。
片段
從一個結構化事件開始
在工作流程完成、失敗或重試的位置新增此形狀。然後從真實的欄位建置儀表板。
BullMQ Queue Monitoring事件
worker.on("completed", async (job, result) => {
await telemetry.log("job_completed", {
job_id: String(job.id),
job_name: job.name,
queue_name: worker.name,
status: "success",
attempt: job.attemptsMade + 1,
queue_wait_ms: job.processedOn - job.timestamp,
duration_ms: job.finishedOn - job.processedOn,
item_count: result?.itemCount,
});
});活動合約
job_id、job_name、queue_name 和狀態
嘗試,queue_wait_ms、duration_ms 和 error_type
item_count、worker_name,並釋放
實施檢查點
檢查站 1
使用 BullMQ 的作業 ID 作為邏輯 ID,並單獨記錄 attemptsMade。
檢查站 2
從原始入隊時間而不是重試時間得出佇列等待時間。
檢查站 3
切勿批次記錄 job.data,因為它通常包含客戶負載。
驗證
證明事件已到達
在演練已知的成功和失敗案例後執行此命令。如果您的最終事件契約與程式碼片段不同,請替換後備資料表名稱。
BullMQ Queue Monitoring 驗證查詢
SELECT *
FROM job_completed
ORDER BY timestamp_utc DESC
LIMIT 20;實施參考
在啟用新的生產路徑之前,請檢查事件合約、資料安全指南和上游主要文件。
生產邊界
保持結果事件小且可恢復
該模式提供了
- 除了上游工作流程之外,還有一個有界的、SQL 就緒的結果。
- 用於儀表板、警示和跨事件關聯的穩定欄位。
- 用於驗證成功、失敗、重試和超時行為的夾具驅動路徑。
該模式不提供
- OTLP 匯出器、自動收集管道或詳細追蹤和診斷日誌的替代品。
- 僅因為有效負載包含事件 ID,所以僅傳送一次。
- 收集原始提供商有效負載、使用者內容、憑證或受監管資料的權限。
事件架構起點
此工作流程的事件契約
在將查詢或程式碼片段適應生產之前,請檢查行粒度、發出邊界、所需型別、隱私類、範例有效負載和驗證清單。
相關產品功能
繼續此工作流程 警示
將經過審查的可靠性查詢提升到擁有的閾值和回應工作流程中。
相關 SQL 查詢範例
用 SQL 回答下一個問題
針對此工作流程中的結構化欄位執行查詢,檢查範例結果,並將有用的答案轉換為儀表板或警示。
測量後台作業重試和失敗率
哪些後台作業消耗的重試次數最多或仍然失敗?
開啟查詢範例按作業測量佇列等待時間
哪些工作在工人開始之前等待的時間最長?
開啟查詢範例測量死信佇列成長
哪些佇列新增死信作業的速度比解決死信作業的速度快?
開啟查詢範例檢測後台作業重試風暴
目前哪些工作型別在重試上花費的工作量最多?
開啟查詢範例按實施系列瀏覽
比較相關整合模式
與此整合配對的範本
更多整合