跳至主要內容
Telemetry
瀏覽說明文件
指南更新於 2026年7月29日由 Telemetry 編輯團隊和產品團隊審查閱讀約需 2 分鐘

讓程式設計代理使用這篇文件

開啟 Claude Code、Codex、Cursor 或其他編碼代理的集中提示包,然後將其適應此處介紹的工作流程。

本頁內容
  1. 定義一個影響行
  2. 確定事件範圍
  3. 驗證恢復情況

使用 SQL 進行客戶影響分析

內部錯誤率並不能確定對客戶的影響。事件回應需要記錄產品結果:結帳失敗、匯出延遲、資料不可用或客戶可能遇到的其他受控影響。

定義一個影響行

每個事件和批准的報告單元發出或派生一個有界行。有用的欄位包括 incident_id、假名 account_id、計劃或服務層、受控 impact_typeaffectedimpact_duration_ms、環境和 UTC 時間。

保留評估人口以及受影響人口。如果聯接僅發現受影響的帳戶,則所得百分比沒有值得信賴的分母。避免在聚合資料表中出現客戶名稱、電子郵件、請求正文、支援訊息和原始內容。將帳戶級別的鑽取限制為批准的回應者。

確定事件範圍

客戶影響 SQL 配方 按計劃對評估和受影響的帳戶進行計數,計算受影響的份額,並僅計算受影響行的平均持續時間。其固定裝置顯示三個受影響的企業帳戶和兩個受影響的啟動帳戶。

服務級別檢測後使用查詢:

  1. 驗證事件的開始和影響的產品結果。
  2. 為同一完整視窗建置評估帳戶群體。
  3. 按計劃、區域、路線或其他經過審查的有界維度比較影響。
  4. 將新受影響和已恢復的帳戶作為單獨的流量進行追蹤。
  5. 將查詢、定義和結果保留在事件記錄中。

如果沒有批准的應對政策,請勿將更高的計劃等同於更高的人類影響。計劃是優先考慮因素之一,不能替代合約或安全要求。

驗證恢復情況

恢復意味著客戶可見的工作流程再次成功,並且延遲重試或作業已耗盡。僅回滾時間戳並不能證明。繼續觀察完整的儲存桶並確保請求量沒有消失。

incident_impact_observed 事件模式提供現場級起始合約。 事件回應指南 涵蓋檢測、路由和發布範圍、時間表和恢復。 API 可靠性用例 提供了更廣泛的測量策略,可以進行影響分析。

相關產品功能

對結構化事件資料表執行只讀 DataFusion SQL 並重用結果。

內容責任與技術參考

Telemetry 編輯團隊負責維護本文;產品團隊審查功能行為、範例和適用範圍。

檢視編輯規範