將 AutoGen 任務流超時轉變為有界結果
捕獲團隊邊界上最後批准的工作流程狀態和設定的超時,而無需複製訊息、任務文字、工具負載或不受限制的停止原因。
- 1
團隊開始
分配穩定的執行 ID、工作流程、團隊名稱、發布和有界起始狀態。
- 2
任務流程執行
在追蹤中保留訊息和工具詳細資訊,同時對結果邊界處的交接、工具和訊息進行計數。
- 3
超時成為最終決定
記錄 timed_out、timeout_ms、最後批准的狀態和有界終止類別。
- 4
SQL 發現迴歸
按工作流程、團隊和版本比較超時率、持續時間和切換。
開始之前
先決條件和界限
- AutoGen 和 telemetry-sh 在受信任的 Python 處理程序中初始化
- 應用程式擁有的執行 ID 和穩定團隊、工作流程、模型、終止和發布名稱
- 當需要詳細的 AutoGen 追蹤時,單獨設定 OpenTelemetry 匯出
交貨設定
安裝並初始化伺服器端
使用伺服器端金鑰為每個處理程序初始化一次 Telemetry 同步程式碼或 TelemetryAsync 非同步程式碼。 將攝取憑據保留在瀏覽器包、客戶端可見的環境變數、原始碼控制、日誌和異常訊息之外。
pip安裝
python -m pip install telemetry-sh- 1準備一個具有有限網路行為的可重用伺服器端交付客戶端。
- 2在成功、失敗、重試或超時邊界處新增結果事件。
- 3在啟用警示之前傳送受控裝置並檢查儲存的行。
片段
從一個結構化事件開始
在工作流程完成、失敗或重試的位置新增此形狀。然後從真實的欄位建置儀表板。
AutoGen Task Flow, State, and Timeout Monitoring事件
import asyncio
from time import perf_counter
async def run_agent_team(team, task: str, run_id: str):
started_at = perf_counter()
status = "success"
error_type = None
state_before = "team_started"
state_after = "team_completed"
timeout_ms = 120_000
result = None
try:
result = await asyncio.wait_for(
team.run(task=task),
timeout=timeout_ms / 1000,
)
return result
except TimeoutError:
status = "timed_out"
error_type = "team_timeout"
state_after = "timeout_reached"
raise
except Exception as error:
status = "failed"
error_type = classify_agent_error(error)
state_after = "team_failed"
raise
finally:
await telemetry.log("agent_run_completed", {
"run_id": run_id,
"workflow": "support_resolution",
"team_name": "support_team",
"status": status,
"error_type": error_type,
"state_before": state_before,
"state_after": state_after,
"timeout_ms": timeout_ms,
"timed_out": status == "timed_out",
"termination_reason": getattr(result, "stop_reason", None),
"message_count": len(result.messages) if result else 0,
"duration_ms": round((perf_counter() - started_at) * 1000),
"release": APP_RELEASE,
})活動合約
run_id、工作流程、team_name、agent_count、model_alias、termination_reason 和發布
狀態、duration_ms、message_count、tool_call_count、handoff_count 和 error_type
用於有界任務流診斷的 state_before、state_after、timeout_ms、timed_out 和 termination_reason
estimated_cost_usd、已接受、human_handoff、evaluation_score 以及批准後的環境
實施檢查點
檢查站 1
包裹公共代理或團隊執行邊界併發出一個最終結果;避免每條訊息一個業務事件,除非特定查詢需要該粒度。
檢查站 2
使用設定的超時和上次批准的工作流程狀態將超時視為最終結果。不要僅僅從節點被觸發來推斷成功。
檢查站 3
AutoGen 支援 OpenTelemetry 追蹤以獲取詳細的代理和工具執行情況。將這些追蹤儲存在相容 OTLP 的後端中,並透過批准的識別符號將結果關聯起來。
檢查站 4
預設情況下,絕不發出任務文字、代理訊息、工具參數、工具結果、記憶體、不受限制的停止訊息或異常文字。
驗證
證明事件已到達
在演練已知的成功和失敗案例後執行此命令。如果您的最終事件契約與程式碼片段不同,請替換後備資料表名稱。
AutoGen Task Flow, State, and Timeout Monitoring 驗證查詢
SELECT *
FROM agent_run_completed
ORDER BY timestamp_utc DESC
LIMIT 20;實施參考
在啟用新的生產路徑之前,請檢查事件合約、資料安全指南和上游主要文件。
生產邊界
保持結果事件小且可恢復
該模式提供了
- 除了上游工作流程之外,還有一個有界的、SQL 就緒的結果。
- 用於儀表板、警示和跨事件關聯的穩定欄位。
- 用於驗證成功、失敗、重試和超時行為的夾具驅動路徑。
該模式不提供
- OTLP 匯出器、自動收集管道或詳細追蹤和診斷日誌的替代品。
- 僅因為有效負載包含事件 ID,所以僅傳送一次。
- 收集原始提供商有效負載、使用者內容、憑證或受監管資料的權限。
事件架構起點
此工作流程的事件契約
在將查詢或程式碼片段適應生產之前,請檢查行粒度、發出邊界、所需型別、隱私類、範例有效負載和驗證清單。
相關產品功能
繼續此工作流程 AI代理監控
透過可審查的 SQL 連線代理執行、工具使用、模型成本、品質和產品結果。
相關 SQL 查詢範例
用 SQL 回答下一個問題
針對此工作流程中的結構化欄位執行查詢,檢查範例結果,並將有用的答案轉換為儀表板或警示。
按實施系列瀏覽
比較相關整合模式
與此整合配對的範本
更多整合