将 AutoGen 任务流超时转变为有界结果
捕获团队边界上最后批准的工作流状态和配置的超时,而无需复制消息、任务文本、工具负载或不受限制的停止原因。
- 1
团队开始
分配稳定的运行 ID、工作流程、团队名称、发布和有界起始状态。
- 2
任务流程运行
在跟踪中保留消息和工具详细信息,同时对结果边界处的交接、工具和消息进行计数。
- 3
超时成为最终决定
记录 timed_out、timeout_ms、最后批准的状态和有界终止类别。
- 4
SQL 发现回归
按工作流程、团队和版本比较超时率、持续时间和切换。
开始之前
先决条件和界限
- AutoGen 和 telemetry-sh 在受信任的 Python 进程中初始化
- 应用程序拥有的运行 ID 和稳定团队、工作流程、模型、终止和发布名称
- 当需要详细的 AutoGen 跟踪时,单独配置 OpenTelemetry 导出
交货设置
安装并初始化服务器端
使用服务器端密钥为每个进程初始化一次 Telemetry 同步代码或 TelemetryAsync 异步代码。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。
pip安装
python -m pip install telemetry-sh- 1准备一个具有有限网络行为的可重用服务器端交付客户端。
- 2在成功、失败、重试或超时边界处添加结果事件。
- 3在启用警报之前发送受控装置并检查存储的行。
片段
从一个结构化事件开始
在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。
AutoGen Task Flow, State, and Timeout Monitoring事件
import asyncio
from time import perf_counter
async def run_agent_team(team, task: str, run_id: str):
started_at = perf_counter()
status = "success"
error_type = None
state_before = "team_started"
state_after = "team_completed"
timeout_ms = 120_000
result = None
try:
result = await asyncio.wait_for(
team.run(task=task),
timeout=timeout_ms / 1000,
)
return result
except TimeoutError:
status = "timed_out"
error_type = "team_timeout"
state_after = "timeout_reached"
raise
except Exception as error:
status = "failed"
error_type = classify_agent_error(error)
state_after = "team_failed"
raise
finally:
await telemetry.log("agent_run_completed", {
"run_id": run_id,
"workflow": "support_resolution",
"team_name": "support_team",
"status": status,
"error_type": error_type,
"state_before": state_before,
"state_after": state_after,
"timeout_ms": timeout_ms,
"timed_out": status == "timed_out",
"termination_reason": getattr(result, "stop_reason", None),
"message_count": len(result.messages) if result else 0,
"duration_ms": round((perf_counter() - started_at) * 1000),
"release": APP_RELEASE,
})活动合约
run_id、工作流程、team_name、agent_count、model_alias、termination_reason 和发布
状态、duration_ms、message_count、tool_call_count、handoff_count 和 error_type
用于有界任务流诊断的 state_before、state_after、timeout_ms、timed_out 和 termination_reason
estimated_cost_usd、已接受、human_handoff、evaluation_score 以及批准后的环境
实施检查点
检查站 1
包裹公共智能体或团队运行边界并发出一个最终结果;避免每条消息一个业务事件,除非特定查询需要该粒度。
检查站 2
使用配置的超时和上次批准的工作流状态将超时视为最终结果。不要仅仅从节点被触发来推断成功。
检查站 3
AutoGen 支持 OpenTelemetry 跟踪以获取详细的智能体和工具执行情况。将这些跟踪保存在兼容 OTLP 的后端中,并通过批准的标识符将结果关联起来。
检查站 4
默认情况下,绝不发出任务文本、智能体消息、工具参数、工具结果、内存、不受限制的停止消息或异常文本。
验证
证明事件已到达
在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。
AutoGen Task Flow, State, and Timeout Monitoring 验证查询
SELECT *
FROM agent_run_completed
ORDER BY timestamp_utc DESC
LIMIT 20;实施参考
在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。
生产边界
保持结果事件小且可恢复
该模式提供了
- 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
- 用于仪表板、警报和跨事件关联的稳定字段。
- 用于验证成功、失败、重试和超时行为的夹具驱动路径。
该模式不提供
- OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
- 仅因为有效负载包含事件 ID,所以仅传送一次。
- 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。
事件架构起点
此工作流程的事件契约
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 AI代理监控
通过可审查的 SQL 连接智能体运行、工具使用、模型成本、质量和产品结果。
相关 SQL 查询示例
用 SQL 回答下一个问题
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
按实施系列浏览
比较相关集成模式
与此集成配对的模板
更多集成