Elixir Phoenix Telemetry Integration:从边界到验证行
在受控应用程序边界使用 Elixir Phoenix Telemetry Integration,保持事件契约较小,并在构建聚合视图之前验证已知结果。
- 1
选择结果
Phoenix API 可靠性
- 2
定义合同
route_template、方法、status_code、状态、duration_ms 和发布
- 3
埋点边界
在应用程序启动期间附加一次并处理终端 Phoenix 端点或路由器调度停止事件;使用 System.convert_time_unit/3 转换本机持续时间单位。
- 4
核实证据
Exercise a known fixture, then inspect your_event_table for one correctly typed terminal row.
开始之前
先决条件和界限
- 启用 Phoenix 端点遥测并安装一次处理程序的受监督应用程序进程
- 具有有限连接和响应超时的服务器端 HTTP 客户端
- 路由模板、状态和受控错误分类,不包括请求参数和连接内容
交货设置
安装并初始化服务器端
使用具有服务器端密钥、有限 HTTP 超时和显式重试限制的受监督客户端进程。 将摄取凭据保留在浏览器包、客户端可见的环境变量、源代码控制、日志和异常消息之外。
- 1准备一个具有有限网络行为的可重用服务器端交付客户端。
- 2在成功、失败、重试或超时边界处添加结果事件。
- 3在启用警报之前发送受控装置并检查存储的行。
片段
从一个结构化事件开始
在工作流程完成、失败或重试的位置添加此形状。然后从真实的字段构建仪表板。
Elixir Phoenix Telemetry Integration事件
defmodule MyAppWeb.TelemetryOutcome do
def attach do
:telemetry.attach(
"telemetry-phoenix-request-outcome",
[:phoenix, :endpoint, :stop],
&__MODULE__.handle_stop/4,
nil
)
end
def handle_stop(_event, measurements, metadata, _config) do
conn = metadata.conn
event = %{
route_template: conn.private[:phoenix_route] || "unmatched",
method: conn.method,
status_code: conn.status,
status: if(conn.status < 500, do: "success", else: "failed"),
duration_ms:
System.convert_time_unit(measurements.duration, :native, :millisecond),
release: System.get_env("APP_RELEASE", "development")
}
# Supervise this app-owned client and give it bounded HTTP timeouts.
MyApp.TelemetryIngest.enqueue("phoenix_request_completed", event)
end
end活动合约
route_template、方法、status_code、状态、duration_ms 和发布
request_id、account_id、环境、node_role 和受控 error_type(经批准后)
没有 conn.params、查询字符串、请求或响应正文、会话、授权标头、堆栈跟踪或不受限制的元数据
实施检查点
检查站 1
在应用程序启动期间附加一次并处理终端 Phoenix 端点或路由器调度停止事件;使用 System.convert_time_unit/3 转换本机持续时间单位。
检查站 2
Phoenix 和 Plug 停止事件不构成完整的分布式跨度,Plug 记录了错误后未发出停止事件的情况。保留该诊断边界的异常和跟踪工具。
检查站 3
通过受监督、有界的传送路径异步转发,因此遥测 HTTP 延迟不会延长用户请求或破坏应用程序邮箱的稳定性。
验证
证明事件已到达
在演练已知的成功和失败案例后运行此命令。如果您的最终事件契约与代码片段不同,请替换后备表名称。
Elixir Phoenix Telemetry Integration 验证查询
SELECT *
FROM your_event_table
ORDER BY timestamp_utc DESC
LIMIT 20;实施参考
在启用新的生产路径之前,请检查事件合同、数据安全指南和上游主要文档。
生产边界
保持结果事件小且可恢复
该模式提供了
- 除了上游工作流程之外,还有一个有界的、SQL 就绪的结果。
- 用于仪表板、警报和跨事件关联的稳定字段。
- 用于验证成功、失败、重试和超时行为的夹具驱动路径。
该模式不提供
- OTLP 导出器、自动收集管道或详细跟踪和诊断日志的替代品。
- 仅因为有效负载包含事件 ID,所以仅传送一次。
- 收集原始提供商有效负载、用户内容、凭证或受监管数据的权限。
事件架构起点
此工作流程的事件契约
在将查询或代码片段适应生产之前,请检查行粒度、发出边界、所需类型、隐私类、示例有效负载和验证清单。
相关产品功能
继续此工作流程 告警
将经过审查的可靠性查询提升到拥有的阈值和响应工作流程中。
相关 SQL 查询示例
用 SQL 回答下一个问题
针对此工作流程中的结构化字段运行查询,检查示例结果,并将有用的答案转换为仪表板或警报。
按路由计算 API 请求吞吐量
哪些 API 路由每分钟处理的请求最多?
打开查询示例按路由计算API错误率
哪些 API 路由具有最高的有意义 5xx 错误率?
打开查询示例计算 p50、p95 和 p99 API 延迟
哪些端点的尾部延迟最差?
打开查询示例按路由计算API超时率
哪些 API 路由超时的频率足以影响用户?
打开查询示例比较依赖性 p95 延迟
哪些下游依赖项的尾部延迟和故障率最差?
打开查询示例按客户影响对错误指纹进行排名
哪些错误组影响最多的客户帐户?
打开查询示例按实施系列浏览
比较相关集成模式
与此集成配对的模板
更多集成