跳转到内容
Telemetry
基础设施 SQL查询示例

按工作负载查找 Kubernetes 重启情况

按容器重启事件、就绪失败和观察到的累积重启计数对 Kubernetes 工作负载进行排名。

入门kubernetes_workload_events已审核 2026-07-28测试用 阿帕奇 DataFusion 45.2.0

审阅者 Telemetry产品团队 . SQL 兼容性、事件契约、合成输出和操作注意事项. 审查标准和所有权

问题已回答

哪些 Kubernetes 工作负载正在重新启动并且未通过就绪性检查?

单独的重新启动计数器不会显示更改发生的时间或用户是否受到影响。此事件模式将重新启动转换和就绪样本保持在工作负载边界处,以便审核者可以识别持续的不稳定情况。

活动合约

查询期望的字段

字段类型为什么存在
timestamp_utcTimestampUTC 格式的采样或转换时间。
clusterUtf8受控集群名称。
namespaceUtf8Kubernetes 命名空间。
workloadUtf8Deployment、StatefulSet 或作业所有者名称。
podUtf8用于限制向下钻取的 Pod 标识符。
event_nameUtf8受控采样或 container_restarted 事件。
restart_countInt64观察到的累积容器重新启动计数。
readyBoolean样品舱是否已准备好。
environmentUtf8部署环境。
DataFusion SQL

复制查询

sql
SELECT
  cluster,
  namespace,
  workload,
  COUNT(*) AS observations,
  SUM(CASE WHEN event_name = 'container_restarted' THEN 1 ELSE 0 END) AS restart_events,
  MAX(restart_count) AS max_restart_count,
  SUM(CASE WHEN ready THEN 0 ELSE 1 END) AS not_ready_observations,
  100.0 * SUM(CASE WHEN ready THEN 0 ELSE 1 END)
    / NULLIF(COUNT(*), 0) AS not_ready_rate_pct
FROM kubernetes_workload_events
WHERE timestamp_utc >= now() - INTERVAL '24 hours'
  AND environment = 'production'
GROUP BY cluster, namespace, workload
ORDER BY restart_events DESC, not_ready_rate_pct DESC, workload;

此只读查询是针对空类型表计划和执行的 阿帕奇 DataFusion 45.2.0。确定性样本输出是综合的并单独审查;根据您自己的数据验证字段类型、阈值和业务定义。 阅读测试方法。

查询结果

按工作负载划分的重启和就绪信号

与计费工作人员相比,结帐有更多的重新启动转换和未就绪的观察。

clusternamespaceworkloadobservationsrestart_eventsmax_restart_countnot_ready_observationsnot_ready_rate_pct
production-usapplicationcheckout-api524240
production-usapplicationbilling-worker412125

综合示例输出。在将其用于操作决策之前,针对您自己的事件架构和阈值运行查询。

Restart and readiness signals by workload:来自 Find Kubernetes Restarts by Workload 示例结果的合成 restart_events 值的静态图表
确定性示例输出的可索引 SVG。下载它以获取带有归属的文章、操作手册或设计评论。

重现示例

下载公共装置

JSON 包包含类型化事件契约, reproducible 输入行、确切的 SQL、预期输出、审阅注释和引擎版本。 CSV 包含显示的结果。

SQL 是如何工作的

  1. 1工作负载所有权比 Pod 名称更稳定,并将结果映射到可部署单元。
  2. 2重新启动转换与累积计数器分开计数,以避免对仪表进行求和。
  3. 3准备情况观察将操作症状与潜在的服务影响放在一起。

需要决定的边缘情况

  • rollout 自然会取代 pod;区分计划更换和重复容器重启。
  • 重新创建 Pod 时计数器可能会重置,因此请使用转换事件来计算速率。
  • 在将重新启动归因于代码更改之前,加入部署和应用程序发布上下文。

推荐仪表板

  • 堆叠条:按工作负载划分的 restart_events 和 not_ready_observations
  • 趋势:按集群和命名空间重新启动过渡
  • 表:最新受影响的 Pod 及其发布和受控原因

警报指导

针对重复重启过渡以及持续的就绪性丧失发出警报,而不是针对孤立的部署替换发出警报。

读取警报设置

让查询示例发挥作用

相关埋点和指南

定义源数据

此分析的事件模式

继续分析

在真实事件中运行它

创建表,调整字段并保存结果

免费开始,发送结构化事件,并将查询结果用作图表、共享仪表板小部件或警报输入。

获取 API 密钥