
📌 gke-ai-troubleshooting-handle-disruption-gpu-tpu 是什么?
一句话概括:它是一款专注「GKE 上 GPU/TPU 节点维护中断排查」的 AI 技能。
它是 Google 官方仓库(google/skills)出品的 GKE 排障 Skill,诊断、预测并缓解 Compute Engine 主机维护与硬/软件维护事件中 GPU/TPU 工作负载的节点中断。
GPU 和 TPU 不支持热迁移,主机维护事件到来时节点和 Pod 必须被终止,这比普通应用故障更麻烦。这个 Skill 通过四个步骤定位维护事件:检查计划维护标签、用 PromQL 查中断指标、看日志与节点污点、得出结论并给出防护三件套。官方明确它只报告高信号发现、不倾倒原始日志。
📋 核心要点速览
| 项目 | 说明 |
|---|---|
| 名称 | gke-ai-troubleshooting-handle-disruption-gpu-tpu |
| 来源 | google/skills(Google 官方技能库) |
| 定位 | GKE GPU/TPU 工作负载的节点中断排查与防护 |
| 必填参数 | project_id、location、cluster_name、timestamp |
| 防护三件套 | 优雅终止、机会性维护、PodDisruptionBudget |
| 兼容性 | Google Cloud 认证 + GKE 集群访问权限 |
🧩 主要功能
- AI 工作负载中断分析:判断训练/推理任务中断是否由主机维护引起。
- GPU 节点状态排查:检查 scheduled-maintenance-time 标签。
- TPU 资源异常检查:通过 PromQL 指标 node_interruption_count 判断 VM 中断。
- 节点污点与日志检查:active-node-maintenance 标签与 impending-node-termination:NoSchedule 污点。
- 故障恢复建议:要求推荐优雅终止、机会性维护、PDB 三件套防护。
✨ 核心特色
- 针对 AI 加速器工作负载:专门处理 GPU/TPU 节点的维护中断。
- 覆盖 Kubernetes 与硬件资源的关联:从 GKE 调度一路查到 Compute Engine 主机维护。
- 四步诊断缩小故障范围:标签 → 指标 → 日志/污点 → 结论。
- 负向发现排除规则:所有检查都为负时,明确排除主机维护,转向应用层原因(OOMKill、CUDA 错误、资源限制)。
- 防护三件套强制推荐:优雅终止、机会性维护、PDB 一起给出。
🎯 可以用来做什么?
- AI 训练任务突然中断。
- GPU 节点无法正常调度。
- TPU 工作负载启动失败。
- Pod 处于 Pending 状态。
- 加速器资源分配异常。
- AI 推理服务出现运行中断。
🙋 适合哪些人?
- GKE 平台管理员。
- MLOps 工程师。
- AI 基础设施开发者。
- Kubernetes 运维人员。
- 云架构师。
🛠️ 如何安装?
官方安装命令为:
使用时需要提供 project_id、location、cluster_name、timestamp 四个必填参数(node_name、workload_name 等可选),并具备 Google Cloud 认证与 GKE 集群访问权限。
✍️ 怎么使用?
按四步诊断流程推进:
- 收集上下文(项目、位置、集群、时间戳)。
- 检查计划维护标签 scheduled-maintenance-time。
- 用 PromQL 查 node_interruption_count 指标。
- 看 active-node-maintenance 标签与 impending-node-termination 污点。
- 得出结论并推荐防护三件套。
- 验证修复效果。
💡 使用技巧
- 提供完整错误信息。
- 记录故障发生时间。
- 区分应用、容器、节点和硬件问题。
- 不要未经验证就重启生产节点。
- 涉及 GPU/TPU 资源时,先确认业务影响。
💰 收费吗?
需要区分 Skill 本身、Agent 服务、Google Cloud GKE 集群费用,以及 GPU/TPU 使用成本。Skill 开源免费,但 GKE 集群和 GPU/TPU 加速器按用量计费。
👍👎 优点与缺点
| 内容 | |
|---|---|
| 优点 | 面向 AI 基础设施;系统化排障;适合复杂云环境;负向排除避免误判。 |
| 缺点 | 技术门槛较高;依赖运行环境和权限;AI 基础设施问题通常不能仅凭文本自动解决。 |
⚖️ 与同类工具对比
| 对比维度 | GKE AI 排障类 Skill | 通用代码助手 |
|---|---|---|
| 主要方向 | AI 基础设施故障 | 软件开发 |
| 关注对象 | GKE、GPU、TPU、工作负载 | 代码与应用 |
| 使用人群 | 云平台与 MLOps 团队 | 开发者 |
| 排障方式 | 需要集群和运行信息 | 主要依赖代码与日志 |
❓ 常见问题 FAQ
- GKE 是什么?Google Cloud 的托管 Kubernetes 服务。
- GPU 和 TPU 有什么区别?都是 AI 加速器,TPU 是 Google 自研,维护通知窗口更短(5 分钟 vs GPU 60 分钟)。
- 是否需要 Google Cloud 账号?需要,且需相应项目与集群权限。
- 能否排查 Pod 无法启动?能,可判断是否由节点维护导致。
- 是否支持生产环境?用于诊断,修复前需人工评估。
⚠️ 使用限制
- 不用于 GKE 集群创建、网络策略配置或非中断类工作负载部署。
- 技术门槛较高,需熟悉 GKE 与 GPU/TPU。
- 不得建议容忍 impending-node-termination:NoSchedule 污点。
🤖 适合哪些 AI 工具
该 Skill 面向支持 skills 命令行的 AI 编码助手与 Agent 环境,通过 kubectl、Cloud Monitoring(PromQL)与 Cloud Logging 与 GKE 集群交互。
📝 编辑评价
gke-ai-troubleshooting-handle-disruption-gpu-tpu 是 GPU/TPU 运维场景下非常「接地气」的一个技能:它不追求大而全,而是盯住「主机维护导致节点中断」这一高频痛点,用四步就把根因圈定,还强制给出优雅终止、机会性维护、PDB 三件套防护。最难得的是它的负向排除规则——查完都正常就老实告诉你「不是维护导致的,去看 OOMKill 和 CUDA 错误」,而不是硬给一个结论。跑 GKE + GPU/TPU 的团队很值得收下。

◯ 评论 0