⚙️ 主要功能:六步流水线把 AKS 变成模型推理平台

airunway-aks-setup 是微软 azure-skills 仓库下的一个官方 Agent Skill,定位非常具体:把一个已有的 AKS 集群,从裸机状态一路带到能跑推理的模型服务状态。它不负责创建集群,也不处理模型训练,只专注“AI Runway 的上手”这一段。

整个流程被拆成六个有序步骤,每一步都有明确的检查点和输出。

第一步,集群验证。检查当前的 Kubernetes context 是否正确、节点清单是否完整、GPU 是否可被识别。这一步的输出是集群状态的健康报告,节点缺失或 GPU 检测失败会在这里被标记出来。

第二步,控制器安装。部署 AI Runway 的 CRD(自定义资源定义)和控制器。控制器是后续所有模型部署操作的执行入口,没有它,AI Runway 的资源对象无法被集群识别和处理。

第三步,GPU 评估。检测集群中 GPU 的具体型号,并标记出 dtype 和 attention 层面的约束。不同类型的 GPU 在推理框架里有不同的精度支持和显存限制,这一步的评估结果会直接影响后续推理 provider 的选择。

第四步,推理 provider 安装。技能内置了三个 provider 供选择,根据集群的 GPU 配置和推理负载特征来推荐。

Provider最适合的场景说明
KAITO托管式 GPU 推理Kubernetes AI Toolchain Operator,自动完成模型部署和 GPU 节点供给
Dynamo高吞吐量服务针对多 GPU、多节点部署优化的推理框架
KubeRay基于 Ray 的工作负载Ray 集群的 Kubernetes operator,适合分布式推理和训练

第五步,首次模型部署。从可用模型中选择一个,通过 AI Runway 部署到集群上。这一步会实际拉起推理服务,验证整个链路是否打通。

第六步,汇总报告。输出完整的部署状态,包括每一步的执行结果、遇到的错误和最终的服务地址。

这个技能还有一个实用的设计:支持从任意步骤恢复。如果部署中途因为网络或配置问题中断了,不需要从头再来一遍。告诉 AI 助手 skip-to-step N,N 是步骤编号(1 到 6),它就会从指定的步骤继续。[reference:5]

成本方面有一个需要提前知道的点:GPU 节点池的费用不低。A100-80GB 的实例每小时可能在 3 到 5 美元甚至更高。技能在执行涉及 GPU 资源的步骤之前,会输出成本提醒,确认用户了解费用影响后再继续。

🛠️ 第一次安装和使用

安装方式取决于你使用的 AI 助手环境。

通过 npx 安装(推荐):

npx skills add https://github.com/microsoft/azure-skills --skill airunway-aks-setup

这条命令会把技能安装到支持 skills 格式的 Agent 环境中。[reference:7]

手动安装到 Claude Code:

从 GitHub 下载 azure-skills 仓库的压缩包,解压后将 skills/airunway-aks-setup 目录放到 ~/.claude/skills/ 下。技能会在下一次会话中被自动发现。[reference:8]

安装之前需要确认几件事。本地需要装好 kubectlmakecurl 这三个命令行工具,技能的所有集群操作都直接通过 kubectl 和 make 执行,不依赖任何外部 MCP 工具。你还需要一个已经存在的 AKS 集群。如果还没有,需要先用 azure-kubernetes 技能创建一个带 GPU 节点池的集群(除非你接受 CPU-only 推理),再回到这个技能继续。

使用的时候不需要记特殊命令。在 AI 助手的对话里说“帮我在这个 AKS 集群上设置 AI Runway”或者“部署一个模型到 AKS”,技能就会被触发。[reference:11]它会按六步顺序推进,每一步完成之后报告状态,涉及安装或部署操作时会先请求确认,确认后才实际执行。

🎯 可以达到的效果

跑完整个流程之后,你会得到一个已经在 AKS 上运行起来的模型推理服务。不是配置文件,不是待执行的脚本,而是一个可以通过 API 调用的推理端点。

具体来说,AI Runway 控制器会以 Kubernetes 原生的方式管理模型部署——你可以在 kubectl get pods 里看到推理服务的 Pod,通过 Service 暴露端点,用标准的 Kubernetes 工具做扩缩容和监控。推理 provider(KAITO、Dynamo 或 KubeRay)负责底层的 GPU 调度和请求处理。

另一个实际的效果是流程的可重复性。这套六步流程是标准化的,换一个集群、换一个模型,操作路径基本一致。团队里其他人拿到同样的技能和集群,可以走同样的步骤得到类似的结果,不需要每个人自己摸索 kubectl 命令和 YAML 配置。

📋 主要应用场景

ML 平台团队的集群初始化。当团队拿到一个新的 AKS 集群,需要快速把它变成能跑推理的环境,这个技能提供了一条标准化的路径。六步流程走完,推理服务就跑起来了,不需要手动查文档配 CRD 和控制器。[reference:13]

从 CPU 推理到 GPU 推理的迁移验证。技能支持 CPU-only 路径(通过 KAITO 或其他 provider),也支持 GPU 路径。如果团队正在评估是否引入 GPU 节点池,可以先用 CPU 路径跑通流程,再切到 GPU 路径做对比。

多 provider 的快速切换测试。KAITO、Dynamo、KubeRay 三个 provider 各有侧重。技能可以在第四步帮你安装选定的 provider,后续如果要换,重新走第四步之后的流程即可。这比手动卸载再安装要清晰得多。

教程和演示环境的搭建。做 AI 推理的培训或演示时,需要在一个干净集群上快速还原一套可用的推理环境。技能的六步流程自带状态检查和确认机制,适合作为演示脚本使用。

部分完成的部署恢复。部署到一半因为网络超时或权限问题中断了,用 skip-to-step 从中断的步骤继续,不需要重头开始。

💡 使用帮助和常见问题

确认集群上下文正确。技能的第一步就是检查 Kubernetes context。如果你本地有多个集群的 kubeconfig,务必在执行前确认当前 context 指向的是目标集群。指向错误会导致控制器被部署到不该部署的地方。

GPU 评估的结果要认真看。第三步的输出会标记 GPU 型号和 dtype/attention 约束。如果评估结果提示某个 GPU 型号不支持你打算用的模型精度(比如 FP16 或 BF16),需要调整模型选择或推理配置,不要跳过这一步直接部署。

成本提醒不是走过场。GPU 节点池按小时计费,A100-80GB 可能每小时 3 到 5 美元。技能在涉及 GPU 资源的步骤前会提醒,目的是让你确认费用可接受。如果只是做功能验证,优先考虑 CPU-only 路径。

步骤中断后的恢复。告诉 AI 助手 skip-to-step 4 这类指令,它就会从第四步开始。已经完成的步骤(1 到 3)会被假定为已完成状态,不会重复执行。

和 azure-kubernetes 技能的配合。如果你还没有 AKS 集群,先用 azure-kubernetes 技能创建集群和 GPU 节点池,再回到这个技能。两个技能是上下游关系,不是替代关系。

🔍 和一个类似技能的对比

Azure Skills 生态里有一个 azure-deploy 技能,两者容易混淆,但定位完全不同。

azure-deploy 处理的是“已经准备好的应用的部署”。它要求项目里已经有 .azure/deployment-plan.md 和基础设施文件,然后执行 azd upazd deployterraform apply 这类命令,把应用推到云上。它不关心你的应用是不是 AI 推理服务,也不处理 GPU 评估和推理 provider 的选择。[reference:17]

airunway-aks-setup 处理的是“在 AKS 上从零搭建 AI 推理平台”。它的起点是一个已有的 AKS 集群(或者需要先创建的集群),终点是一个跑起来的模型推理服务。中间涉及的所有操作——CRD 安装、GPU 检测、推理 provider 选择、模型部署——都是 AI 推理场景特有的,azure-deploy 不会覆盖这些。

简单判断:如果你的应用是普通的 Web 服务或微服务,要部署到 Azure,用 azure-deploy。如果你要在 AKS 上跑模型推理,需要有人帮你把 AI Runway 的整套基础设施装好,用 airunway-aks-setup。两者不是竞争关系,在同一个项目里可能先后用到——先用 airunway-aks-setup 把推理平台搭起来,再用 azure-deploy 部署依赖这个推理服务的应用。

🤖 适合哪些 AI 工具

这个技能是微软官方维护的 azure-skills 包中的一员,官方明确支持的 AI 助手包括:

  • GitHub Copilot for Azure:在 VS Code 里通过 Azure MCP 扩展使用,是微软主推的组合方式
  • Claude Code:手动将技能目录放入 ~/.claude/skills/ 即可使用
  • Visual Studio Code + Azure MCP 扩展:通过 MCP 客户端加载技能
  • 其他兼容 MCP 客户端的 AI 助手:只要支持 skills 格式或 MCP 客户端协议,都可以加载

技能本身不依赖任何 MCP 工具,所有集群操作通过 kubectl 和 make 直接执行。这意味着即使你的 AI 助手环境没有配置复杂的 MCP 工具链,只要本地有这两个命令行工具,技能就能正常工作。

📌 一句话总结

airunway-aks-setup 做的是把“在 AKS 上部署第一个 AI 模型”这件事,从一堆零散的 kubectl 命令和 YAML 配置,压缩成六步可确认、可恢复、可重复的标准流程。如果你手头有 AKS 集群,需要快速验证或搭建模型推理能力,这个技能省掉的是查文档、配 CRD、选 provider 的那段摸索时间。