⚙️ 主要功能:六步流水线把 AKS 变成模型推理平台
airunway-aks-setup 是微软 azure-skills 仓库下的一个官方 Agent Skill,定位非常具体:把一个已有的 AKS 集群,从裸机状态一路带到能跑推理的模型服务状态。它不负责创建集群,也不处理模型训练,只专注“AI Runway 的上手”这一段。
整个流程被拆成六个有序步骤,每一步都有明确的检查点和输出。
第一步,集群验证。检查当前的 Kubernetes context 是否正确、节点清单是否完整、GPU 是否可被识别。这一步的输出是集群状态的健康报告,节点缺失或 GPU 检测失败会在这里被标记出来。
第二步,控制器安装。部署 AI Runway 的 CRD(自定义资源定义)和控制器。控制器是后续所有模型部署操作的执行入口,没有它,AI Runway 的资源对象无法被集群识别和处理。
第三步,GPU 评估。检测集群中 GPU 的具体型号,并标记出 dtype 和 attention 层面的约束。不同类型的 GPU 在推理框架里有不同的精度支持和显存限制,这一步的评估结果会直接影响后续推理 provider 的选择。
第四步,推理 provider 安装。技能内置了三个 provider 供选择,根据集群的 GPU 配置和推理负载特征来推荐。
| Provider | 最适合的场景 | 说明 |
|---|---|---|
| KAITO | 托管式 GPU 推理 | Kubernetes AI Toolchain Operator,自动完成模型部署和 GPU 节点供给 |
| Dynamo | 高吞吐量服务 | 针对多 GPU、多节点部署优化的推理框架 |
| KubeRay | 基于 Ray 的工作负载 | Ray 集群的 Kubernetes operator,适合分布式推理和训练 |
第五步,首次模型部署。从可用模型中选择一个,通过 AI Runway 部署到集群上。这一步会实际拉起推理服务,验证整个链路是否打通。
第六步,汇总报告。输出完整的部署状态,包括每一步的执行结果、遇到的错误和最终的服务地址。
这个技能还有一个实用的设计:支持从任意步骤恢复。如果部署中途因为网络或配置问题中断了,不需要从头再来一遍。告诉 AI 助手 skip-to-step N,N 是步骤编号(1 到 6),它就会从指定的步骤继续。[reference:5]
成本方面有一个需要提前知道的点:GPU 节点池的费用不低。A100-80GB 的实例每小时可能在 3 到 5 美元甚至更高。技能在执行涉及 GPU 资源的步骤之前,会输出成本提醒,确认用户了解费用影响后再继续。
🛠️ 第一次安装和使用
安装方式取决于你使用的 AI 助手环境。
通过 npx 安装(推荐):
npx skills add https://github.com/microsoft/azure-skills --skill airunway-aks-setup
这条命令会把技能安装到支持 skills 格式的 Agent 环境中。[reference:7]
手动安装到 Claude Code:
从 GitHub 下载 azure-skills 仓库的压缩包,解压后将 skills/airunway-aks-setup 目录放到 ~/.claude/skills/ 下。技能会在下一次会话中被自动发现。[reference:8]
安装之前需要确认几件事。本地需要装好 kubectl、make 和 curl 这三个命令行工具,技能的所有集群操作都直接通过 kubectl 和 make 执行,不依赖任何外部 MCP 工具。你还需要一个已经存在的 AKS 集群。如果还没有,需要先用 azure-kubernetes 技能创建一个带 GPU 节点池的集群(除非你接受 CPU-only 推理),再回到这个技能继续。
使用的时候不需要记特殊命令。在 AI 助手的对话里说“帮我在这个 AKS 集群上设置 AI Runway”或者“部署一个模型到 AKS”,技能就会被触发。[reference:11]它会按六步顺序推进,每一步完成之后报告状态,涉及安装或部署操作时会先请求确认,确认后才实际执行。
🎯 可以达到的效果
跑完整个流程之后,你会得到一个已经在 AKS 上运行起来的模型推理服务。不是配置文件,不是待执行的脚本,而是一个可以通过 API 调用的推理端点。
具体来说,AI Runway 控制器会以 Kubernetes 原生的方式管理模型部署——你可以在 kubectl get pods 里看到推理服务的 Pod,通过 Service 暴露端点,用标准的 Kubernetes 工具做扩缩容和监控。推理 provider(KAITO、Dynamo 或 KubeRay)负责底层的 GPU 调度和请求处理。
另一个实际的效果是流程的可重复性。这套六步流程是标准化的,换一个集群、换一个模型,操作路径基本一致。团队里其他人拿到同样的技能和集群,可以走同样的步骤得到类似的结果,不需要每个人自己摸索 kubectl 命令和 YAML 配置。
📋 主要应用场景
ML 平台团队的集群初始化。当团队拿到一个新的 AKS 集群,需要快速把它变成能跑推理的环境,这个技能提供了一条标准化的路径。六步流程走完,推理服务就跑起来了,不需要手动查文档配 CRD 和控制器。[reference:13]
从 CPU 推理到 GPU 推理的迁移验证。技能支持 CPU-only 路径(通过 KAITO 或其他 provider),也支持 GPU 路径。如果团队正在评估是否引入 GPU 节点池,可以先用 CPU 路径跑通流程,再切到 GPU 路径做对比。
多 provider 的快速切换测试。KAITO、Dynamo、KubeRay 三个 provider 各有侧重。技能可以在第四步帮你安装选定的 provider,后续如果要换,重新走第四步之后的流程即可。这比手动卸载再安装要清晰得多。
教程和演示环境的搭建。做 AI 推理的培训或演示时,需要在一个干净集群上快速还原一套可用的推理环境。技能的六步流程自带状态检查和确认机制,适合作为演示脚本使用。
部分完成的部署恢复。部署到一半因为网络超时或权限问题中断了,用 skip-to-step 从中断的步骤继续,不需要重头开始。
💡 使用帮助和常见问题
确认集群上下文正确。技能的第一步就是检查 Kubernetes context。如果你本地有多个集群的 kubeconfig,务必在执行前确认当前 context 指向的是目标集群。指向错误会导致控制器被部署到不该部署的地方。
GPU 评估的结果要认真看。第三步的输出会标记 GPU 型号和 dtype/attention 约束。如果评估结果提示某个 GPU 型号不支持你打算用的模型精度(比如 FP16 或 BF16),需要调整模型选择或推理配置,不要跳过这一步直接部署。
成本提醒不是走过场。GPU 节点池按小时计费,A100-80GB 可能每小时 3 到 5 美元。技能在涉及 GPU 资源的步骤前会提醒,目的是让你确认费用可接受。如果只是做功能验证,优先考虑 CPU-only 路径。
步骤中断后的恢复。告诉 AI 助手 skip-to-step 4 这类指令,它就会从第四步开始。已经完成的步骤(1 到 3)会被假定为已完成状态,不会重复执行。
和 azure-kubernetes 技能的配合。如果你还没有 AKS 集群,先用 azure-kubernetes 技能创建集群和 GPU 节点池,再回到这个技能。两个技能是上下游关系,不是替代关系。
🔍 和一个类似技能的对比
Azure Skills 生态里有一个 azure-deploy 技能,两者容易混淆,但定位完全不同。
azure-deploy 处理的是“已经准备好的应用的部署”。它要求项目里已经有 .azure/deployment-plan.md 和基础设施文件,然后执行 azd up、azd deploy、terraform apply 这类命令,把应用推到云上。它不关心你的应用是不是 AI 推理服务,也不处理 GPU 评估和推理 provider 的选择。[reference:17]
airunway-aks-setup 处理的是“在 AKS 上从零搭建 AI 推理平台”。它的起点是一个已有的 AKS 集群(或者需要先创建的集群),终点是一个跑起来的模型推理服务。中间涉及的所有操作——CRD 安装、GPU 检测、推理 provider 选择、模型部署——都是 AI 推理场景特有的,azure-deploy 不会覆盖这些。
简单判断:如果你的应用是普通的 Web 服务或微服务,要部署到 Azure,用 azure-deploy。如果你要在 AKS 上跑模型推理,需要有人帮你把 AI Runway 的整套基础设施装好,用 airunway-aks-setup。两者不是竞争关系,在同一个项目里可能先后用到——先用 airunway-aks-setup 把推理平台搭起来,再用 azure-deploy 部署依赖这个推理服务的应用。
🤖 适合哪些 AI 工具
这个技能是微软官方维护的 azure-skills 包中的一员,官方明确支持的 AI 助手包括:
- GitHub Copilot for Azure:在 VS Code 里通过 Azure MCP 扩展使用,是微软主推的组合方式
- Claude Code:手动将技能目录放入
~/.claude/skills/即可使用 - Visual Studio Code + Azure MCP 扩展:通过 MCP 客户端加载技能
- 其他兼容 MCP 客户端的 AI 助手:只要支持 skills 格式或 MCP 客户端协议,都可以加载
技能本身不依赖任何 MCP 工具,所有集群操作通过 kubectl 和 make 直接执行。这意味着即使你的 AI 助手环境没有配置复杂的 MCP 工具链,只要本地有这两个命令行工具,技能就能正常工作。
📌 一句话总结
airunway-aks-setup 做的是把“在 AKS 上部署第一个 AI 模型”这件事,从一堆零散的 kubectl 命令和 YAML 配置,压缩成六步可确认、可恢复、可重复的标准流程。如果你手头有 AKS 集群,需要快速验证或搭建模型推理能力,这个技能省掉的是查文档、配 CRD、选 provider 的那段摸索时间。

◯ 评论 0