🎨 ai-image-generation技能简介
ai-image-generation 的核心价值可以用一句话概括:把图像生成的多模型选择、提示词构建和迭代管理,全部交给 AI 代理处理。你不需要记住每个模型的 API 差异,不需要手动拼接参数,也不需要在一堆网页之间来回切换。
它支持文本生成图像、图像生成图像、局部重绘(inpainting)、LoRA 自定义风格、图像编辑和放大,以及图像内文字渲染。覆盖的模型超过 50 个,常用的包括 FLUX Dev LoRA、Gemini 3 Pro、Grok Imagine、Seedream 4.5、Reve 和 ImagineArt 等。
但它不只是一个模型列表的包装。这个技能内置了一套模型选择逻辑,会根据你要的画面风格推荐合适的模型——需要摄影级产品图就推 FLUX 或 Imagen,追求艺术感和风格化就选 Midjourney 或 Reve,需要准确渲染画面内文字就用 DALL·E 3 或 Seedream 3.0。
更实用的是它的提示词工程能力。生成图片时,提示词会被拆解为有序结构:主体、动作、风格/媒介、构图、光线,而不是一坨自由发挥的散文。生成结果还支持通过固定 seed 值来复现和微调,避免“改了一个词整张图全变”的尴尬。
📦 第一次怎么安装
这个技能通过 skills 注册表分发,安装前提是你已经装好了 Node.js,并且有一个支持 Agent Skills 的 AI 编码环境。
命令行安装(最通用)
npx skills add https://github.com/1nference-sh/skills --skill ai-image-generation
安装脚本会自动检测你的操作系统和架构,从官方分发地址下载匹配的二进制文件,并验证 SHA-256 校验和。不会请求提权权限,也不会在后台驻留进程。
OpenClaw 桌面应用安装
如果你在用 OpenClaw Easy,打开应用内的 Skills 面板,搜索 ai-image-generation,点击 Install 就行。装完后技能会在收到匹配描述的消息时自动激活,不需要额外配置。
如果你习惯 OpenClaw CLI:
openclaw skills add ai-image-generation
装完后重启一下 OpenClaw 网关,让新技能被识别。
🚀 装好之后怎么用
安装完成后不需要做任何配置。在 Claude Code、Cursor 等环境中,技能会自动被识别为项目级上下文,AI 代理在生成代码或响应请求时会主动使用它。
触发方式很直接——用自然语言描述你要的图片就行。比如:
帮我生成一张咖啡店的产品海报,暖色调,木质桌面,自然光从左侧照进来,画面里要有“Morning Brew”这几个字。
AI 会自动完成模型选择、提示词结构化、生成和保存的完整流程。
MCP 方式
如果你不想用 skills 格式,也可以在 MCP 配置中添加对应的服务器。比如 MeiGen-AI-Design-MCP 支持 GPT Image 2、Seedance 和 ComfyUI,内置 1400+ 提示词库,在 Claude Code、Cursor、Codex、Windsurf 等工具中都可以使用。
另一个选择是 @nuver-labs/image-gen-mcp,支持通过环境变量传入 Gemini 和 OpenAI 的 API Key:
claude mcp add image-gen --scope user \
--env GEMINI_API_KEY=your-key \
--env OPENAI_API_KEY=your-key \
-- npx -y @nuver-labs/image-gen-mcp
还有 imgx-mcp,支持文本驱动的图像编辑和多提供商路由,安装后直接输入 /image-generation 就能启动引导式工作流。
🎯 主要应用场景
营销素材快速产出。 产品海报、社交媒体配图、广告横幅、博客头图——这些不需要真实摄影的场景,用 ai-image-generation 可以在几分钟内出多版草稿。比较适合“先看方向再定稿”的工作流,省去反复向设计师提需求的时间。
产品模型与概念图。 做电商的可以用它生成产品使用场景图,做硬件的可以在开模前先出概念渲染图。Seedream 4.5 支持 2K-4K 电影级画质,产品类图片的可用度比较高。
UI/UX 设计中的占位素材。 开发过程中需要临时配图、图标背景、纹理素材时,直接在编码环境里让 AI 生成并放到项目 assets 目录,不用离开编辑器去别的地方找图。
多模型对比选型。 同一个提示词,可以让技能同时用 FLUX、Gemini 和 Seedream 各出一版,直观对比不同模型的表现,再决定最终用哪个方案。这在选定品牌视觉方向的阶段很有用。
内容创作中的插图生成。 写文章、做教程、准备演示文稿时,随时生成风格一致的插图。Reve 模型在自然语言编辑和文字渲染方面表现不错,适合需要画面中包含指定文字的场景。
💡 使用技巧与快捷键
按“画面效果”选模型,而不是按品牌。 需要摄影级真实感就选 FLUX 或 Imagen;需要画风独特的艺术感就选 Midjourney 或 Reve;需要在画面里准确显示文字就选 DALL·E 3 或 Seedream 3.0。在提示词里加一句“用适合产品摄影的模型”比指定品牌名更有效。
画面内文字要用引号包起来。 如果你想让图片里显示“CLOSED”这个单词,提示词要写成 "the sign reads exactly 'CLOSED'"。不加引号的话,模型会自己“理解”并改写你想要的文字。
用 seed 值做微调,不要重新生成。 对一张图基本满意但想改一个小细节时,固定 seed 值再调整提示词。这样画面主体和构图不会跑偏,只改你指定的部分。不加 seed 重新生成等于完全换一张图。
Ctrl/Cmd + Enter 直接生成。 在大多数集成了这个技能的界面中,输入完提示词后按 Ctrl + Enter(Mac 上是 Cmd + Enter)就能立即触发生成,不用去点按钮。Esc 可以紧急取消当前生成。
描述性提示词的推荐结构。 按“主体 + 动作/姿态 + 风格/媒介 + 构图 + 光线”的顺序写,比堆砌形容词有效得多。比如“一只仓鸮 + 展翅俯冲向麦田 + 油画,印象派笔触 + 居中构图,低角度 + 暖金色自然光”就比“美丽的鸟,很好看的油画风格”产出稳定得多。
避免模糊词。 “好看”“高端”“有质感”这类词对模型来说信息量几乎为零。把“高端”换成“哑光黑色陶瓷材质,工作室灯光,背景是浅灰色无缝纸”,效果会立刻不一样。
🧩 适合哪些 AI 工具
ai-image-generation 基于 skills.sh 格式分发,兼容所有支持该格式的 AI 编码代理。经过实际验证的工具包括:
- Claude Code:安装后自动作为技能上下文加载,可以直接在对话中生成图片。
- Cursor:在 Agent 模式中使用,生成的图片默认保存到项目的
assets/文件夹。 - OpenClaw:支持桌面应用一键安装和 CLI 安装,装完后可通过 WhatsApp、Telegram、Slack、Discord 等消息平台触发。
- Windsurf:支持 skills.sh 格式,安装后自动识别。
- Cline / Aider:通过项目级上下文文件读取技能指令。
- Codex:命令行环境下的 AI 编码代理,同样兼容。
如果你偏好 MCP 方案而非 skills 格式,MeiGen-AI-Design-MCP、imgx-mcp 和 @nuver-labs/image-gen-mcp 也都可以在 Claude Code、Cursor、Codex 等 MCP 兼容宿主中使用。选择哪个取决于你现有的工作流——已经在用 skills 生态就用前者,偏好 MCP 配置管理就用后者。

◯ 评论 0