🧩 它到底是什么

先把名字理清楚。nano-banana-2 指的是 Google Gemini 3.1 Flash Image 这个图像生成与编辑模型,在 AI Studio 中的模型标识是 gemini-3.1-flash-image-preview。它不是传统意义上的浏览器插件,而是一个能力极强的云端图像模型,通过 API 被各类 AI 工具调用。

在 Claude Code 生态里,围绕这个模型有一个常用的 skill,让 Claude 可以直接调用 nano-banana-2 完成图片编辑任务。skill 本身是一份 SKILL.md 文件,负责告诉 Agent 如何组装请求、传参和拿结果,真正干活的是 Google 的 API。

理解 nano-banana-2 的能力边界,关键看它的定位。它在 Arena 排行榜文生图项目上拿了 1280 分,排名第一,价格只有 Nano Banana Pro 的一半。但它的“性格”不是天马行空的插画师,而是一个手极稳的修图助理——擅长的是在参考图基础上做定向修改,而不是从零画一张全新的图。

它最核心的几项能力:多图参考最多可以挂 14 张参考图,官方建议按“产品层锁外观、场景层定环境、风格层管调性”的顺序分层使用,多数任务 5 到 6 张就够了;精准局部重绘支持主体分割跳过,把主体圈起来不许动,只改其余部分;主体一致性可以在单次工作流中保持最多 5 个角色和 14 个物体的保真度;精确文本渲染中文文本渲染相比一代有质的飞跃,带文字的设计素材基本不用手动 PS 修正;分辨率覆盖从 512px 到 4K,支持各种长宽比。

📦 第一次怎么装

nano-banana-2 的 skill 安装方式和多数 Agent Skill 一致。在项目根目录执行:

npx skills add google-gemini/nano-banana-2-skill --skill nano-banana-2

如果你不知道确切的仓库地址,也可以把下面这段话直接发给 Claude Code:

帮我找一个能调用 nano-banana-2(Gemini 3.1 Flash Image)的 skill 装上,我需要用它做图片编辑。

装好 skill 只是第一步。你还需要一个 Google AI Studio 的 API key,在 ~/.sketchkit/config 或环境变量里配置好 GOOGLE_API_KEY。如果你在 Claude Code 里操作,也可以在对话中直接说“帮我配置 nano-banana-2 的 API key”,Agent 会引导你完成设置。

这个 skill 本身不包含模型权重,它是一个纯文本的指令文件。如果你不用 Claude Code,也可以直接在 Gemini App、Google AI Studio 或任何支持 Gemini API 的第三方平台里使用 nano-banana-2,不需要装这个 skill。

🛠️ 装好之后怎么用

使用方式和你跟修图助理沟通的逻辑基本一样——描述改什么、保什么、参考谁。这三要素写齐和写不齐,成功率是两个世界。

在 Claude Code 中,你可以直接这样说:

用 nano-banana-2 帮我改这张图:背景换成纯白摄影棚,人物和服装保持原样不动,光照方向照我上传的参考图来。输出 2K 分辨率。

Agent 会把你的描述拆解成模型能理解的参数,组装 API 请求,然后把生成的图片保存到本地。如果你在第三方平台(如 Flux Art、ComfyUI 的 partner nodes)里使用,操作方式类似,区别只是界面不同。

几个典型的应用场景:

  • 电商产品图换背景。保留产品的外观、颜色和 Logo,只替换背景环境。用编辑式提示写“背景换掉,产品别动,色调照参考图来”,比描述整张画面靠谱得多。
  • 人物照片改风格。保留人物身份特征,把照片的整体调性改成胶片、杂志编辑或赛博朋克风格。挂一张风格参考图,模型会按参考的色调和光影来重新渲染。
  • 多图合成。把产品图、场景图和风格图同时作为参考喂进去,模型会融合三种信号生成新画面。官方建议控制在 5 到 6 张,按产品层、场景层、风格层的顺序上传,提示词里点名引用更方便。
  • 带文字的设计素材。生成海报、广告图或社交媒体卡片时,nano-banana-2 的中文渲染能力足够精准,不需要后期手动修正文字。

关于 MCP 命令,nano-banana-2 目前没有官方统一的 MCP server。在 Claude Code 中,skill 直接调用 Google 的 API;在其他工具中,通常通过各自的 API 集成层来使用。如果你需要 MCP 方式,可以关注社区是否有相关实现,或者自己在现有的 Gemini MCP server 基础上适配。

💡 几个让它出活更稳的技巧

  • 按编辑指令写,别按画面描述写。这是 nano-banana-2 和很多图像模型使用习惯上最大的区别。描述整张画面会让模型以为你要“整张重画”,该保的产品细节、人脸和 Logo 全被卷进重绘。写“改什么、保什么、参考谁”这三句,模型收到的信号才是清晰的。
  • 参考图要分层上传。14 张是容量上限,不是任务指标。多数任务 5 到 6 张就够,关键是分层:产品层锁外观,场景层定环境,风格层管调性。顺序固定下来,提示词里点名引用才方便。
  • 利用主体分割跳过保护关键元素。如果你需要改背景但不想让人物的脸有任何变化,明确告诉模型“把人物圈起来不许动,只改其余部分”。这个能力在 nano-banana-2 上是原生支持的,用好了能省掉大量后期修补的时间。
  • 分辨率按需选,不要一律 4K。1K 分辨率的成本是每张 0.067 美元,4K 会更高。社交媒体配图 1K 够用,印刷或大屏展示才需要 4K。在 skill 或 API 参数里指定分辨率能帮你控制成本。
  • 配合 Seedance 2.0 做动态化。先用 nano-banana-2 生成或编辑出满意的静态图,再把结果喂给 Seedance 2.0 做图生视频。这个工作流已经在社区里被验证过,适合需要“先定画面再动画”的场景。

🤖 适合哪些 AI 工具

nano-banana-2 的 skill 主要面向 Claude Code,安装后 Agent 可以自动识别“用 nano-banana-2 改这张图”这类意图并触发调用。

但模型本身不绑定 Claude Code。只要你的工具能调用 Google Gemini API,就能用上 nano-banana-2 的能力。目前支持的方式包括:Google AI Studio(官方网页端,免费可用)、Gemini App(手机端)、ComfyUI(通过 partner nodes 接入)、以及 Flux Art 等第三方聚合平台。

需要留意的是,nano-banana-2 的长处是“在已有图的基础上做精准修改”,不是从零生成复杂创意图。如果你要凭空画一张有复杂叙事或独特构图的图,GPT Image 2 或 Nano Banana Pro 可能更合适。nano-banana-2 的正确用法是:已经有参考图、知道要改哪里、需要精准控制改动范围——这时候它几乎是目前最好的选择。