🧩 它和“一个模型干一件事”的思路有什么不同

Flux.2 Klein 是 Black Forest Labs 在 2026 年初推出的开源图像模型家族,名字里的“Klein”在德语中是“小”的意思,指向它最核心的设计取向:用更小的参数量做更多的事,同时把推理速度压到亚秒级

它最值得留意的设计,是把文生图、图像编辑和多参考合成塞进了同一个架构里。传统做法是文生图一个模型、编辑一个模型、多图合成再一个模型,切换时要换权重、换 pipeline、重新加载。Flux.2 Klein 把这三种任务统一成一套 rectified flow transformer,输入端接收什么,模型就做什么,不需要你提前声明“我现在要切换到编辑模式”。

目前这个家族有两个参数规模:

  • 4B 版本采用 Apache 2.0 许可证,支持商用。在 RTX 3090/4070 及以上显卡上仅需约 13GB 显存,蒸馏版在 RTX 5090 上生成一张图约 1.2 秒,显存占用约 8.4GB。
  • 9B 版本质量更高,官方称其性能可与参数规模大 5 倍的模型匹敌,采用 FLUX 非商业许可证,适合研究和非商业场景。蒸馏版在 RTX 5090 上约 2 秒出图,显存占用约 19.6GB。
  • Base 版本(4B Base 和 9B Base)保留完整训练信号、未经蒸馏,输出多样性更高,适合微调和 LoRA 训练。

量化版本是与 NVIDIA 合作开发的。FP8 版本在 RTX GPU 上速度提升最高 1.6 倍,显存占用减少约 40%;NVFP4 版本速度提升最高 2.7 倍,显存占用减少约 55%。这意味着 4B 的 NVFP4 版本在消费级显卡上可以跑到非常轻的显存占用。

还有一个容易被忽略但很实用的能力:Flux.2 Klein 支持最高 400 万像素(如 2000×2000)的图像编辑。在开源模型里,能把编辑分辨率做到这个级别的并不多,对需要高分辨率输出的设计场景来说是一个实打实的优势。

📦 三种安装方式,按你的工作流选

方式一:Diffusers Python 库(推荐给开发者和脚本用户)

Flux.2 Klein 的支持目前还在 diffusers 的 flux2-klein 分支上,还没有合并进主分支。所以安装时要指定分支:

pip install torch diffusers transformers accelerate optimum-quanto huggingface-hub safetensors
pip install git+https://github.com/huggingface/diffusers.git@flux2-klein

装好之后,文生图的基础用法很直接:

import torch
from diffusers import Flux2KleinPipeline

pipe = Flux2KleinPipeline.from_pretrained(
    "black-forest-labs/FLUX.2-klein-4B",
    torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()

image = pipe(
    prompt="你的图像描述",
    height=1024, width=1024,
    guidance_scale=1.0,
    num_inference_steps=4,
    generator=torch.Generator(device="cuda").manual_seed(0)
).images[0]
image.save("output.png")

注意 num_inference_steps=4——这是蒸馏版的设计步数,不要按常规习惯改成 20 或 30,那会拖慢速度且不提升质量。guidance_scale=1.0 也是 Klein 的推荐值,调高反而可能过饱和。

方式二:ComfyUI 自定义节点(推荐给可视化工作流用户)

ComfyUI 对 Flux.2 Klein 的支持已经比较成熟。最省事的方式是装一个全能节点包 one-node-flux-2-klein,它把文生图、图像编辑、局部重绘、扩图、换脸全部整合进一个自包含的 UI widget,通过单击切换 7 种模式:T2I、I2I、EDIT、PAINT、FACESWAP 等。

如果你偏好更细粒度的控制,也可以用 ComfyUI-Flux2Klein-Enhancer,它的核心工作流是多参考身份保持编辑:每张参考图先用 FLUX.2 VAE 编码,把 latent 送到 Multi Reference Latent 节点,再把 conditioning 输出给采样器,最后用 Identity Feature Transfer Final 节点 patch 模型。

手动安装的话,把节点包克隆到 ComfyUI 的 custom_nodes 目录,重启后即可使用。ComfyUI 官方模板库也已经收录了 Flux.2 Klein 的工作流,包括 9B 文生图、9B 蒸馏图像编辑和图像扩展。

有一个细节值得注意:Flux.2 Klein 默认对 Differential Diffusion 的支持不太好,如果你在使用 Nunchaku 等加速方案时遇到画质问题,可以先把 Differential Diffusion 关掉。

方式三:MCP 服务器(推荐给 Claude Code / Cursor 用户)

Black Forest Labs 官方维护了一个 MCP 服务器,把所有 FLUX.2 模型(Pro、Max、Klein 4B & 9B、Flex)统一暴露给任何支持 MCP 协议的客户端。安装方式因客户端而异,Claude Code 用户最简单:

claude mcp add --transport http FLUX https://mcp.bfl.ai

Cursor 用户可以在 ~/.cursor/mcp.json 中添加:

{
  "mcpServers": {
    "FLUX": { "url": "https://mcp.bfl.ai" }
  }
}

Codex 用户执行 codex mcp add flux --url https://mcp.bfl.ai 即可。Windsurf 用户需要注意:Windsurf 的配置字段是 serverUrl 而不是 url

这个 MCP 服务器是托管在 mcp.bfl.ai 的远程服务,走 OAuth 认证,不需要在对话里粘贴 API key。第一次调用时会弹出浏览器让你登录 BFL 账号并选择计费组织,之后 token 会自动刷新。你直接向 BFL 付费,没有中间商。暴露的工具覆盖 generateeditvarybrowse,每次 prompt 最多可以并行出 8 张图。

另外还有一个社区维护的 RunComfy skill 路线,用 npx skills add agentspace-so/runcomfy-skills --skill flux-2-klein -g 安装,走 RunComfy 的异步 REST API,不需要 API key 也能用。

🛠️ 装好之后怎么用:提示词写法和参数逻辑

Flux.2 Klein 的提示词风格和很多图像模型不一样。官方最佳实践文档里有一条很明确的建议:像小说家描述场景一样写提示词,而不是堆标签

它特别吃光照和氛围描述。同样一个主体,写“a woman standing in a room”和写“morning light streaming through linen curtains, soft shadows across a woman’s face as she pauses by the window”得到的结果差距很大。Klein 对光线词汇的敏感度明显高于对风格标签的敏感度。

几个具体的写法准则:

  • 主体前置。词序在这个模型上是生效的。把你的焦点主体放在 prompt 最前面,后面再跟环境、光线和氛围。不要写“一个温暖的下午,光线很好,有一个女人在窗边”,要写“A woman by the window, warm afternoon light, soft shadows”。
  • 用强调短语标记优先级。prominently featuringwith particular attention toespecially detailed 这类短语会让模型把注意力分配到指定元素上。需要突出某个细节时,比加粗字体有用。
  • 长度控制在 40 到 70 词之间。官方最佳实践给出的区间是这个范围。太短模型自己发挥,太长模型开始忽略后半部分。
  • 负面提示词在编辑场景下很有用。有一个反直觉的技巧:如果你做图像编辑时发现模型总想把背景也换掉,在负面提示词里加上“change background”,它就不换了。负面提示词在这里不是用来排除画质瑕疵的,而是用来锁定编辑范围的。

图像编辑场景的提示词还有一个实用技巧:在 prompt 前面加上或去掉 change to。这个短语会显著改变模型对编辑指令的理解方式——加上它,模型明确知道这是一次“修改”;去掉它,模型可能把它当成“基于参考图重新生成”。两种理解方式得到的结果差异很大,取决于你具体想要什么。

多参考编辑的推荐流程是:先用一张图做单参考编辑,确认 prompt 方向对了,再扩展到多参考。不要一上来就传四五张参考图,那样反而很难判断问题出在哪张图上。

💡 几个让出图更稳的技巧

  • 用短提示词做多轮快速变体,而不是一条长 prompt 反复改。Klein 的亚秒级速度让“多试几次”变得非常便宜。与其花十分钟精雕一条 prompt,不如用 40 词的短 prompt 跑 6 个变体,一眼就能看出模型对哪个方向响应最好。
  • 编辑后偏色用 LCS 修正。社区实践中发现,Klein 编辑后的图像有时会出现偏色问题。推荐用 ComfyUI-LCS 插件做 Lentent 修正,效果比手动调色自然。
  • LoRA 加速要克制。Turbo 或 Distill LoRA 可以进一步提升速度,但会牺牲画质。如果要用,尽量把 LoRA weight 设得小一些,找到速度和质量的平衡点。
  • 编辑步数可以适当提高到 10 到 25 步。虽然蒸馏版的设计步数是 4 步,但在图像编辑和 inpainting 场景下,社区经验是把步数提到 10 到 25 之间能减少细节崩坏。文生图保持 4 步即可。
  • 400 万像素编辑是它的差异化能力。如果你需要在高分辨率图上做局部修改,Klein 是目前开源模型里少数能在这个分辨率级别上工作的选择。把编辑分辨率用到 2000×2000,细节保留程度会明显好于先缩小再编辑。
  • 锁定 seed 做可控迭代。和大多数图像模型一样,固定 seed 后只改一个 prompt 变量,可以精确判断哪个变化产生了哪个效果。这对编辑任务尤其重要——你能分清“是 prompt 起作用了还是随机性”。

🔗 可以配合什么使用

  • 配合 Qwen3-VL 做智能编辑提示生成。ComfyUI 上有一个产品植入工作流,先用 Qwen3-VL 分析输入图片并生成富上下文的编辑提示,再把提示交给 Flux.2 Klein 9B 做多图合成,最后用 LTX-2.3 把静帧转成产品短视频。这条链路把“理解图片”和“编辑图片”分给了不同的模型,各司其职。
  • 配合 ComfyUI-Color-Matcher 做扩图色彩保持。做 outpainting(图像扩展)时,用 ComfyUI-Color-Matcher 和 comfyui-kjnodes 可以在扩展区域保持与原图一致的色彩和风格连贯性。对于需要把有限素材扩展成更大构图的场景很实用。
  • 配合 Nunchaku 做推理加速。Nunchaku 提供了针对 Flux.2 Klein 的量化推理支持,有专门的 ComfyUI 节点包。如果你在追求极致速度,Nunchaku + FP8/NVFP4 量化版本的组合可以在消费级显卡上把出图时间压到接近理论极限。
  • 配合 LTX-2 做静帧到视频的延伸。Klein 负责生成或编辑高质量静帧,LTX-2 负责把静帧转成带音画同步的短视频。这个组合适合需要“先定画面再动态化”的内容生产流程。

🤖 适合哪些 AI 工具

Flux.2 Klein 的接入面在开源图像模型里属于比较宽的,因为它既有完整的开源权重,又有官方 MCP 服务器。

MCP 路线的官方服务器 mcp.bfl.ai 支持 Claude Code、Claude Desktop、Cursor、Codex、Windsurf、Hermes 以及任何遵循 MCP 协议的宿主。对于只接受静态 bearer token 的客户端,可以用 mcp-remote 做 stdio 桥接。

本地部署路线适合所有支持 Diffusers 或 ComfyUI 的环境。Diffusers 让它可以嵌入任何 Python 脚本或服务;ComfyUI 让它在可视化节点图里工作。Krita 的 AI Diffusion 插件从 1.46.0 版本开始支持 Flux 2 Klein 模型的管理安装,1.47.0 之后支持自动下载。

第三方平台方面,WaveSpeedAI 提供了 Flux.2 Klein 9B 的 REST 推理接口,云算力平台如网心算力云也提供了预配置的镜像,支持一键部署。InvokeAI 从 v6.11.0 开始支持 Flux.2 Klein 模型。

需要留意的是许可证差异:4B 版本是 Apache 2.0,可以商用;9B 版本是 FLUX 非商业许可证,只能用于研究和非商业场景。如果你的项目涉及商业用途,选 4B 版本或者去 BFL 获取 9B 的商业授权。