Qwen-Image 2.1 入门:从一句提示词到一张图,6GB 显存为什么也能跑

最近我在本地折腾 Qwen-Image 2.1,遇到的第一个问题是模型应该怎么下载。提示词可以放到后面再研究。

以前使用在线图片模型很简单。在输入框里写一句话,点一下生成,过一会儿就能拿到图片。至于后台有几个模型、每个模型做了什么,用户根本不需要关心。

到了本地部署就不一样了。我这次用的是 Unsloth Desktop。它把模型搜索、下载、加载、参数设置和图片画廊都放进了桌面界面,使用时不需要像 ComfyUI 那样先手工连接节点。

客户端把复杂过程藏在界面后面。查看模型说明和运行日志,仍然可以看到三个必需组件:

1
2
3
一个文本编码器
一个 7B 图片生成模型
一个 VAE

如果再启用官方的提示词重写功能,还会多出一个 9B 模型。

一开始我也有点疑惑。Qwen-Image 2.1 的视觉生成主干是 7B,下载量却远超一个 7B 模型。生成一张图还要三个组件接力。我手里的 RTX 3060 只有 6GB 显存,它依然能跑起来。

实际测试中,复杂提示词使用 40 步生成一张图,大约要等 40 分钟。速度很慢,但 6GB 显存的 RTX 3060 确实完成了整个生成过程。

本文从基础过程讲起:一张 AI 图片怎样生成,三个组件分别做什么,步数为什么直接影响时间,6GB 显存又是如何承载十几 GB 的模型文件。

一、为什么要关注 Qwen-Image 2.1

Qwen-Image 2.1 在 2026 年 9 月 20 日发布,是截至本文写作时 Qwen 最新的开放权重图片模型。

“开放权重”最直接的意思是,模型文件可以下载到自己的电脑,不必把每一次生成请求都交给云端服务器。Qwen 官方同时提供了 Hugging Face、ModelScope、Diffusers 和 ComfyUI 等使用路径。

能够下载只是起点。它值得单独介绍,还因为这次把几个原本分散的能力放到了一起:

  • 可以根据文字从零生成图片;
  • 可以拿已有图片继续修改;
  • 最多可以同时参考 10 张图片;
  • 可以用圆圈、涂画或蒙版指出只改哪里;
  • 可以直接生成带透明背景的 RGBA 图片;
  • 原生支持 2K 分辨率;
  • 视觉生成主干只有 7B,给消费级硬件和量化部署留下了空间。

质量方面,Qwen 重点改进了图片中的文字、字体布局、人物光线和纹理细节。官方演示覆盖风景图、人像、多人合影、虚拟换装、商品保持、海报文字、透明素材和局部修改。

这里还是要保守一点。官方展示和官方自己的 Qwen-Image-Bench 能说明团队对质量有信心,但不能直接替代独立横评。我没有拿完全相同的提示词、参考图、尺寸和种子去做严格盲测,所以不会直接下“超过 GPT Image 2”这种结论。

比较稳妥的判断是:Qwen-Image 2.1 的质量已经值得考虑实际用途,权重可下载只是其中一个条件。

二、AI 生成图片的基本过程

很多第一次接触生图模型的人,会把它想象成一个特别大的图库:输入“雨夜咖啡店”,模型从图库里找到相似图片,再拼接出结果。

实际过程更像从噪声中逐步修改出一张图。

模型开始工作时,拿到的更像是一张铺满随机雪花点的电视屏幕。它会根据提示词不断判断:哪些区域应该是人物,哪些地方应该是灯光,桌子放在哪里,招牌上应该出现什么文字。

可以把这个过程想象成一幅不断修改的草图:

1
2
3
4
5
6
7
8
9
10
11
随机噪声
↓
大致分出天空、人物和地面
↓
确定人物姿势、物体位置和光线方向
↓
补充衣服、头发、文字和材质
↓
清理边缘与细节
↓
最终图片

每一次“再修改一点”,就是 Unsloth Desktop 生成设置里的一个 Step。

设置 20 步,模型就做 20 轮主要修正;设置 40 步,核心生成模型基本要计算 40 轮。步数翻倍以后,时间通常也会接近翻倍。

这时会遇到下一个问题:一句中文提示词,怎么变成模型能够用来修改图片的信号?这就是三个模型开始分工的地方。

三、三个组件怎样组成一条流水线

先不看 DiT、VAE 这些名词,可以把整个系统想象成三个人合作画一张图:

  1. 第一个人负责听懂需求,整理成画师能执行的说明;
  2. 第二个人根据说明反复修改草图,完成主要绘制;
  3. 第三个人把压缩草图还原成真正的 PNG 图片。

对应到 Qwen-Image 2.1,就是下面这条流水线:

1
2
3
4
5
6
7
8
9
10
提示词、参考图
│
▼
Qwen3-VL 8B 编码器:理解需求
│
▼
7B DiT:反复修改图像潜变量
│
▼
RGBA VAE:还原为真正的图片

三个组件按阶段接力。前一个完成自己的工作,再把结果交给下一个。

第一步:编码器先把人话翻译成模型能理解的表示

输入“一个穿黄色雨衣的小孩站在蓝色公交站旁边”,模型不能直接拿中文字符去画图。它需要先理解:

  • 主体是一个小孩;
  • 衣服是黄色雨衣;
  • 旁边有蓝色公交站;
  • “黄色”修饰雨衣,公交站的颜色是蓝色;
  • 人物和公交站之间存在空间关系。

Qwen-Image 2.1 使用 Qwen3-VL 8B 作为文本和视觉编码器。它可以读提示词、理解参考图片,再把这些信息转成一组数字表示,交给后面的生成模型。

“编码器”可以理解成需求分析员。它不负责最终绘图,却会影响后续模型对需求的执行。

公开的兼容权重中,这个编码器有不同精度。下面的文件大小主要用来理解量化前后的差异,不代表我在 Unsloth Desktop 里已经确认使用了其中某一个具体文件:

编码器版本文件大小直观理解
BF16约 17.5GB信息保留更多,占用也最大
INT8约 9.35GB体积明显缩小
W4A8约 6.31GB更适合内存紧张的机器

编码器通常只在前面运行一次,不需要像生成模型那样完整重复 40 次。

第二步:DiT 才是真正反复画图的主力

编码器把要求整理好以后,7B DiT 开始根据这些条件修改图像。

DiT 的全称是 Diffusion Transformer。普通读者不需要记住全称,只要记住它是整条流水线里最像“画师”的部分。

它会多次修正画面,每一轮都会执行类似的判断:

1
2
3
4
现在画面离提示词还差什么?
人物轮廓是否正确?
灯光方向是否合理?
文字边缘是否需要继续修正?

官方默认 40 步,就意味着这个最重的组件需要连续工作 40 轮。主要时间消耗在这里。

它的 BF16 权重约 14.2GB,INT8 权重约 7.26GB。即使只下载 INT8,文件本身也已经大于 6GB 显存,因此低显存机器必须依靠模型卸载。

第三步:VAE 把压缩草图还原成图片

如果让 DiT 从头到尾直接处理 2048×2048 的完整像素,计算量会非常大。实际生成发生在一个被压缩的“潜空间”里。

可以把潜空间理解成一种模型专用的压缩草图:人眼不能直接把它当照片看,但它保留了画面的主要结构和特征。

当 DiT 完成所有步骤以后,VAE 再把这张压缩草图解码成我们能打开的图片。Qwen-Image 2.1 的 VAE 支持 16 倍空间压缩和 RGBA,可以恢复颜色并直接生成透明度通道。

ComfyUI 兼容包提供的单文件 BF16 VAE 约 676MB。它比前两个组件小得多,通常只在解码阶段运行一次。处理高分辨率图片时,这一阶段仍会产生显存峰值。

四、为什么不直接把它们做成一个模型

三个组件的分工如下:

  • 编码器擅长理解语言和参考图片;
  • DiT 擅长反复生成结构、光影和细节;
  • VAE 擅长压缩和还原像素图片。

这和拍电影有点像。编剧、摄影和后期都在为同一个成片工作,但不能因为最终只需要一个视频文件,就要求一个人同时把所有事情做完。

分开以后还有一个实际好处:框架可以在某个组件完成工作后,把它从显存挪回系统内存,再把下一个组件放进去。对于大显存显卡,这个动作不一定明显;对于 6GB 显存,它直接决定了模型能不能启动。

可选的提示词重写模型又是什么

Qwen 还提供了两个 Qwen3.5-VL 9B 模型,一个服务于文生图,一个服务于图片编辑。

这两个模型负责提示词重写。它们可以把“帮我画一只雨里的猫”扩写成更具体的构图、光线、风格和位置描述,相当于在需求分析员前面增加一个文案编辑。

提示词重写可以提高简单提示词的完整度。基础出图不依赖这两个可选组件。低配机器应该先把三段式流程跑通,再考虑是否增加 9B 模型。

五、7B 为什么还要下载十几 GB

这里有一个常见的单位误区。

7B 指大约 70 亿个参数。它不直接对应 7GB 文件。参数需要用数字格式保存,不同精度占用的字节数不同。

用比较粗略的算法理解:

1
2
3
4
5
BF16:每个参数约 2 字节
70 亿参数 × 2 字节 ≈ 14GB

INT8:每个参数约 1 字节
70 亿参数 × 1 字节 ≈ 7GB

这与公开兼容权重的大致大小一致:DiT 的 BF16 约 14.2GB,INT8 约 7.26GB。

但这还只是画师,不包括负责理解提示词的 Qwen3-VL 8B,也不包括 VAE。官方完整 BF16 仓库总量约 33.1GB,因此不能看到“7B”就以为准备 8GB 硬盘和 8GB 内存足够了。

量化所做的事情,就是用更少的位数保存参数。文件会变小,内存压力会降低,代价是有些精度会损失。它有点像把无损图片转换成高质量 JPEG:大部分时候变化不明显,但复杂纹理、小字和人物细节可能更容易暴露差异。

六、6GB 显存为什么没有被直接撑爆

理解低显存运行,最简单的类比是把显存看成工作台,把系统内存看成旁边的货架。

完整模型太大,无法全部摊在 6GB 工作台上。但程序可以把暂时不用的东西放在 32GB 货架上,只把当前需要计算的组件或层搬到工作台:

1
2
3
4
5
NVMe:存放模型文件
↓ 读取
32GB 系统内存:保存大部分模型权重
↓ 按需搬运
6GB 显存:计算当前组件或当前一部分层

完成一部分以后,再把它挪走,换下一部分进来。这个过程通常叫 CPU Offload 或模型卸载。

“6GB 显存能跑”指的是显卡、系统内存和硬盘共同维持流水线。约 14GB 的模型权重会分段进入 6GB 显存。

代价同样很好理解:画师每画几笔,就要停下来去货架换一箱工具。真正绘图的时间没有消失,搬运又增加了额外等待。

我的机器配置和目前观察到的结果是:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
客户端:Unsloth Desktop
GPU:RTX 3060,6GB 显存
系统内存:32GB
分辨率:1024×1024
生成步数:40
Guidance:1
Batch size:1
Runs:1
Transformer:BF16
Text encoder:FP8
Attention:cuDNN
Memory:Streaming Offload
CPU Offload:自动启用
Step Cache:关闭
复杂提示词耗时:约 40 分钟/张

Unsloth 在 2026 年 9 月 22 日加入了 Qwen-Image 2.1 支持,桌面端可以在 Images 页面直接搜索并下载 GGUF 或 FP8 版本。官方文档也明确给出了 6GB 显存使用 FP8 配合 Offload 的路径。

本次实际运行记录显示,反复执行 40 步的 Transformer 使用 BF16,文本编码器使用 FP8,显存策略是 Streaming Offload。这个组合会把约 14GB 的 BF16 Transformer 分段送入 6GB 显存。

这也解释了为什么能够运行,同时又需要约 40 分钟。40 步里最重的 Transformer 会反复计算,而 Streaming Offload 还要不断在系统内存和显存之间搬运权重。

这个数字只是一次个人实测,不构成严格跑分。后台占用、软件版本、硬盘和自动参数都会影响耗时,其他 3060 机器可能得到不同结果。

但它能解释一个现象:低显存不会必然报错,只是大量时间花在分层计算和内存搬运上。系统内存越小、硬盘越慢、PCIe 传输越受限,这个过程就越难受。

七、40 步到底在做什么

前面说过,每一步都可以理解为模型重新检查并修正一次画面。

为了方便理解,可以把不同阶段粗略看成:

1
2
3
前几步:决定大构图,人物和背景在哪里
中间阶段:确定物体关系、姿势、光线和颜色
后面阶段:补纹理、边缘、文字和小物体

真实算法不会严格按照这个分工切开,但用它判断步数已经足够。

Qwen 和 Diffusers 公开示例使用 40 步,Unsloth 也把 40 步列为 GPU/Diffusers 路径的基准。这是本文推荐的质量对照点。

步数增加时,主要生成阶段会做更多轮计算。Unsloth 同时提醒,增加步数不保证结果一定更好,降低步数也未必解决显存不足。

如果 40 步耗时过长,可以在同一台机器上做一组对照测试:固定提示词、分辨率、种子和其他设置,分别运行 20、30 和 40 步。这两个低步数是测试点,没有被官方定义为画质档位。保留能够接受的最低步数,比照抄一张通用“极速参数表”更可靠。

复杂提示词会增加编码和注意力计算。40 分钟耗时主要来自 40 轮 DiT 计算和低显存环境下的权重搬运。多写几十个字的影响相对小。

八、Qwen-Image 2.1 做了哪些实际优化

知道一次出图的时间消耗以后,官方强调的架构优化会更容易理解。

1. VAE 先把大图压缩,再交给 DiT

这是基础架构。DiT 在被 VAE 压缩过的潜空间里生成,然后再还原到完整像素。

可以把它理解成在尺寸更小、信息更集中的画布上完成主要创作,再输出大图。如果消费级硬件需要处理 40 轮完整 2K 画面,计算成本会高得多。

2. 文字和图片不再用同一种阅读方式

文字有明显顺序。“黄色雨衣的小孩”不能随便打乱成“黄色小孩的雨衣”。图片则不同,同一个画面里的左侧人物和右侧公交站需要彼此看到,才能保持空间关系。

Qwen-Image 2.1 使用混合粒度注意力:文字采用 token 级因果掩码,图片采用 chunk 级双向掩码。

普通用户不必记这些术语,只要理解为:文字按照句子顺序读,图片按照完整画面看。模型不再强迫两种信息使用完全相同的处理方式。

3. 固定内容只计算一次

生成 40 步时,提示词和参考图片通常不会变化。如果每一步都重新理解六张参考图,会浪费大量计算。

Prefix KV Cache 所做的事,就像先把固定资料整理成笔记。第一步完成以后,后面 39 步直接查笔记,不再从头阅读。

参考图越多,这项优化越重要。它不会让 40 步变成 4 步,但能减少重复处理输入条件的开销。

4. 生成、编辑和透明图片共用一套管线

Qwen-Image 2.1 使用 64 通道 RGBA VAE,透明度可以直接成为模型输出的一部分。

旧工作流程常常需要生图模型、编辑模型和抠图模型接力。Qwen-Image 2.1 把文生图、参考图编辑和透明素材放在同一个体系中,工作流更紧凑。

5. 发布时已经准备好多种运行方式

Qwen 官方发布时就提供了 Diffusers 和 ComfyUI 支持,也列出了 vLLM-Omni、SGLang 与 LightX2V 路径。Unsloth 随后在桌面客户端中加入了 Qwen-Image 2.1 的本地生成和编辑支持。

普通用户可以先用 Unsloth Desktop 跑通第一张图片;想进一步观察每个模型节点怎样连接,再切换到 ComfyUI;需要做批量接口、多卡或并发服务时,再研究 CUDA Graph、FP8、张量并行和服务框架。没有必要第一次出图就把整套生态全部学完。

九、这些升级对普通人有什么实际影响

参数和架构最终还是要落回使用场景,否则只是另一张规格表。

图片里的文字更有机会直接可用

Qwen 重点改进了文字内容、字体样式和版式之间的关系。短标题、招牌、海报主视觉的可用率会更高。

正式排版仍然需要 Photoshop、Figma 或其他排版工具。价格、日期、活动规则和产品型号需要人工核对。

多张参考图可以共同参与生成

最多 10 张参考图可以同时参与生成。用户可以组合来自不同图片的人物、衣服、鞋和包,也可以根据多件家具生成完整房间。

这让模型从“根据一句话画图”,开始靠近可控的内容生产工具。

局部修改不必整张重画

通过圆圈、涂画或者蒙版指出修改区域后,可以只要求模型改变头发、衣服或某个物体。对于已经基本满意、只差一个局部的图片,这比重新抽一次种子更合理。

透明图片可以少一道抠图

图标、贴纸、商品素材、网页装饰和视频叠加层,可以直接要求输出 RGBA。少一次抠图,就少一次毛边、漏选和半透明区域丢失的风险。

十、它和 GPT Image 2 应该怎么选

这两者的核心区别是部署位置和控制权。可以用厨房作类比:GPT Image 2 使用云端厨房,Qwen-Image 2.1 把厨房装在自己的电脑上。

GPT Image 2 由 OpenAI 通过 Images API 和 Responses API 提供。用户不用下载权重,也不用关心显存、内存和量化,提交提示词和图片以后等待服务返回结果。

Qwen-Image 2.1 则允许把模型文件、工作流、参考图和生成记录全部放在本地。方便的代价是硬件、速度和维护都要自己负责。

关心的问题Qwen-Image 2.1GPT Image 2
能否下载模型权重可以官方只提供云端服务接口
是否需要自己准备显卡需要不需要
上手速度要配置模型和工作流调用网页或 API 更直接
数据能否完全留在本地可以请求需要提交给云端服务
成本方式硬件、电费、时间按 API 使用量计费
工作流控制可以固定模型、节点、种子和版本以服务端能力和接口为准
最适合谁喜欢折腾、隐私素材、固定流程和本地研究更在意速度、质量和省心的用户

如果只是偶尔生成几张图片,云端模型通常更轻松。为了省几次 API 费用,专门下载几十 GB 模型,再等 40 分钟出一张图,并不划算。

如果需要反复生成、处理内部素材、固定工作流,或者就是想知道图片模型在本地怎样运转,Qwen-Image 2.1 的价值就完全不同了。

截至本文写作时,OpenAI 图片产品线已经出现 GPT Image 2.5。这里保留 GPT Image 2 作为对照,是因为本文比较的是“云端专有模型”和“本地开放权重模型”两种使用方式,不是在做最新模型排行榜。

十一、普通人如何开始部署

我这次使用 Unsloth Desktop。它适合先跑通生成流程,不需要预先学习 ComfyUI 或自己写 Python。

安装桌面客户端以后,基本流程只有四步:

  1. 在左侧进入 Images;
  2. 保持默认的 Create 文生图工作流;
  3. 在模型选择器或 Model Hub 里搜索 Qwen-Image 2.1;
  4. 下载适合当前硬件的量化版本,输入提示词后点击 Generate。

第一次生成通常会更慢,因为客户端还要下载、加载模型并准备运行环境。生成成功以后,图片会进入本地 Gallery;打开图片可以回看提示词和参数,也可以通过 Recipe 恢复当时的生成配置。

6GB 显存应该怎么选

Unsloth 官方文档给出的建议是:FP8/INT8 更适合 GPU 路径,GGUF 更适合主要依赖系统内存、纯 CPU 或统一内存设备。文档明确写到 6GB 显存可以通过 FP8 加 CPU Offload 运行,只是速度会下降。

我这台 3060 的运行方式与官方说明一致。客户端把一部分权重放到 32GB 系统内存,需要时再搬进显卡。

模型选择器中的完整条目名称很重要。不同量化和后端可能采用不同的步数、CFG 和调度器配方。文件名中的 FP8 或 GGUF 不足以确定全部参数,必须确认实际运行的后端。

RTX 3060 6GB+32GB 内存的推荐参数

下表面向 Unsloth Desktop 的 GPU/Diffusers 路径。数值来自 Qwen 的 Diffusers 示例和 Unsloth 的 Qwen-Image 2.1 运行指南。高级选项中没有官方指定唯一值的项目,则采用适合 6GB 显存的保守选择。

参数推荐值依据和原因
模型版本Qwen-Image 2.1 FP8Unsloth 明确给出 6GB 显存用 FP8 配合 Offload 的路径
后端Unsloth GPU / Diffusers本表的 40 步和 Guidance 1.0 只对应这条路径
分辨率1024×1024Unsloth 建议从 1024×1024 开始;宽高要能被 32 整除
Steps40Qwen/Diffusers 的官方基准
Guidance / CFG1.0Unsloth 的 GPU/Diffusers 配方明确要求
Negative prompt留空官方配方的建议
Sampler / Scheduler保持模型管线默认避免把其他 Stable Diffusion 模型的配方套进来
Batch size1Unsloth 官方基准,也能控制显存峰值
Runs1单次只生成一张,避免时间按次数累加
Seed42Qwen 和 Unsloth 示例使用的固定对照种子;正式创作可留空随机
SpeedAuto先保持可复现的默认基线;编译加速可能让第一张更慢
Transformer precisionFP8减少权重体积和卸载压力;Unsloth 的 6GB 路径使用这一精度
Text encoder precisionDefault让当前模型配方选择可用精度,加载后在 Loaded build 中核对
AttentionAuto让客户端按当前 NVIDIA 环境选择可用实现
MemoryLow VRAM;若 Auto 显示 Streaming 可保持 AutoUnsloth 建议显存接近极限时用 Low VRAM;Streaming 同样会分段搬运权重
CPU Offload开启官方的 6GB 路径依赖 Offload,32GB 系统内存用于承接卸载权重
Step CacheAuto;做基线时保持 OffUnsloth 说明它会复用步骤间的部分计算,但没有给出所有硬件都应强制开启的结论

这组参数的目标是先获得可复现、可比较的基准。Qwen 官方的原生分辨率是 2K,Unsloth 针对本地起步配置建议 1024×1024。对 6GB 显存,两者需要区分。

为什么建议从 FP8 开始

我实际跑通的是 BF16 Transformer 配合 Streaming Offload。它证明这台机器可以生成图片,40 步耗时约 40 分钟也说明权重搬运很重。

Unsloth 对 6GB 显存的公开建议是 FP8 加 Offload,并提醒 Offload 需要额外系统内存,也会拖慢生成。因此可以先把 Transformer 从 BF16 换为 FP8,其他项保持不动,然后记录新的耗时和画质。

Unsloth 还公布了 INT8 和 FP8 的量化对照。其测试中 INT8 的 LPIPS 和 SSIM 指标更好,因此官方默认倾向 INT8。这不会改变 6GB 配置的起点,因为官方针对 6GB 显存单独列出的是 FP8 卸载路径。

如何缩短等待时间

参数调整应该一次只改一项:

  1. 选择 FP8 版本,启用 CPU Offload;
  2. 保持 1024×1024、Guidance 1.0、Batch 1、Runs 1 和 Seed 42;
  3. 先跑一次 40 步,记录时间和结果;
  4. 保持其他条件,再跑 30 步和 20 步;
  5. 逐张比较人物结构、文字、手部、纹理和边缘,保留自己能接受的最低步数;
  6. 完成步数对照后,再单独测试 Step Cache。

20 步和 30 步在这里是对照测试点,没有官方画质保证。不同提示词对步数的敏感度不同,所以不宜把一个数字写成所有场景的“最佳值”。

不要混用两种后端的配方

Unsloth 为 Native stable-diffusion.cpp 另外给出了 20 步、CFG 6、Euler 和自动 Flow Shift 的配方。这套数值属于 stable-diffusion.cpp 后端,不应搬到 Unsloth GPU/Diffusers 路径。

Guidance 1.0 同样需要与 GPU/Diffusers 路径绑定理解。某些 Stable Diffusion 模型常用 CFG 5 或 7,这些经验值不能直接用到 Qwen-Image 2.1 的这套管线。

为什么文章前面还介绍 ComfyUI 文件

Unsloth Desktop 帮用户自动完成了模型搜索和下载,所以不需要手工把三个文件放进对应目录。但编码器、DiT 和 VAE 仍然存在,只是由客户端管理。

如果以后切换到 ComfyUI 手动部署,才需要分别下载这些组件。以低内存组合为例,INT8 DiT、W4A8 编码器和 BF16 VAE 合计约 14.25GB。加上客户端、缓存、输出图片和交换空间,硬盘仍建议至少预留 25~30GB。

先确认 Unsloth Desktop 能完整生成第一张图,再去拆 ComfyUI 节点,会比一开始同时处理模型目录、节点连接和显存问题容易得多。

十二、18GB 内存的 Mac 又是什么情况

Qwen 官方 Hugging Face 页面给出了 Apple 设备切换到 MPS 的提示,Mac 具备可用的运行路径。

18GB 统一内存不能简单类比成“18GB 显存”。它是 CPU、GPU 和 macOS 共同使用的一块空间。系统占用一部分以后,模型可用容量会进一步减少。

而我的独立显卡电脑实际拥有:

1
6GB 显存 + 32GB 系统内存

虽然两块空间不能简单相加,但模型卸载时,32GB 系统内存确实提供了更大的货架。18GB Mac 使用量化权重和组件卸载,有机会运行;完整 BF16 不现实,INT8 也会带来明显内存压力,并可能使用 SSD 交换空间。

所以 18GB Mac 更适合体验和偶尔出图。如果准备高频生成、多参考图编辑或者持续跑 2K,本地硬件余量会比较紧张。

十三、三个使用边界

能跑和好用之间差得很远

6GB 显存跑出一张图值得高兴,但几十分钟一张不适合不停改提示词。它适合学习、验证和偶尔使用,不适合作为高频生产工具。

模型进步不代表结果一定正确

文字、人物身份和商品外观的保持率依然达不到百分之百。涉及价格、品牌、人物和正式宣传素材时,必须人工检查。

权重可下载不等于可以随意商用

Qwen 官方的描述中使用了“开源”,具体许可证名称是 Qwen Research License,与 Apache 2.0 的授权范围不同。当前许可证直接授权非商业研究和评估。商业使用需要向 Qwen 申请单独许可。

文章中用“开放权重、可以本地部署”会更准确。权重可下载不等于可以自由商用。

十四、我的判断

Qwen-Image 2.1 没有让 6GB 显卡获得高端显卡的速度。我的实际体验是,复杂提示词、40 步需要等待约 40 分钟。性能差距仍然很大。

它降低了亲手试验新模型的硬件门槛。

以前面对这一档图片模型,低显存机器经常只能看看官方演示;现在通过 INT8、W4A8 和模型卸载,至少能够亲自完成一张图,观察提示词、步数、参考图和量化带来的区别。

知道编码器负责理解、DiT 负责迭代、VAE 负责还原以后,Unsloth Desktop 里的 Generate 按钮就有了可以解释的内部过程。出了问题,可以从提示词理解、生成步数、模型卸载和显存四个方向排查。

它的新架构、图片质量和本地部署路径共同构成了写作价值。普通用户可以在本地观察和拆解整个生成流程。

参考资料