Qwen-Image 2.1 入门:从一句提示词到一张图,6GB 显存为什么也能跑
最近我在本地折腾 Qwen-Image 2.1,遇到的第一个问题是模型应该怎么下载。提示词可以放到后面再研究。
以前使用在线图片模型很简单。在输入框里写一句话,点一下生成,过一会儿就能拿到图片。至于后台有几个模型、每个模型做了什么,用户根本不需要关心。
到了本地部署就不一样了。我这次用的是 Unsloth Desktop。它把模型搜索、下载、加载、参数设置和图片画廊都放进了桌面界面,使用时不需要像 ComfyUI 那样先手工连接节点。
客户端把复杂过程藏在界面后面。查看模型说明和运行日志,仍然可以看到三个必需组件:1
2
3一个文本编码器
一个 7B 图片生成模型
一个 VAE
如果再启用官方的提示词重写功能,还会多出一个 9B 模型。
一开始我也有点疑惑。Qwen-Image 2.1 的视觉生成主干是 7B,下载量却远超一个 7B 模型。生成一张图还要三个组件接力。我手里的 RTX 3060 只有 6GB 显存,它依然能跑起来。
实际测试中,复杂提示词使用 40 步生成一张图,大约要等 40 分钟。速度很慢,但 6GB 显存的 RTX 3060 确实完成了整个生成过程。
本文从基础过程讲起:一张 AI 图片怎样生成,三个组件分别做什么,步数为什么直接影响时间,6GB 显存又是如何承载十几 GB 的模型文件。
一、为什么要关注 Qwen-Image 2.1
Qwen-Image 2.1 在 2026 年 9 月 20 日发布,是截至本文写作时 Qwen 最新的开放权重图片模型。
“开放权重”最直接的意思是,模型文件可以下载到自己的电脑,不必把每一次生成请求都交给云端服务器。Qwen 官方同时提供了 Hugging Face、ModelScope、Diffusers 和 ComfyUI 等使用路径。
能够下载只是起点。它值得单独介绍,还因为这次把几个原本分散的能力放到了一起:
- 可以根据文字从零生成图片;
- 可以拿已有图片继续修改;
- 最多可以同时参考 10 张图片;
- 可以用圆圈、涂画或蒙版指出只改哪里;
- 可以直接生成带透明背景的 RGBA 图片;
- 原生支持 2K 分辨率;
- 视觉生成主干只有 7B,给消费级硬件和量化部署留下了空间。
质量方面,Qwen 重点改进了图片中的文字、字体布局、人物光线和纹理细节。官方演示覆盖风景图、人像、多人合影、虚拟换装、商品保持、海报文字、透明素材和局部修改。
这里还是要保守一点。官方展示和官方自己的 Qwen-Image-Bench 能说明团队对质量有信心,但不能直接替代独立横评。我没有拿完全相同的提示词、参考图、尺寸和种子去做严格盲测,所以不会直接下“超过 GPT Image 2”这种结论。
比较稳妥的判断是:Qwen-Image 2.1 的质量已经值得考虑实际用途,权重可下载只是其中一个条件。
二、AI 生成图片的基本过程
很多第一次接触生图模型的人,会把它想象成一个特别大的图库:输入“雨夜咖啡店”,模型从图库里找到相似图片,再拼接出结果。
实际过程更像从噪声中逐步修改出一张图。
模型开始工作时,拿到的更像是一张铺满随机雪花点的电视屏幕。它会根据提示词不断判断:哪些区域应该是人物,哪些地方应该是灯光,桌子放在哪里,招牌上应该出现什么文字。
可以把这个过程想象成一幅不断修改的草图:1
2
3
4
5
6
7
8
9
10
11随机噪声
↓
大致分出天空、人物和地面
↓
确定人物姿势、物体位置和光线方向
↓
补充衣服、头发、文字和材质
↓
清理边缘与细节
↓
最终图片
每一次“再修改一点”,就是 Unsloth Desktop 生成设置里的一个 Step。
设置 20 步,模型就做 20 轮主要修正;设置 40 步,核心生成模型基本要计算 40 轮。步数翻倍以后,时间通常也会接近翻倍。
这时会遇到下一个问题:一句中文提示词,怎么变成模型能够用来修改图片的信号?这就是三个模型开始分工的地方。
三、三个组件怎样组成一条流水线
先不看 DiT、VAE 这些名词,可以把整个系统想象成三个人合作画一张图:
- 第一个人负责听懂需求,整理成画师能执行的说明;
- 第二个人根据说明反复修改草图,完成主要绘制;
- 第三个人把压缩草图还原成真正的 PNG 图片。
对应到 Qwen-Image 2.1,就是下面这条流水线:1
2
3
4
5
6
7
8
9
10提示词、参考图
│
▼
Qwen3-VL 8B 编码器:理解需求
│
▼
7B DiT:反复修改图像潜变量
│
▼
RGBA VAE:还原为真正的图片
三个组件按阶段接力。前一个完成自己的工作,再把结果交给下一个。
第一步:编码器先把人话翻译成模型能理解的表示
输入“一个穿黄色雨衣的小孩站在蓝色公交站旁边”,模型不能直接拿中文字符去画图。它需要先理解:
- 主体是一个小孩;
- 衣服是黄色雨衣;
- 旁边有蓝色公交站;
- “黄色”修饰雨衣,公交站的颜色是蓝色;
- 人物和公交站之间存在空间关系。
Qwen-Image 2.1 使用 Qwen3-VL 8B 作为文本和视觉编码器。它可以读提示词、理解参考图片,再把这些信息转成一组数字表示,交给后面的生成模型。
“编码器”可以理解成需求分析员。它不负责最终绘图,却会影响后续模型对需求的执行。
公开的兼容权重中,这个编码器有不同精度。下面的文件大小主要用来理解量化前后的差异,不代表我在 Unsloth Desktop 里已经确认使用了其中某一个具体文件:
| 编码器版本 | 文件大小 | 直观理解 |
|---|---|---|
| BF16 | 约 17.5GB | 信息保留更多,占用也最大 |
| INT8 | 约 9.35GB | 体积明显缩小 |
| W4A8 | 约 6.31GB | 更适合内存紧张的机器 |
编码器通常只在前面运行一次,不需要像生成模型那样完整重复 40 次。
第二步:DiT 才是真正反复画图的主力
编码器把要求整理好以后,7B DiT 开始根据这些条件修改图像。
DiT 的全称是 Diffusion Transformer。普通读者不需要记住全称,只要记住它是整条流水线里最像“画师”的部分。
它会多次修正画面,每一轮都会执行类似的判断:1
2
3
4现在画面离提示词还差什么?
人物轮廓是否正确?
灯光方向是否合理?
文字边缘是否需要继续修正?
官方默认 40 步,就意味着这个最重的组件需要连续工作 40 轮。主要时间消耗在这里。
它的 BF16 权重约 14.2GB,INT8 权重约 7.26GB。即使只下载 INT8,文件本身也已经大于 6GB 显存,因此低显存机器必须依靠模型卸载。
第三步:VAE 把压缩草图还原成图片
如果让 DiT 从头到尾直接处理 2048×2048 的完整像素,计算量会非常大。实际生成发生在一个被压缩的“潜空间”里。
可以把潜空间理解成一种模型专用的压缩草图:人眼不能直接把它当照片看,但它保留了画面的主要结构和特征。
当 DiT 完成所有步骤以后,VAE 再把这张压缩草图解码成我们能打开的图片。Qwen-Image 2.1 的 VAE 支持 16 倍空间压缩和 RGBA,可以恢复颜色并直接生成透明度通道。
ComfyUI 兼容包提供的单文件 BF16 VAE 约 676MB。它比前两个组件小得多,通常只在解码阶段运行一次。处理高分辨率图片时,这一阶段仍会产生显存峰值。
四、为什么不直接把它们做成一个模型
三个组件的分工如下:
- 编码器擅长理解语言和参考图片;
- DiT 擅长反复生成结构、光影和细节;
- VAE 擅长压缩和还原像素图片。
这和拍电影有点像。编剧、摄影和后期都在为同一个成片工作,但不能因为最终只需要一个视频文件,就要求一个人同时把所有事情做完。
分开以后还有一个实际好处:框架可以在某个组件完成工作后,把它从显存挪回系统内存,再把下一个组件放进去。对于大显存显卡,这个动作不一定明显;对于 6GB 显存,它直接决定了模型能不能启动。
可选的提示词重写模型又是什么
Qwen 还提供了两个 Qwen3.5-VL 9B 模型,一个服务于文生图,一个服务于图片编辑。
这两个模型负责提示词重写。它们可以把“帮我画一只雨里的猫”扩写成更具体的构图、光线、风格和位置描述,相当于在需求分析员前面增加一个文案编辑。
提示词重写可以提高简单提示词的完整度。基础出图不依赖这两个可选组件。低配机器应该先把三段式流程跑通,再考虑是否增加 9B 模型。
五、7B 为什么还要下载十几 GB
这里有一个常见的单位误区。
7B 指大约 70 亿个参数。它不直接对应 7GB 文件。参数需要用数字格式保存,不同精度占用的字节数不同。
用比较粗略的算法理解:1
2
3
4
5BF16:每个参数约 2 字节
70 亿参数 × 2 字节 ≈ 14GB
INT8:每个参数约 1 字节
70 亿参数 × 1 字节 ≈ 7GB
这与公开兼容权重的大致大小一致:DiT 的 BF16 约 14.2GB,INT8 约 7.26GB。
但这还只是画师,不包括负责理解提示词的 Qwen3-VL 8B,也不包括 VAE。官方完整 BF16 仓库总量约 33.1GB,因此不能看到“7B”就以为准备 8GB 硬盘和 8GB 内存足够了。
量化所做的事情,就是用更少的位数保存参数。文件会变小,内存压力会降低,代价是有些精度会损失。它有点像把无损图片转换成高质量 JPEG:大部分时候变化不明显,但复杂纹理、小字和人物细节可能更容易暴露差异。
六、6GB 显存为什么没有被直接撑爆
理解低显存运行,最简单的类比是把显存看成工作台,把系统内存看成旁边的货架。
完整模型太大,无法全部摊在 6GB 工作台上。但程序可以把暂时不用的东西放在 32GB 货架上,只把当前需要计算的组件或层搬到工作台:1
2
3
4
5NVMe:存放模型文件
↓ 读取
32GB 系统内存:保存大部分模型权重
↓ 按需搬运
6GB 显存:计算当前组件或当前一部分层
完成一部分以后,再把它挪走,换下一部分进来。这个过程通常叫 CPU Offload 或模型卸载。
“6GB 显存能跑”指的是显卡、系统内存和硬盘共同维持流水线。约 14GB 的模型权重会分段进入 6GB 显存。
代价同样很好理解:画师每画几笔,就要停下来去货架换一箱工具。真正绘图的时间没有消失,搬运又增加了额外等待。
我的机器配置和目前观察到的结果是:1
2
3
4
5
6
7
8
9
10
11
12
13
14
15客户端:Unsloth Desktop
GPU:RTX 3060,6GB 显存
系统内存:32GB
分辨率:1024×1024
生成步数:40
Guidance:1
Batch size:1
Runs:1
Transformer:BF16
Text encoder:FP8
Attention:cuDNN
Memory:Streaming Offload
CPU Offload:自动启用
Step Cache:关闭
复杂提示词耗时:约 40 分钟/张
Unsloth 在 2026 年 9 月 22 日加入了 Qwen-Image 2.1 支持,桌面端可以在 Images 页面直接搜索并下载 GGUF 或 FP8 版本。官方文档也明确给出了 6GB 显存使用 FP8 配合 Offload 的路径。
本次实际运行记录显示,反复执行 40 步的 Transformer 使用 BF16,文本编码器使用 FP8,显存策略是 Streaming Offload。这个组合会把约 14GB 的 BF16 Transformer 分段送入 6GB 显存。
这也解释了为什么能够运行,同时又需要约 40 分钟。40 步里最重的 Transformer 会反复计算,而 Streaming Offload 还要不断在系统内存和显存之间搬运权重。
这个数字只是一次个人实测,不构成严格跑分。后台占用、软件版本、硬盘和自动参数都会影响耗时,其他 3060 机器可能得到不同结果。
但它能解释一个现象:低显存不会必然报错,只是大量时间花在分层计算和内存搬运上。系统内存越小、硬盘越慢、PCIe 传输越受限,这个过程就越难受。
七、40 步到底在做什么
前面说过,每一步都可以理解为模型重新检查并修正一次画面。
为了方便理解,可以把不同阶段粗略看成:1
2
3前几步:决定大构图,人物和背景在哪里
中间阶段:确定物体关系、姿势、光线和颜色
后面阶段:补纹理、边缘、文字和小物体
真实算法不会严格按照这个分工切开,但用它判断步数已经足够。
Qwen 和 Diffusers 公开示例使用 40 步,Unsloth 也把 40 步列为 GPU/Diffusers 路径的基准。这是本文推荐的质量对照点。
步数增加时,主要生成阶段会做更多轮计算。Unsloth 同时提醒,增加步数不保证结果一定更好,降低步数也未必解决显存不足。
如果 40 步耗时过长,可以在同一台机器上做一组对照测试:固定提示词、分辨率、种子和其他设置,分别运行 20、30 和 40 步。这两个低步数是测试点,没有被官方定义为画质档位。保留能够接受的最低步数,比照抄一张通用“极速参数表”更可靠。
复杂提示词会增加编码和注意力计算。40 分钟耗时主要来自 40 轮 DiT 计算和低显存环境下的权重搬运。多写几十个字的影响相对小。
八、Qwen-Image 2.1 做了哪些实际优化
知道一次出图的时间消耗以后,官方强调的架构优化会更容易理解。
1. VAE 先把大图压缩,再交给 DiT
这是基础架构。DiT 在被 VAE 压缩过的潜空间里生成,然后再还原到完整像素。
可以把它理解成在尺寸更小、信息更集中的画布上完成主要创作,再输出大图。如果消费级硬件需要处理 40 轮完整 2K 画面,计算成本会高得多。
2. 文字和图片不再用同一种阅读方式
文字有明显顺序。“黄色雨衣的小孩”不能随便打乱成“黄色小孩的雨衣”。图片则不同,同一个画面里的左侧人物和右侧公交站需要彼此看到,才能保持空间关系。
Qwen-Image 2.1 使用混合粒度注意力:文字采用 token 级因果掩码,图片采用 chunk 级双向掩码。
普通用户不必记这些术语,只要理解为:文字按照句子顺序读,图片按照完整画面看。模型不再强迫两种信息使用完全相同的处理方式。
3. 固定内容只计算一次
生成 40 步时,提示词和参考图片通常不会变化。如果每一步都重新理解六张参考图,会浪费大量计算。
Prefix KV Cache 所做的事,就像先把固定资料整理成笔记。第一步完成以后,后面 39 步直接查笔记,不再从头阅读。
参考图越多,这项优化越重要。它不会让 40 步变成 4 步,但能减少重复处理输入条件的开销。
4. 生成、编辑和透明图片共用一套管线
Qwen-Image 2.1 使用 64 通道 RGBA VAE,透明度可以直接成为模型输出的一部分。
旧工作流程常常需要生图模型、编辑模型和抠图模型接力。Qwen-Image 2.1 把文生图、参考图编辑和透明素材放在同一个体系中,工作流更紧凑。
5. 发布时已经准备好多种运行方式
Qwen 官方发布时就提供了 Diffusers 和 ComfyUI 支持,也列出了 vLLM-Omni、SGLang 与 LightX2V 路径。Unsloth 随后在桌面客户端中加入了 Qwen-Image 2.1 的本地生成和编辑支持。
普通用户可以先用 Unsloth Desktop 跑通第一张图片;想进一步观察每个模型节点怎样连接,再切换到 ComfyUI;需要做批量接口、多卡或并发服务时,再研究 CUDA Graph、FP8、张量并行和服务框架。没有必要第一次出图就把整套生态全部学完。
九、这些升级对普通人有什么实际影响
参数和架构最终还是要落回使用场景,否则只是另一张规格表。
图片里的文字更有机会直接可用
Qwen 重点改进了文字内容、字体样式和版式之间的关系。短标题、招牌、海报主视觉的可用率会更高。
正式排版仍然需要 Photoshop、Figma 或其他排版工具。价格、日期、活动规则和产品型号需要人工核对。
多张参考图可以共同参与生成
最多 10 张参考图可以同时参与生成。用户可以组合来自不同图片的人物、衣服、鞋和包,也可以根据多件家具生成完整房间。
这让模型从“根据一句话画图”,开始靠近可控的内容生产工具。
局部修改不必整张重画
通过圆圈、涂画或者蒙版指出修改区域后,可以只要求模型改变头发、衣服或某个物体。对于已经基本满意、只差一个局部的图片,这比重新抽一次种子更合理。
透明图片可以少一道抠图
图标、贴纸、商品素材、网页装饰和视频叠加层,可以直接要求输出 RGBA。少一次抠图,就少一次毛边、漏选和半透明区域丢失的风险。
十、它和 GPT Image 2 应该怎么选
这两者的核心区别是部署位置和控制权。可以用厨房作类比:GPT Image 2 使用云端厨房,Qwen-Image 2.1 把厨房装在自己的电脑上。
GPT Image 2 由 OpenAI 通过 Images API 和 Responses API 提供。用户不用下载权重,也不用关心显存、内存和量化,提交提示词和图片以后等待服务返回结果。
Qwen-Image 2.1 则允许把模型文件、工作流、参考图和生成记录全部放在本地。方便的代价是硬件、速度和维护都要自己负责。
| 关心的问题 | Qwen-Image 2.1 | GPT Image 2 |
|---|---|---|
| 能否下载模型权重 | 可以 | 官方只提供云端服务接口 |
| 是否需要自己准备显卡 | 需要 | 不需要 |
| 上手速度 | 要配置模型和工作流 | 调用网页或 API 更直接 |
| 数据能否完全留在本地 | 可以 | 请求需要提交给云端服务 |
| 成本方式 | 硬件、电费、时间 | 按 API 使用量计费 |
| 工作流控制 | 可以固定模型、节点、种子和版本 | 以服务端能力和接口为准 |
| 最适合谁 | 喜欢折腾、隐私素材、固定流程和本地研究 | 更在意速度、质量和省心的用户 |
如果只是偶尔生成几张图片,云端模型通常更轻松。为了省几次 API 费用,专门下载几十 GB 模型,再等 40 分钟出一张图,并不划算。
如果需要反复生成、处理内部素材、固定工作流,或者就是想知道图片模型在本地怎样运转,Qwen-Image 2.1 的价值就完全不同了。
截至本文写作时,OpenAI 图片产品线已经出现 GPT Image 2.5。这里保留 GPT Image 2 作为对照,是因为本文比较的是“云端专有模型”和“本地开放权重模型”两种使用方式,不是在做最新模型排行榜。
十一、普通人如何开始部署
我这次使用 Unsloth Desktop。它适合先跑通生成流程,不需要预先学习 ComfyUI 或自己写 Python。
安装桌面客户端以后,基本流程只有四步:
- 在左侧进入 Images;
- 保持默认的 Create 文生图工作流;
- 在模型选择器或 Model Hub 里搜索 Qwen-Image 2.1;
- 下载适合当前硬件的量化版本,输入提示词后点击 Generate。
第一次生成通常会更慢,因为客户端还要下载、加载模型并准备运行环境。生成成功以后,图片会进入本地 Gallery;打开图片可以回看提示词和参数,也可以通过 Recipe 恢复当时的生成配置。
6GB 显存应该怎么选
Unsloth 官方文档给出的建议是:FP8/INT8 更适合 GPU 路径,GGUF 更适合主要依赖系统内存、纯 CPU 或统一内存设备。文档明确写到 6GB 显存可以通过 FP8 加 CPU Offload 运行,只是速度会下降。
我这台 3060 的运行方式与官方说明一致。客户端把一部分权重放到 32GB 系统内存,需要时再搬进显卡。
模型选择器中的完整条目名称很重要。不同量化和后端可能采用不同的步数、CFG 和调度器配方。文件名中的 FP8 或 GGUF 不足以确定全部参数,必须确认实际运行的后端。
RTX 3060 6GB+32GB 内存的推荐参数
下表面向 Unsloth Desktop 的 GPU/Diffusers 路径。数值来自 Qwen 的 Diffusers 示例和 Unsloth 的 Qwen-Image 2.1 运行指南。高级选项中没有官方指定唯一值的项目,则采用适合 6GB 显存的保守选择。
| 参数 | 推荐值 | 依据和原因 |
|---|---|---|
| 模型版本 | Qwen-Image 2.1 FP8 | Unsloth 明确给出 6GB 显存用 FP8 配合 Offload 的路径 |
| 后端 | Unsloth GPU / Diffusers | 本表的 40 步和 Guidance 1.0 只对应这条路径 |
| 分辨率 | 1024×1024 | Unsloth 建议从 1024×1024 开始;宽高要能被 32 整除 |
| Steps | 40 | Qwen/Diffusers 的官方基准 |
| Guidance / CFG | 1.0 | Unsloth 的 GPU/Diffusers 配方明确要求 |
| Negative prompt | 留空 | 官方配方的建议 |
| Sampler / Scheduler | 保持模型管线默认 | 避免把其他 Stable Diffusion 模型的配方套进来 |
| Batch size | 1 | Unsloth 官方基准,也能控制显存峰值 |
| Runs | 1 | 单次只生成一张,避免时间按次数累加 |
| Seed | 42 | Qwen 和 Unsloth 示例使用的固定对照种子;正式创作可留空随机 |
| Speed | Auto | 先保持可复现的默认基线;编译加速可能让第一张更慢 |
| Transformer precision | FP8 | 减少权重体积和卸载压力;Unsloth 的 6GB 路径使用这一精度 |
| Text encoder precision | Default | 让当前模型配方选择可用精度,加载后在 Loaded build 中核对 |
| Attention | Auto | 让客户端按当前 NVIDIA 环境选择可用实现 |
| Memory | Low VRAM;若 Auto 显示 Streaming 可保持 Auto | Unsloth 建议显存接近极限时用 Low VRAM;Streaming 同样会分段搬运权重 |
| CPU Offload | 开启 | 官方的 6GB 路径依赖 Offload,32GB 系统内存用于承接卸载权重 |
| Step Cache | Auto;做基线时保持 Off | Unsloth 说明它会复用步骤间的部分计算,但没有给出所有硬件都应强制开启的结论 |
这组参数的目标是先获得可复现、可比较的基准。Qwen 官方的原生分辨率是 2K,Unsloth 针对本地起步配置建议 1024×1024。对 6GB 显存,两者需要区分。
为什么建议从 FP8 开始
我实际跑通的是 BF16 Transformer 配合 Streaming Offload。它证明这台机器可以生成图片,40 步耗时约 40 分钟也说明权重搬运很重。
Unsloth 对 6GB 显存的公开建议是 FP8 加 Offload,并提醒 Offload 需要额外系统内存,也会拖慢生成。因此可以先把 Transformer 从 BF16 换为 FP8,其他项保持不动,然后记录新的耗时和画质。
Unsloth 还公布了 INT8 和 FP8 的量化对照。其测试中 INT8 的 LPIPS 和 SSIM 指标更好,因此官方默认倾向 INT8。这不会改变 6GB 配置的起点,因为官方针对 6GB 显存单独列出的是 FP8 卸载路径。
如何缩短等待时间
参数调整应该一次只改一项:
- 选择 FP8 版本,启用 CPU Offload;
- 保持 1024×1024、Guidance 1.0、Batch 1、Runs 1 和 Seed 42;
- 先跑一次 40 步,记录时间和结果;
- 保持其他条件,再跑 30 步和 20 步;
- 逐张比较人物结构、文字、手部、纹理和边缘,保留自己能接受的最低步数;
- 完成步数对照后,再单独测试 Step Cache。
20 步和 30 步在这里是对照测试点,没有官方画质保证。不同提示词对步数的敏感度不同,所以不宜把一个数字写成所有场景的“最佳值”。
不要混用两种后端的配方
Unsloth 为 Native stable-diffusion.cpp 另外给出了 20 步、CFG 6、Euler 和自动 Flow Shift 的配方。这套数值属于 stable-diffusion.cpp 后端,不应搬到 Unsloth GPU/Diffusers 路径。
Guidance 1.0 同样需要与 GPU/Diffusers 路径绑定理解。某些 Stable Diffusion 模型常用 CFG 5 或 7,这些经验值不能直接用到 Qwen-Image 2.1 的这套管线。
为什么文章前面还介绍 ComfyUI 文件
Unsloth Desktop 帮用户自动完成了模型搜索和下载,所以不需要手工把三个文件放进对应目录。但编码器、DiT 和 VAE 仍然存在,只是由客户端管理。
如果以后切换到 ComfyUI 手动部署,才需要分别下载这些组件。以低内存组合为例,INT8 DiT、W4A8 编码器和 BF16 VAE 合计约 14.25GB。加上客户端、缓存、输出图片和交换空间,硬盘仍建议至少预留 25~30GB。
先确认 Unsloth Desktop 能完整生成第一张图,再去拆 ComfyUI 节点,会比一开始同时处理模型目录、节点连接和显存问题容易得多。
十二、18GB 内存的 Mac 又是什么情况
Qwen 官方 Hugging Face 页面给出了 Apple 设备切换到 MPS 的提示,Mac 具备可用的运行路径。
18GB 统一内存不能简单类比成“18GB 显存”。它是 CPU、GPU 和 macOS 共同使用的一块空间。系统占用一部分以后,模型可用容量会进一步减少。
而我的独立显卡电脑实际拥有:1
6GB 显存 + 32GB 系统内存
虽然两块空间不能简单相加,但模型卸载时,32GB 系统内存确实提供了更大的货架。18GB Mac 使用量化权重和组件卸载,有机会运行;完整 BF16 不现实,INT8 也会带来明显内存压力,并可能使用 SSD 交换空间。
所以 18GB Mac 更适合体验和偶尔出图。如果准备高频生成、多参考图编辑或者持续跑 2K,本地硬件余量会比较紧张。
十三、三个使用边界
能跑和好用之间差得很远
6GB 显存跑出一张图值得高兴,但几十分钟一张不适合不停改提示词。它适合学习、验证和偶尔使用,不适合作为高频生产工具。
模型进步不代表结果一定正确
文字、人物身份和商品外观的保持率依然达不到百分之百。涉及价格、品牌、人物和正式宣传素材时,必须人工检查。
权重可下载不等于可以随意商用
Qwen 官方的描述中使用了“开源”,具体许可证名称是 Qwen Research License,与 Apache 2.0 的授权范围不同。当前许可证直接授权非商业研究和评估。商业使用需要向 Qwen 申请单独许可。
文章中用“开放权重、可以本地部署”会更准确。权重可下载不等于可以自由商用。
十四、我的判断
Qwen-Image 2.1 没有让 6GB 显卡获得高端显卡的速度。我的实际体验是,复杂提示词、40 步需要等待约 40 分钟。性能差距仍然很大。
它降低了亲手试验新模型的硬件门槛。
以前面对这一档图片模型,低显存机器经常只能看看官方演示;现在通过 INT8、W4A8 和模型卸载,至少能够亲自完成一张图,观察提示词、步数、参考图和量化带来的区别。
知道编码器负责理解、DiT 负责迭代、VAE 负责还原以后,Unsloth Desktop 里的 Generate 按钮就有了可以解释的内部过程。出了问题,可以从提示词理解、生成步数、模型卸载和显存四个方向排查。
它的新架构、图片质量和本地部署路径共同构成了写作价值。普通用户可以在本地观察和拆解整个生成流程。