6GB显存能跑35B MoE吗:FreeToken极限配置、性能压榨与实操教程
6GB显存可以尝试运行Qwen3.6-35B-A3B-NVFP4,但代价是更小的专家缓存和KV容量,以及对32GB以上内存、CPU与PCIe带宽的更高依赖。本文给出已验证配置、调优顺序、压测脚本和明确限制。
围绕 Java 运行时、低成本大模型推理和 Agent 工程,按学习顺序整理已有文章。
从类加载、Java Agent 和 Javassist 进入字节码增强,最后串联到 ByteKit 与 Arthas。
按顺序阅读从本地部署、量化和 KV Cache 参数入手,逐步理解显存占用、GPU Offload 与 MoE 专家缓存。
按顺序阅读从 Agent 开发框架和工具系统出发,理解循环、上下文、工具调用、Subagent 与 MCP 的工程实现。
按顺序阅读6GB显存可以尝试运行Qwen3.6-35B-A3B-NVFP4,但代价是更小的专家缓存和KV容量,以及对32GB以上内存、CPU与PCIe带宽的更高依赖。本文给出已验证配置、调优顺序、压测脚本和明确限制。
之前写过几篇 Java Agent 和 Javassist,也单独介绍过 Arthas 的 vmtool。这些内容放在一起看,会发现它们其实一直围绕着同一个问题:
前几天看到一个挺夸张的结果:FreeToken 在一台只有 8GB 显存的 RTX 4060 Laptop 上运行 Qwen3.6-35B-A3B,解码速度达到了 39.3 tok/s。
最近deepseek发布了harness,试用了一下结合deepseek-4-flash,用它尝试写一个php的现代版phpmyadmin,因为也是一个比较重要且有一点复杂度的应用 试了下除了数据展示有点问题,修了一轮就完成了,整体表现还是不错的 然后看了下它主打的是万物都是插…
本文拆解 Pi Agent 的核心工具系统,说明 Read、Write、Edit、Bash 的输入结构、文件读写流程、输出截断、变更队列与命令执行机制。