6GB 显存加速 GPT-OSS 20B:GPU Offload 层数与速度实测
使用 RTX 3060 Laptop 6GB 显卡和 LM Studio 运行 GPT-OSS 20B,实测不同 GPU Offload 层数、显存占用与生成速度,并说明小显存配置的限制。
使用 RTX 3060 Laptop 6GB 显卡和 LM Studio 运行 GPT-OSS 20B,实测不同 GPU Offload 层数、显存占用与生成速度,并说明小显存配置的限制。
之前体验过gemini code这个工具,谷歌还算比较友好,有token,有网络就可以用,claude code目前是个很严格,而且这家公司也对国内用户很不友好 所以就研究了下怎么把它对接上国内的模型 幸好之前deepseek发布v3.1的时候天然给了支持
上次是文字型的,这次我们来写点代码试试,看看效果怎么样 首先肯定是比较简单的尝试开始 写一个todo应用,主要是看能不能零改动就跑起来 用最简单的提示词 然后就给出了代码
本文拆解 GPT-OSS 20B/120B 的 MoE、稀疏注意力、GQA 与 RoPE 架构,并记录 18GB 内存 MacBook Pro 通过 Ollama 运行 20B 模型的资源占用和实际表现。
上周被spring-ai调用模型api这个折腾的有点难受,这周又试了下用deepseek官方的api,但结果还是一样,不确定是啥原因,请求会一直卡着 后来想着本地有ollama,那是不是可以直接用ollama来调本地模型 这里我们用一个非常基础很小的模型 然后对应的配置是 当然…