在 WSL 里把 llama.cpp CUDA 版编译起来:一次真实的本地部署记录
在 Ubuntu 26.04 LTS + RTX 4060 Laptop GPU 的 WSL 环境里,不改系统目录,用 micromamba 准备 CUDA 12.4、GCC 13 和 cuBLAS,编译 llama.cpp CUDA 后端,并用 Qwen3 4B 做 CPU 与 CUDA 的速度对比。
共 7 篇文章
在 Ubuntu 26.04 LTS + RTX 4060 Laptop GPU 的 WSL 环境里,不改系统目录,用 micromamba 准备 CUDA 12.4、GCC 13 和 cuBLAS,编译 llama.cpp CUDA 后端,并用 Qwen3 4B 做 CPU 与 CUDA 的速度对比。
在一台 RTX 4060 Laptop 8GB 显存、WSL 分配 32GB 内存的本地开发机上,实测 Qwen3 4B、Qwen3 8B、Gemma 4 E4B、Gemma 4 12B 的加载时间、生成速度、显存占用、多模态能力和使用取舍。
本地开源模型真正有价值的地方,不是跑分,而是能否进入每天都会发生的任务。本文把 Qwen3 4B、Qwen3 8B、Gemma 4 E4B、Gemma 4 12B 放进开发辅助、图像理解、写作整理三个工作流里,整理一套能长期演进的本地模型用法。
这是一篇持续更新的本地开源模型安装记录。从一台 64GB 内存、WSL 分配 32GB、RTX 4060 Laptop 8GB 显存的 Windows + Ubuntu 26.04 LTS 开发机出发,先判断 Ollama 应该跑在 Windows 还是 WSL,再比较 llama.cpp、LM Studio、vLLM 等方案,最后整理适合本机长期使用的模型清单。
从一台带 NVIDIA 显卡的 Windows 开发机出发,讲清楚 WSL 里验证 CUDA、跑 PyTorch、部署本地模型、管理模型缓存和排查 GPU 没被用上的方法。
端侧 AI 不是云端大模型的缩小版。它关心的是延迟、功耗、隐私、缓存和产品边界,也需要开发者重新适应一套更贴近设备的工程约束。
在本地测试机上通过 Ollama 跑 gemma4:12b,先用三版分形树 prompt 测代码生成,再接入 OpenClaw + QVeris 做真实数据调用,复盘这个 12B 本地模型的可用性、速度和边界。