本地跑 Llama4 不用专门租云算力,Windows 电脑搭配独显就能搞定,只是安装步骤细碎,稍有疏忽就会直接报错。
先核对电脑硬件,别装到一半才发现带不动
好多人兴冲冲下载一堆安装包,最后启动模型弹出显存不足,白白浪费大半天下载时间。我身边不少新手都踩过这个毫无技术含量的坑。
想流畅运行量化版 Llama4,显卡是硬性门槛。6G 显存笔记本勉强能跑极小参数量版本,但加载卡顿、频繁闪退,体验完全没法用;8G 显存设备只能轻度测试,不适合长时间对话推理。12G 显存的游戏卡刚好够用,4bit 量化后的小参数量版本能稳定推理;如果手里是 24G 显存的高端显卡,34B 规模的 Llama4 也能本地顺畅跑起来。
除了显卡,硬盘空间也得预留充足。完整模型文件、各类运行依赖、Python 环境打包文件加起来,至少腾出 50G 存储空间,固态盘优先,机械硬盘读取模型会卡顿严重。要是打算把模型缓存存在 C 盘,一定要确认系统盘剩余空间充足。
CPU 和内存不用过分纠结,普通酷睿、锐龙处理器都能兼容,内存 16G 是底线,32G 能大幅缓解加载模型时的内存占用峰值。
Windows 前置依赖,一次性配齐避免后续报错
Windows 原生环境没法直接运行大模型,底层工具链缺一个都不行,我整理了一套反复调试过的安装顺序,照着来很少出问题。
第一件事,安装英伟达显卡驱动和 CUDA 工具。别直接去第三方网站下精简版,官网完整包兼容性最好。安装完成后打开命令行输入 nvidia-smi,能弹出显卡信息才算安装成功,没显示内容的话,后面所有模型加载操作都会失效。
然后是 Python 运行环境,推荐 3.10 版本,过高或过低的版本容易和 transformers、bitsandbytes 库冲突。安装的时候记得勾选添加到系统环境变量,很多人忽略这一步,打开 cmd 输入 python 提示不是内部命令,来回折腾很久。
Git 工具也得装上,后续要拉取开源推理框架、模型仓库代码,没有 Git 只能手动下载压缩包,更新框架的时候会麻烦很多。
还有个容易被忽略的小工具,7-Zip 解压软件。部分模型分卷压缩包,Windows 自带解压工具会出现文件损坏报错,第三方解压工具稳定得多。
选择适配 Windows 的推理工具,新手优先 Ollama
跑 Llama4 的 Windows 工具不少,各有优劣,试过几款之后,我更愿意推荐新手直接用 Ollama。
它省去复杂的环境配置,不用手动处理量化、权重合并,一行命令就能拉取并启动模型,对不懂代码的开发者友好度拉满。唯一小小的缺点是自定义微调 LoRA 权重会麻烦一点,纯本地推理场景完全够用。
如果你后续有微调、二次训练的需求,这里要多说一句,新版 bitsandbytes 虽然提供 Windows 原生支持,但编译安装步骤繁琐,训练时 GPU 加速经常失效,稳定性很差。想要顺畅跑 QLoRA 训练,WSL2 依旧是更稳妥的选择,初次配置会多花十几分钟。
还有 llama.cpp 这类轻量化工具,极致追求低显存占用的人可以选,命令行操作偏多,上手门槛会高一些。
Ollama 完整安装流程,一步步落地本地 Llama4
打开 Ollama 官网下载 Windows 安装程序,双击一路默认安装就行。默认安装路径和模型缓存目录会放在 C 盘,空间紧张的电脑建议提前修改环境变量,把模型缓存转移到其他大容量磁盘,避免系统盘被占满。
安装结束后重启终端窗口,直接输入 ollama run llama4,程序会自动校验你的显卡配置,在线拉取对应量化版本的模型文件。网络波动大的时候下载会中断,重新执行命令就能续传,不用删掉已下载文件重来。国内下载速度慢可以配置镜像节点,能大幅缩短等待时间。
下载完成会自动进入对话交互界面,你可以直接输入问题测试模型输出。要是觉得默认模型精度不够,还能指定参数版本,比如 llama4:70b、llama4:13b,按需切换。
不想用命令行交互的话,本地搭一个简单 WebUI 前端也很简单,拉取开源前端仓库,修改配置文件对接 Ollama 本地接口,浏览器打开页面就能可视化对话,日常使用体验提升不少。
WSL2 环境搭建,适配 Llama4 微调需求
单纯推理用 Ollama 足够,可一旦涉及数据集处理、模型微调,即便原生 Windows 能装上量化库,训练过程也容易出现各类兼容报错,WSL2 是业内主流稳定方案。
在系统设置里开启虚拟机平台、适用于 Linux 的 Windows 子系统两项功能,重启电脑后去微软商店安装 Ubuntu 发行版。初始化子系统时设置用户名和密码,别设置过于简单的字符,后续安装依赖会有权限校验。
子系统内部单独安装一份 Python、CUDA,和 Windows 主机环境互不干扰。安装完英伟达 WSL 专属驱动,才能让子系统识别到主机独显,否则训练只能跑 CPU,速度慢到无法接受。
把存放模型、数据集的 Windows 文件夹挂载到 Ubuntu 内,不用重复复制大体积模型文件,节省大量硬盘空间。只是挂载目录读写速度比不上子系统本地磁盘,加载超大模型时会轻微拖慢速度。所有训练、加载命令都在子系统终端执行,量化、LoRA 训练代码不会再报底层兼容错误。
模型文件手动部署方案,离线无网环境适用
部分企业内网环境不能联网下载模型,只能手动获取 Llama4 权重文件。
有网络的设备上可以借助国内 Hugging Face 镜像站点下载完整模型权重,分卷压缩后转移到 Windows 主机。解压时核对每一个分片文件完整性,缺失任意一个分片都会导致模型加载失败。
如果用 llama.cpp 运行,需要把原始模型转换成 GGUF 量化格式,转换脚本在 Windows 终端也能执行,转换完成后得到轻量化模型文件,显存占用会大幅下降。
本地离线启动时,修改工具配置文件内的模型本地路径,关闭自动联网校验选项,就能脱离网络完成推理对话。离线模式下没法更新模型权重,想切换版本只能手动替换文件。
安装高频故障,快速自查解决办法
绝大多数安装失败,根源都集中在几个固定问题上,不用漫无目的地全网搜索解决方案。
输入命令提示 cuda 不可用,优先检查显卡驱动版本、WSL 驱动是否配套,老旧显卡不支持新版 CUDA,只能降级工具版本。
模型加载中途闪退、显存溢出,要么是显卡显存不够,要么是没选用 4bit 量化模型,切换更小参数量版本就能缓解。
Ollama 下载模型速度极慢,可以手动替换镜像源,修改配置文件内的下载地址,国内镜像节点拉取文件速度会提升数倍。
WSL 子系统无法识别显卡,多半是没安装 WSL 专用驱动,主机驱动和子系统驱动不能混用,分开安装才能正常调用 GPU 算力。
安装完成后的简单优化,提升 Llama4 运行体验
全部部署完成后,花几分钟调整参数,本地运行流畅度能上一个台阶。
推理上下文窗口根据显存大小设置,12G 显卡建议限制 4k 上下文,开大窗口会持续占用显存,容易触发崩溃。关闭后台多余软件,释放系统内存,加载大模型时内存占用峰值会降低。
不用一直保留完整高精度模型文件,日常使用只留存 INT4 量化版本,节省几十 G 硬盘空间。偶尔需要高精度输出时,再临时下载 INT8 完整权重。
有长期使用需求的话,创建桌面快捷命令,不用每次打开终端输入一长串启动代码,随手就能唤起 Llama4 对话窗口。
一套完整 Windows 端 Llama4 安装流程走完,不用依赖云服务器,普通家用电脑就能拥有专属本地大模型,数据全部存在本地,隐私性比线上 API 强得多。