
维度 | DeepSeek V4-Pro | DeepSeek V4-Flash |
|---|---|---|
总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
激活参数量 | 490 亿(49B) | 130 亿(13B) |
模型架构 | MoE(混合专家) | MoE(混合专家) |
上下文窗口 | 100 万 Token | 100 万 Token |
许可证 | MIT(完全开源) | MIT(完全开源) |
权重地址 | Hugging Face | Hugging Face |
API 接口 | OpenAI / Anthropic 兼容 | OpenAI / Anthropic 兼容 |
发布状态 | 预览版已上线(2026.4.24) | 预览版已上线(2026.4.24) |
正式版 | 2026 年 7 月中旬上线 | 2026 年 7 月中旬上线 |
模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
V4-Pro | ¥0.05 / 百万 Token | ¥6 / 百万 Token | ¥12 / 百万 Token |
V4-Flash | ¥0.04 / 百万 Token | ¥2 / 百万 Token | ¥4 / 百万 Token |
模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
V4-Pro | ¥0.025 / 百万 Token | ¥3 / 百万 Token | ¥6 / 百万 Token |
V4-Flash | ¥0.02 / 百万 Token | ¥1 / 百万 Token | ¥2 / 百万 Token |
模型版本 | 最低显存 | 推荐显存 | 推荐显卡 | 生成速度参考 | 适用场景 |
|---|---|---|---|---|---|
V4-Flash(284B) | 约 40GB | 80GB+ | A100 40GB ×2 或 H100 | 较快 | 企业级 / 高并发 |
V4-Pro(1.6T) | 约 80GB | 160GB+ | A100 80GB ×2 或 H100 ×2 | 中等 | 追求最强性能 |
DeepSeek R1 70B | 40GB | 80GB+ | A100 或双卡 4090 | 中等 | 企业 / 高需求用户 |
DeepSeek R1 32B | 24GB | 32GB | RTX 4090 / A6000 | 较快 | 进阶用户 |
DeepSeek R1 14B | 10GB | 16GB | RTX 4060 Ti / 3090 | 快 | 普通开发者 |
DeepSeek R1 8B | 6GB | 8GB | RTX 3060 / 4060 | 较快 | 入门用户 |
DeepSeek R1 7B | 6GB | 8GB | RTX 3060 | 快 | 新手入门 |
DeepSeek R1 1.5B | 4GB | 6GB | GTX 1080 / CPU 可运行 | 一般 | CPU 备用方案 |
方案 | 推荐指数 | 适合人群 | 优点 | 缺点 | 难度 |
|---|---|---|---|---|---|
Ollama | ⭐⭐⭐⭐⭐ | 新手 / 全平台用户 | 安装简单,一条命令跑起来,支持 Win/Mac/Linux | 性能非最优,吞吐量有限 | ⭐(极简单) |
LM Studio | ⭐⭐⭐⭐ | 普通用户 / 不想用命令行的用户 | 图形界面直观,本地模型管理方便 | 跨平台不如 Ollama | ⭐(简单) |
vLLM | ⭐⭐⭐⭐ | 企业 / 生产环境 / 多用户并发 | 性能最优,吞吐量比 Ollama 高 3-5 倍 | 配置复杂,需命令行操作 | ⭐⭐⭐⭐(较复杂) |
ollama.comWin+R,输入 cmd,输入 ollama -v,显示版本号即成功ollama.com,下载 macOS 版本ollama -v 验证# 下载 DeepSeek R1 7B 模型(约 4.7GB)ollama run deepseek-r1:7b# 下载 DeepSeek R1 8B 模型ollama run deepseek-r1:8b# 下载 DeepSeek R1 14B 模型(需 16GB 显存)ollama run deepseek-r1:14b# 下载 DeepSeek R1 32B 模型(需 32GB 显存)ollama run deepseek-r1:32b# 下载 DeepSeek R1 70B 模型(需 80GB+ 显存)ollama run deepseek-r1:70b# 下载 DeepSeek V4-Flash(量化版,Hugging Face 权重)# 关注 Ollama 社区镜像更新,或通过 huggingface-cli 下载后转换ollama run deepseek-ai/deepseek-v4-flashollama listchatboxai.comhttp://localhost:11434# 安装 Open WebUIpip install open-webui# 启动服务open-webui serve# 浏览器访问 http://localhost:8080# 首次使用需注册,之后即可在 Web 界面中使用lmstudio.ai显卡配置 | 推荐版本 | 生成速度参考 |
|---|---|---|
RTX 3060 / 4060(8GB) | 7B / 8B | 5-8 字/秒 |
RTX 3090 / 4090(24GB) | 14B / 32B | 10-20 字/秒 |
专业 GPU(40GB+) | 70B 或 V4-Flash 量化版 | 20+ 字/秒 |
# 安装 vLLM(需要 Python 环境)pip install vllm# 或通过源码安装(获取最新功能)git clone https://github.com/vllm-project/vllm.gitcd vllmpip install -e .# 安装 huggingface-clipip install huggingface_hub# 登录 Hugging Face(需申请 DeepSeek 模型访问权限)huggingface-cli login# 下载 DeepSeek V4-Flash 权重huggingface-cli download deepseek-ai/DeepSeek-V4-Flash# 下载 DeepSeek V4-Pro 权重huggingface-cli download deepseek-ai/DeepSeek-V4-Pro# 启动 DeepSeek V4-Flash(INT4 量化版)python -m vllm.entrypoints.openai.api_server \ --model deepseek-ai/DeepSeek-V4-Flash \ --tensor-parallel-size 1 \ --quantization awq \ --max-model-len 131072# 多卡部署(两张 A100 80GB)# python -m vllm.entrypoints.openai.api_server \# --model deepseek-ai/DeepSeek-V4-Flash \# --tensor-parallel-size 2 \# --quantization awq \# --max-model-len 131072http://localhost:8000 访问 OpenAI 兼容 API。curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "deepseek-ai/DeepSeek-V4-Flash", "messages": [ {"role": "system", "content": "你是一个专业助手"}, {"role": "user", "content": "用 Python 写一个快速排序算法"} ], "max_tokens": 512 }'Win+R → 输入 dxdiag → 查看显卡型号和显存大小:ollama.comWin+R → 输入 cmd → 打开命令提示符ollama run deepseek-r1:7bchatboxai.comhttp://localhost:11434deepseek-r1:7b# 通过 Homebrew 安装brew install ollama# 或访问 ollama.com 下载安装包# M1 Mac 推荐:DeepSeek R1 7Bollama run deepseek-r1:7b# M1 Pro/Max/Ultra 或统一内存 32GB+:可尝试 14Bollama run deepseek-r1:14b# 安装 Page Assist(Chrome 扩展)# 或安装 Open WebUIpip install open-webuiopen-webui serve# 浏览器访问 http://localhost:8080常见问题 | 原因 | 解决方案 |
|---|---|---|
下载模型卡在 0% 或速度极慢 | 网络问题或 Hugging Face 限速 | 使用代理;Ollama 国内镜像;或分时段下载 |
显存不足(OOM) | 模型太大超出显存 | 降低量化精度(FP16→INT8→INT4);减小上下文长度 |
Ollama 下载的模型占用 C 盘 | 未设置自定义路径 | 设置 OLLAMA_MODELS 环境变量指向其他盘 |
生成速度慢(每秒不到 5 字) | 量化精度过高或无 GPU 加速 | 使用 INT4 量化版;确认 CUDA 驱动已安装 |
LM Studio 加载模型后闪退 | 显存估算不足 | 降低 GPU 加载比例;关闭其他占用显存的程序 |
vLLM 启动报错 CUDA 版本不兼容 | CUDA 版本过低 | 升级 NVIDIA 驱动;安装匹配版本的 CUDA Toolkit |
V4 权重下载后转换失败 | 部分格式需要额外转换工具 | 使用 llm-export 或 huggingface 上的转换脚本 |
Chatbox 连接 Ollama 失败 | Ollama 服务未启动或端口错误 | 确认 Ollama 正在运行;API 地址填写 http://localhost:11434 |
对比维度 | DeepSeek V4-Pro | DeepSeek R1 | Llama 4 | Qwen 3 |
|---|---|---|---|---|
开源状态 | ✅ MIT 完全开源 | ✅ MIT 完全开源 | 部分开源 | ✅ 开源 |
本地部署难度 | ⭐⭐⭐⭐⭐(门槛高) | ⭐⭐(简单) | ⭐⭐⭐(中等) | ⭐⭐(简单) |
最低显存需求 | 80GB+(全精度) | 6GB(7B量化) | 24GB+ | 6GB+ |
上下文窗口 | 100 万 Token | 128K Token | 100 万 Token | 100 万 Token |
推理能力 | 对标 GPT-4o | 强(推理模型) | 强 | 强 |
中文优化 | ✅ 原生中文优化 | ✅ 中文能力强 | 一般 | ✅ 原生中文优化 |