导语:DeepSeek 于 9 月 10 日正式开源 V4.1 Flash 模型(552B 总参数 / 16B 激活),社区随即推出可在两台 NVIDIA DGX Spark 上本地运行的 EXL3 量化方案,60 万上下文与 50 tok/s 的推理速度,让”私有大模型”部署门槛再次下移。
模型发布:V4.1 Flash 是什么
DeepSeek 于 2026 年 9 月 10 日正式发布 V4.1 Flash,定位为”高效旗舰”系列的开源升级。模型本体为 552B 总参数的混合专家(MoE)架构,其中输入阶段激活 8B 参数、生成阶段激活 16B 参数;原生上下文窗口达到 1M token,并原生支持图像理解的多模态能力。开源协议延续 MIT,意味着模型权重、推理代码均可商用。
API 端定价参照 V4 Flash 同档,输入 $0.30 / 百万 tokens,与上一代基本持平。Hugging Face 上的官方仓库为 deepseek-ai/DeepSeek-V4.1-Flash,发布即同步上线。
本地部署方案:MiaAI-Lab 的 2× DGX Spark 套件
推文(@0x0SojalSec)所转述的方案来自 MiaAI-Lab 在 GitHub 开源的 DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks。整套方案的核心要素如下:
- 硬件:2× NVIDIA DGX Spark(GB10 工作站,单机 128 GiB unified memory)
- 互联:两台机器通过 CX7 做 tensor-parallel size 2 张量并行
- 量化:EXL3 2.9 bpw / mul1(基于 turboderp-org/exllamav3 路径),模型总体积 196 GiB,39 个分片
- 推理引擎:vLLM 0.1.dev20904 + 镜像
vllm-openai:deepseekv41-flash-0909 - 服务接口:OpenAI 兼容 API,端口 8888,模型名
DeepSeek-v4.1-Flash-EXL3

实测性能:60 万上下文与 50 tok/s
根据 @MiaAI_lab 与 @0x0SojalSec 公开的实测数据:
- 生成速度:约 50 tok/s(单流 prose 输出)
- 预填速度:约 849 tok/s(8k-128k 上下文),256k 上下文仍可达 872 tok/s
- 上下文上限:MAX_MODEL_LEN = 614,400(约 60 万 token)
- KV 缓存池:774,400 token 容量,每节点 2.5 GiB
- 并发能力:默认 MAX_NUM_SEQS = 2,双流并发可达 ~42 tok/s
需要更长上下文的用户可以参照 tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Spark 的 4× DGX Spark TP4 配置,已通过 100 万 token 的”针在草堆里”测试。
配套技术细节
- 架构特征:CED 20+20(20 层编码器 + 20 层解码器)、CSA2 注意力、Engram 表层(位于第 1 与第 14 层)、视觉塔、原生 DSpark 投机解码
- 采样默认:temperature=1.0、top_p=0.95、reasoning_effort 默认 high(=75)
- 投机解码:DSPARK,k=3(num_speculative_tokens=3),dspark_block_size=5
- 每节点 128 GiB 内存分配:EXL3 权重每 rank 99.5 GiB、KV pool 2.5 GiB、系统与 CUDA 上下文约 14-16 GiB、可用余量约 4 GiB
- 看护机制:脚本
scripts/memguard.sh默认关闭,设置DSV41_MEM_GUARD=1后会在可用内存连续两次低于 1.5 GiB 时自动重启容器(用于避免 GB10 上 RSS 统计不到显存占用的 OOM 场景)
安全意义:模型本地化对数据合规的价值
对关注数据合规与信息安全的团队而言,”模型自托管”的价值往往比”模型性能本身”更值得关注:
- 数据不出本地:医疗、法律、金融、政务等敏感行业可以在自有网络内运行 LLM,对话内容全程不离开本机
- API 供应链风险降低:避免 API key 泄露、计费异常、依赖方服务中断带来的连带影响
- 合规审计可闭环:所有推理都在自家机柜里完成,便于满足等保、GDPR、行业监管的审计要求
- 网络隔离环境可用:在完全断网的环境下也能跑(DeepSeek-V4.1-Flash 的权重可从 Hugging Face 镜像下载到本地)
- 国产开源可控:MIT 协议 + 中国团队开发,自主可控程度高于闭源模型

硬件门槛:要花多少钱
- DGX Spark 单机定价约 3,500 美元(GB10 芯片,128 GiB unified memory)
- 双机方案总价约 7,000 美元,约合人民币 5 万元
- 相比长期调用云 API(按 $0.30 / 百万 tokens 计算,60 万上下文单次请求约 $0.18),如果每天有几万次请求,长期使用可在 1-2 年内摊薄硬件成本
- GB10 单机功耗约 600W,双机持续运行需要考虑机房散热与电力容量
局限与注意事项
- 上下文非满血 1M:当前 2× 配置上限 60 万,更长的 1M 上下文需要 4× DGX Spark TP4
- 性能弱于云端 API:vLLM + EXL3 的 50 tok/s 与官方 API 通常的 100+ tok/s 有差距,长上下文与高并发场景下尤为明显
- 量化精度:2.9 bpw 是较高压缩率,极端长尾场景下建议做能力回归测试
- 内存余量紧:可用余量仅约 4 GiB,长 prefill 时会被进一步压缩,建议启用 memguard
- 电源与散热:双 GB10 持续推理的功耗与噪音不可忽视,不适合放在普通办公环境
适用场景建议
- 企业内部知识库问答(RAG 架构 + 私域文档,数据全程不出公司)
- 代码助手本地化(敏感代码不上云,审计与合规可控)
- 法律 / 医疗文档分析(行业合规要求高的场景)
- 网络隔离环境下的 AI 助手(军工、政企内网、研发涉密环境)
- 科研机构本地实验(可调原型可控,避免 API 调用记录留痕)
生态与社区
- 官方权重:
deepseek-ai/DeepSeek-V4.1-Flash(Hugging Face) - 社区量化:
0xSero/deepseek-v4-flash-0731-spark、bot-lab-21/DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard - 不同规模方案:
MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark(单机)、MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks(双机)、tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Spark(四机 TP4) - EXL3 路径:turboderp-org/exllamav3,RTX 6K Discord 社区(Brandon 等贡献者)
- 相关讨论:NVIDIA Developer Forums 已出现”DeepSeek v4.1 Flash on DGX Spark / GB10″专题帖,NVIDIA GB10 的 sm_121a 原生 cubins 让 EXL3 推理无需额外 PTX 兼容层
版权声明:本文由华盟网原创发布,保留所有权利。配图由华盟网授权使用。














暂无评论内容