博客
DeepSeek V4 Flash 正式版开源,KT 原生支持

DeepSeek V4 Flash 正式版开源,KT 原生支持

发布于 2026-08-06 · KTransformers 开源社区原文语言:中文

DeepSeek V4 Flash 正式版开源,KT 原生支持

一、总览

DeepSeek V4 Flash 正式版现已正式开源。其模型结构与此前发布的版本保持一致,KTransformers(KT)提供原生无损支持,精度完全对齐。用户下载模型即可直接运行。

二、性能表现

借助消费级 GPU 与 CPU,用户即可流畅体验前沿大模型能力。实测在双卡 RTX 5090 与支持 AVX512 指令集的 CPU 上,KT 可实现 300+ tok/s 的预填充速度,开启 layerwise prefill 后,预填充速度可达 1000+ tok/s。同时解码速度可达 30+ tok/s。

详情请参考 KTransformers 性能测试

三、支持硬件

目前,KT 已覆盖主流消费级硬件平台:

  • 支持 NVIDIA GeForce RTX 30、40、50 系列显卡
  • 支持 AVX2、AVX-512 指令集
  • 支持单卡与多卡配置

运行需要配备不少于 200 GB 的系统内存。

四、快速部署

为降低部署门槛,KT 提供预构建的 DeepSeek V4 Flash Docker 镜像。用户无需克隆仓库、编译代码或手动替换特定依赖版本;只需在配有相关驱动的机器下载镜像,即可一键启动服务。

4.1 拉取 Docker 镜像

拉取镜像,标签需对齐 Docker Hub 上 approachingai/ktransformers 仓库的 DSV4-specific

sudo docker pull approachingai/ktransformers:DSV4-specific

4.2 启动服务

下载模型后进入模型目录:

cd /path/to/DeepSeek-V4-Flash-0731

执行以下命令启动服务:

sudo docker run --gpus all \
  --ipc host \
  --cap-add SYS_NICE \
  -p 30000:30000 \
  -v "$PWD":/model:ro \
  approachingai/ktransformers:DSV4-specific

服务将在 http://localhost:30000 启动,并提供 OpenAI 兼容接口。服务日志出现就绪信息后,可用以下命令确认接口可达:

curl http://localhost:30000/v1/models

如果需要了解更加详细的调优方式(比如开启 layerwise prefill 提升预填充速度等),或是希望从本地编译源码部署,参见 KTransformers tutorial