KTransformers

DeepSeek V4 Flash Docker 快速部署

KTransformers 提供预构建的 DeepSeek V4 Flash Docker 镜像。用户无需克隆仓库、编译代码或手动替换特定依赖版本;只需在配有相关驱动的机器下载镜像,即可一键启动服务。

前置条件

  • 已下载 DeepSeek V4 Flash 模型文件。
  • 机器已安装 NVIDIA 驱动、Docker 与 NVIDIA Container Toolkit。
  • 系统内存不少于 200 GB。
  • CPU 支持 AVX2 或 AVX-512 指令集。

拉取 Docker 镜像

拉取镜像,标签需对齐 Docker Hub 上 approachingai/ktransformers 仓库的 DSV4-specific

sudo docker pull approachingai/ktransformers:DSV4-specific

启动服务

下载模型后进入模型目录:

cd /path/to/DeepSeek-V4-Flash-0731

执行以下命令启动服务:

sudo docker run --gpus all \
  --ipc host \
  --cap-add SYS_NICE \
  -p 30000:30000 \
  -v "$PWD":/model:ro \
  approachingai/ktransformers:DSV4-specific

服务将在 http://localhost:30000 启动,并提供 OpenAI 兼容接口。

验证接口

服务日志出现就绪信息后,可用以下命令确认接口可达:

curl http://localhost:30000/v1/models

更多调优

如果需要了解更加详细的调优方式,比如开启 layerwise prefill 提升预填充速度,或是希望从本地编译源码部署,参见 KTransformers tutorial