DeepSeek V4 Flash Docker 快速部署
KTransformers 提供预构建的 DeepSeek V4 Flash Docker 镜像。用户无需克隆仓库、编译代码或手动替换特定依赖版本;只需在配有相关驱动的机器下载镜像,即可一键启动服务。
前置条件
- 已下载 DeepSeek V4 Flash 模型文件。
- 机器已安装 NVIDIA 驱动、Docker 与 NVIDIA Container Toolkit。
- 系统内存不少于 200 GB。
- CPU 支持 AVX2 或 AVX-512 指令集。
拉取 Docker 镜像
拉取镜像,标签需对齐 Docker Hub 上 approachingai/ktransformers 仓库的 DSV4-specific:
sudo docker pull approachingai/ktransformers:DSV4-specific
启动服务
下载模型后进入模型目录:
cd /path/to/DeepSeek-V4-Flash-0731
执行以下命令启动服务:
sudo docker run --gpus all \
--ipc host \
--cap-add SYS_NICE \
-p 30000:30000 \
-v "$PWD":/model:ro \
approachingai/ktransformers:DSV4-specific
服务将在 http://localhost:30000 启动,并提供 OpenAI 兼容接口。
验证接口
服务日志出现就绪信息后,可用以下命令确认接口可达:
curl http://localhost:30000/v1/models
更多调优
如果需要了解更加详细的调优方式,比如开启 layerwise prefill 提升预填充速度,或是希望从本地编译源码部署,参见 KTransformers tutorial。