DeepSeek V4 Flash 正式版开源,KT 原生支持
一、总览
DeepSeek V4 Flash 正式版现已正式开源。其模型结构与此前发布的版本保持一致,KTransformers(KT)提供原生无损支持,精度完全对齐。用户下载模型即可直接运行。
二、性能表现
借助消费级 GPU 与 CPU,用户即可流畅体验前沿大模型能力。实测在双卡 RTX 5090 与支持 AVX512 指令集的 CPU 上,KT 可实现 300+ tok/s 的预填充速度,开启 layerwise prefill 后,预填充速度可达 1000+ tok/s。同时解码速度可达 30+ tok/s。
详情请参考 KTransformers 性能测试。
三、支持硬件
目前,KT 已覆盖主流消费级硬件平台:
- 支持 NVIDIA GeForce RTX 30、40、50 系列显卡
- 支持 AVX2、AVX-512 指令集
- 支持单卡与多卡配置
运行需要配备不少于 200 GB 的系统内存。
四、快速部署
为降低部署门槛,KT 提供预构建的 DeepSeek V4 Flash Docker 镜像。用户无需克隆仓库、编译代码或手动替换特定依赖版本;只需在配有相关驱动的机器下载镜像,即可一键启动服务。
4.1 拉取 Docker 镜像
拉取镜像,标签需对齐 Docker Hub 上 approachingai/ktransformers 仓库的 DSV4-specific:
sudo docker pull approachingai/ktransformers:DSV4-specific
4.2 启动服务
下载模型后进入模型目录:
cd /path/to/DeepSeek-V4-Flash-0731
执行以下命令启动服务:
sudo docker run --gpus all \
--ipc host \
--cap-add SYS_NICE \
-p 30000:30000 \
-v "$PWD":/model:ro \
approachingai/ktransformers:DSV4-specific
服务将在 http://localhost:30000 启动,并提供 OpenAI 兼容接口。服务日志出现就绪信息后,可用以下命令确认接口可达:
curl http://localhost:30000/v1/models
如果需要了解更加详细的调优方式(比如开启 layerwise prefill 提升预填充速度等),或是希望从本地编译源码部署,参见 KTransformers tutorial。
