固件更新中 12小时前
vLLM v0.28.0发布:Kimi-K3与DeepSeek V4专项优化
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

vLLM v0.28.0 正式发布

vLLM 项目发布 v0.28.0 版本,本次更新包含来自 270 位贡献者的 584 次提交,其中 76 位为新贡献者。版本重点围绕 Kimi-K3 与 DeepSeek V4 两款模型展开优化,同时推进投机解码、模型运行器 V2、分层 KV 缓存卸载以及 Rust 前端与 gRPC 等多项能力。

Kimi-K3 性能专项优化

Kimi-K3 在本版本中获得跨栈优化,覆盖多项关键技术路径。解码上下文并行(DCP)支持已合入,FlashKDA 解码与预填充内核完成融合,MegaMoE 获得 SiTU 激活支持,序列并行引入 GEMM-RS。通信层面,合并后的全收集操作带来 1.5 至 3 倍的内核级加速。投机解码方面,自适应投机令牌预算使 DSpark TTFT 改善约 60%。可选的共享专家分片可为每块 GPU 节省约 17 GiB 显存。Kimi-K3 现已在 ROCm 上通过 V2 模型运行器运行。

DeepSeek V4 稀疏 MLA 端到端可用

DeepSeek V4 的稀疏 MLA 现已支持普通解码、MTP 与 DSpark 投机解码的端到端运行。AMD Quark NVFP4 支持同步加入,推理强度提示与映射、稀疏 top-k 元数据内核优化、eager CUDA 图区域收窄均已落地。ROCm 支持覆盖 gfx11 与 gfx950 平台。

投机解码与模型运行器 V2 进展

投机解码新增 DFlash2,具备局部卷积与候选选择器;DSpark 引入置信度调度验证;草稿模型异步调度默认启用。模型运行器 V2 进一步成熟,支持 E/P/D 分解、权重卸载、多层 MTP KV 缓存、编码器 CUDA 图、解码器逐令牌池化及 Transformers 池化模型,并新增无注意力模型与 thinking_token_budget 支持。

分层 KV 缓存卸载与 Rust 前端

分层 KV 缓存卸载新增磁盘卸载支持,允许通过 module_path 接入树外二级层管理器,支持部分二级层加载结果与分层指标,并提供并行无关卸载的规范 CPU 布局。Rust 前端与 gRPC 方面,独立渲染器、gRPC 多模态图像推理、显式数据并行 rank 路由与 RL 生命周期控制均已加入,protobuf 模式已发布至 Buf。

默认值与破坏性变更

默认配置出现调整:max_num_batched_tokens 从 8192 提升至 16384,Mamba 模型默认启用前缀缓存,Blackwell CUDA 图捕获默认值提升至 1024。破坏性变更包括:bitsandbytes 支持迁移至树外插件,Transformers 升级至 5.15.0,已弃用的 calculate_kv_scales 运行时 KV 缩放计算被移除,override_attention_dtype 被移除。

发布产物与模型支持

预构建发布产物位于页面底部 Assets 区域,包含源码分发包、CUDA 12.9 与 CUDA 13.0 的 x86_64 及 arm64 Python wheel、CPU 平台 x86_64、arm64 与 macOS 的 Python wheel。模型支持新增 Muse Glimmer,以及 Ling 3.0 Flash,后者支持 BF16、MTP 与解析器,并附带 FP8 变体。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

gpu
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论