论文研究 ·
DPS双模式LLM服务方案提升内存利用率
DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory
75进行中1 条HF Daily Papers
AI 解读
AI 生成推荐理由可直接降低大模型推理服务的硬件成本,实用性强。
DPS系统把LLM权重内存变为弹性资源,大幅提升服务吞吐量且不损失精度
发生了什么
研究团队针对现有LLM服务系统固定占用模型权重内存、动态管理KV缓存的设计局限,基于半统一内存机制推出DPS双精度服务系统:正常负载下跑全精度FP16模型,当KV缓存出现负载尖峰、显存不足时,自动切换到嵌套低精度权重变体,把原本闲置的权重显存挪作KV缓存块使用。该系统基于vLLM开发,在密集模型、MoE模型和生产流量 traces 上测试,较静态FP16部署 sustained 吞吐量提升2.1-3.3倍,有效pass@1最高提升41个百分点,同时保持FP16级精度。
关键信息
- 系统名称
- DPS
- 适配底座
- vLLM
- 吞吐量提升幅度
- 2.1-3.3倍
- 有效pass@1最高提升
- 41个百分点
- 核心技术
- 半统一内存双精度切换
背景
现有主流LLM服务系统普遍对KV缓存做虚拟化和内存优化,但始终将模型权重内存视为运行期固定资源,面对突增流量时往往因为KV缓存空间不足出现吞吐量下降、无法满足服务等级目标的问题。
为什么重要
对推理服务厂商而言,该方案无需额外扩容显存就能显著扛住突发流量、降低单请求推理成本;对开发者而言,它兼容现有vLLM生态和分页KV缓存管理机制,迁移成本低;对普通用户而言,大模型服务在高峰期的响应延迟会明显下降。
后续看点
后续将观察该双精度弹性内存思路能否被vLLM等主流推理框架正式合入,进一步在生产集群中验证长期稳定性。
由 AI 根据原文生成,可能有疏漏,以原文为准。