论文研究 ·

DPS双模式LLM服务方案提升内存利用率

DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory

75进行中1 条HF Daily Papers
DPS双模式LLM服务方案提升内存利用率
图片来自HF Daily Papers

AI 解读

AI 生成

推荐理由可直接降低大模型推理服务的硬件成本,实用性强。

DPS系统把LLM权重内存变为弹性资源,大幅提升服务吞吐量且不损失精度

发生了什么

研究团队针对现有LLM服务系统固定占用模型权重内存、动态管理KV缓存的设计局限,基于半统一内存机制推出DPS双精度服务系统:正常负载下跑全精度FP16模型,当KV缓存出现负载尖峰、显存不足时,自动切换到嵌套低精度权重变体,把原本闲置的权重显存挪作KV缓存块使用。该系统基于vLLM开发,在密集模型、MoE模型和生产流量 traces 上测试,较静态FP16部署 sustained 吞吐量提升2.1-3.3倍,有效pass@1最高提升41个百分点,同时保持FP16级精度。

关键信息

系统名称
DPS
适配底座
vLLM
吞吐量提升幅度
2.1-3.3倍
有效pass@1最高提升
41个百分点
核心技术
半统一内存双精度切换

背景

现有主流LLM服务系统普遍对KV缓存做虚拟化和内存优化,但始终将模型权重内存视为运行期固定资源,面对突增流量时往往因为KV缓存空间不足出现吞吐量下降、无法满足服务等级目标的问题。

为什么重要

对推理服务厂商而言,该方案无需额外扩容显存就能显著扛住突发流量、降低单请求推理成本;对开发者而言,它兼容现有vLLM生态和分页KV缓存管理机制,迁移成本低;对普通用户而言,大模型服务在高峰期的响应延迟会明显下降。

后续看点

后续将观察该双精度弹性内存思路能否被vLLM等主流推理框架正式合入,进一步在生产集群中验证长期稳定性。

由 AI 根据原文生成,可能有疏漏,以原文为准。

来源

  1. HF Daily Papers ↗DPS双模式LLM服务方案提升内存利用率DPS: Dual-Mode Precision LLM Serving with Semi-Unified Memory论文提出半统一内存架构的双精度LLM服务系统DPS,优化显存开销。
返回 AI 热点