最新消息:关注人工智能 AI赋能新媒体运营

小红书联合北大、上交推出HYPIC:混合注意力大模型首token延迟降至1/3.25

科技资讯 admin 浏览

小红书联合北大、上交发布HYPIC:首次为混合注意力大模型实现位置无关缓存

大模型服务的主战场正在转移。检索增强问答、多文档摘要和长程Agent等新场景下,一条请求的prompt往往由几十到上百个语义独立的片段拼接而成,检索到的文档、技能说明、记忆文件、历史轮次被组装成数万乃至数十万token的超长上下文。在这个长度下,预填充(prefill)阶段主导了单请求的算力开销,成为服务商最显眼的成本来源;更棘手的是,一旦发生缓存未命中,尾部首token延迟(TTFT)能冲到数十秒,直接砸坏交互体验。

业界为此发展出两条降本路线。一条是位置无关缓存(PIC),它放开严格的前缀约束,让每个语义独立的片段只缓存一次、并能拼接到任意前缀之后,刚好贴合RAG与Agent的prompt组装方式。另一条是混合注意力模型,用线性注意力替换大部分全注意力层,把注意力的二次复杂度压到线性,并将无界的历史压缩成固定大小的循环状态。近来的生产模型如MiniMax-M1、Ring-2.5、Qwen3.5、Kimi-Linear,普遍把75%以上的层线性化、保留少量全注意力层,形成混合注意力的主流设计。

矛盾恰恰出在这里:现有PIC操作的是逐token的KV缓存,而线性注意力层只向外暴露一个per-request的循环状态,没有任何逐token的抓手可供拼接或修正。结果是,混合模型里的大部分层都落在了现有PIC的能力范围之外。在此之前,没有任何系统能为混合注意力大模型提供位置无关缓存。

HYPIC系统架构示意图

小红书大模型推理团队联合北京大学、上海交通大学提出的HYPIC,是首个在混合注意力大模型上实现PIC的服务系统。它在4个生产级混合注意力模型、5个工作负载上的测试显示:首token延迟平均降低3.25倍,同SLO下可持续QPS提升1.66倍,而任务质量与完全重算仅相差1.71分。这套系统的核心思想,是对混合注意力模型里的线性层和全注意力层分而治之,再用一层系统级并行把冷请求也一并加速,由三个环环相扣的机制构成。

对线性层,HYPIC缓存的是"转移算子",实现常数时间的状态组合。最直接的PIC方案是把两段各自的零初值末状态直接相加——这在朴素线性注意力下恰好成立,但在带衰减、门控、delta擦除的进阶线性注意力下会失效。真正被漏掉的关键量是一个段累积转移算子T_C,即一段内所有token转移矩阵的连乘。HYPIC的关键洞察是,T_C和零初值末状态都只由片段内部的token决定、与前缀无关,因此它在片段首次prefill时把二元组一并缓存,复用时按组合律左乘T_C再相加,即可在常数时间内近乎精确地还原任意前缀下的末状态,且天然覆盖全部线性注意力家族。实测在Qwen3.5-35B-A3B上,组合后的状态与完全重算仅相差6×10??,落在FP16噪声之内。

对全注意力层,HYPIC用"缝合窗口"修复跨段注意力。混合模型中少数的全注意力层仍需要PIC,但以往的选择性重算无法直接迁移,因为下方的线性层只保留末状态,非末尾token无法向上穿过全注意力层。团队的观察是,KV拼接后的偏差高度集中在每个复用片段的开头,其余部分几乎不受影响。据此,HYPIC为每个内部片段开头w个token构造一个缝合窗口,缓存时这几个token不入缓存,复用时在完整前缀下重算以修复跨段注意力,默认w=8。由于实际片段长度通常大于512token,缝合窗口只占极小一部分,重算开销可控。

缝合窗口与段并行机制示意图

第三块拼图是段并行,它把"长冷请求"也变成了可加速的负载。缓存未命中不可避免,而长冷请求正是尾延迟的主因。现有系统仍把整条prompt当作一个整体、在单实例上串行prefill所有冷片段,TTFT随O(n·|C|)增长。但PIC已经让每个片段自包含——其prefill结果只由内部token决定。HYPIC顺势提出实例间的段并行:Router探测每段命中状态,把冷片段并行分发给多个scatter worker,再由一个combine worker把各段结果组装成完整运行状态,把冷prefill从O(n·|C|)降到O(?n/m?·|C|+c)。为了把这条路径跑满,HYPIC用LPT贪心策略均衡各worker负载,并把每段的计算与传输流水线重叠。

这套系统已在SGLang上实现,约14k行Python与Triton代码,在8×H20节点上完成评测。全量预热后,HYPIC相比Prefix Cache将p50 TTFT平均降低3.25倍(各模型2.77×至4.05×),而质量几乎无损——16个"模型×数据集"单元平均只落后完全重算1.71分,在Qwen3.5-35B上甚至反超0.47分;作为对照,不缓存转移算子的朴素相加直接损失了66.9%的分数。在生产RAG trace上,同1秒TTFT SLO下,HYPIC把可持续QPS相比Prefix Cache提升1.66倍,峰值单卡吞吐提升约1.3至1.5倍。在纯冷未命中路径上,一条32k token请求的TTFT从单worker的2.83秒降到8worker的0.49秒,达到5.7倍加速。

HYPIC首次把位置无关缓存带到了混合注意力大模型上:用缓存的段累积转移算子实现线性层的常数时间状态组合,用缝合窗口修复全注意力层的跨段对齐,再用段并行把长冷请求变成可加速的负载。它让RAG与Agent这类长上下文服务,在拥抱高效混合架构的同时,也能享受到片段级缓存复用的红利。团队表示,未来将进一步探索分布式的PIC管理与调度、多级缓存分层管理,推动大模型推理向更快、更省、更可扩展持续演进。