小红书开源的 RedKnot 推理引擎通过将 KV Cache 按注意力头维度拆解,并结合头分类稀疏与 SegPagedAttention 机制,在长文本处理上实现了显著的 TTFT 加速与并发提升,为大模型推理优化提供了新思路。


来源:公众号:小红书技术(dots.llm)|原文链接