LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing
By Wen Zan, Jiaqi Zhang, Jianchao Tan, Hong Liu, Cunguang Wang, Xiang Li, Duyue Ma, Guanyu Wu, Yifan Lu, Fengcun Li, Yerui Sun, Peng Pei, Yuchen Xie, Xunliang Cai
LongCat Sparse Attention is a hardware-algorithm co-designed framework that integrates streaming-aware, cross-layer, and hierarchical indexing to speed up sparse attention for LLMs. It achieves significant speedups for million-token contexts while maintaining model quality.