RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably
By Yufeng Du, Phillip Harris, Minyang Tian, Eliu A Huerta, Srikanth Ronanki, Subendhu Rongali, Aram Galstyan, Hao Peng
As first covered in Research yesterday, Proves that RoPE (Rotary Positional Embeddings) loses both locality bias and token relevance consistency as context length increases, with failure probability approaching 0.5 (random chance). Provides theoretical explanation for long-context degradation.