RBS-Attention: Radius-Bounded Sparse Prefill für Long-Context Large Language Models
· Quelle: arXiv cs.AI
Großskalige Sprachmodelle, die mit langen Kontexten arbeiten können, stoßen in der Vorfüllphase auf ein erhebliches Problem: Der dichte Selbstaufmerksamkeitsmechanismus verarbeitet den gesamten Eingabetext, bevor die Generierung beginnt. Um diese Kosten zu senken, wurden Techniken vorgeschlagen, die Blöcke dezentral auswählen; diese können jedoch wichtige Tokens unter vielen irrelevanten verbergen – ein Phänomen, das die Autoren „mittlere Verdünnung“ nennen. Der Artikel stellt RBS‑Attention vor, eine sparsamer Vorfüllstrategie, die ohne zusätzliche Schulung auskommt und zwei ergänzende Auswahlzweige kombiniert. Der erste Zweig, basierend auf Zentroiden, erfasst die durchschnittliche Relevanz der Blöcke; der zweite, der „Rescue‑Branch“, nutzt den maximalen Radius des Blockschlüssels sowie eine Prompt‑, Layer‑ und Head‑abhängige Verteilung, um potenziell unterbewertete Blöcke zu erkennen. Jeder Zweig wird unabhängig getriggert, und die resultierenden Masken werden zusammengeführt, sodass die Rescue‑Blöcke in die reguläre FlashAttention‑Ausführung mit dezentralen Blöcken integriert werden können.
Tests auf H100‑GPUs zeigen, dass RBS‑Attention die Vorfüllaufmerksamkeit um mehr als das 20‑fache gegenüber einer isolierten Ausführung und fast das 12‑fache gegenüber der vLLM‑Implementierung beschleunigt. Gleichzeitig verkürzt es die Zeit bis zum ersten Token um nahezu das Sechsfache bei einem Kontext von 128 k Tokens. Die Genauigkeitsverluste sind minimal: RULER‑Score 88,65 gegenüber 89,52 der dichten Methode. Benchmark‑Ergebnisse bei LongBench‑v2, InfiniteBench und Video‑MME bestätigen die Qualität. Diese Innovation ermöglicht es großen Sprachmodellen, deutlich längere Eingaben schneller und ressourcenschonender zu verarbeiten, was insbesondere für Aufgaben mit umfangreicher Textanalyse, wie die juristische Dokumentenprüfung oder großflächige Inhaltserstellung, von Bedeutung ist.
Originalartikel lesen auf arXiv cs.AI
Diese Zusammenfassung ist eine informationelle Synthese von dataqbs.com. Alle Rechte am Originalinhalt liegen beim Autor und dem genannten Medienunternehmen. Wir handeln ausschließlich als Kuratoren von Technologie-Nachrichten und beanspruchen keine Urheberschaft.