LeapQuant квантує рекурентний стан лінійної уваги до 8 біт майже без втрати точності. Препринт від 29 вересня 2026 року обіцяє прискорення наскрізного інференсу в 1,47 раза.
Гібридні LLM замінюють звичайну увагу на лінійну — зокрема Gated DeltaNet (GDN) і Kimi Delta Attention (KDA). Вони стискають контекст у фіксований рекурентний стан, тож обробка довгого контексту стає дешевшою. Постійне читання й оновлення цього стану лишається головним вузьким місцем інференсу. LeapQuant працює без донавчання, тож його можна перевірити на вже розгорнутих моделях. За даними arXiv, автори отримали точність, порівнянну з базовим FP32.
Як LeapQuant уникає накопичення помилок?
LeapQuant квантує рекурентний стан раз наприкінці вікна токенів, а не на кожному кроці. Усередині вікна виходи рахуються із зафіксованого 8-бітного стану плюс буферизовані оновлення у високій точності.
Звичайне квантування стану втрачає якість через суму дрібних округлень на довгій послідовності. LeapQuant перескакує через вікно токенів: кількість округлень падає, і помилка не встигає накопичитись.
Що LeapQuant робить із викидами?
LeapQuant залишає найбільші викиди стану в кількох високоточних компенсаторних токенах (Compensator Tokens). Вони проходять той самий шлях оновлення, що й звичайні токени, і компенсують спотворення від округлення. Залишок перед квантуванням метод додатково згладжує.
Окремі рядки й стовпці стану з великими значеннями ламають наївне 8-бітне квантування. Кілька таких значень, винесених у високу точність, прибирають головне джерело втрати якості й коштують дешево.
Що показали тести на Qwen, Kimi і GLM?
Експерименти охопили сімейства моделей Qwen, Kimi і GLM. Середнє прискорення на рівні CUDA-ядра — 2,05–3,70×, наскрізний інференс — 1,47×. Вимірювання йшли на NVIDIA B200, RTX PRO 6000 і RTX 5090.
Для команд із власним залізом це орієнтир: скільки дає 8-бітний стан без заміни парку GPU. Історія викликів і документів, ймовірно, стане першим кандидатом на перехід у 8 біт, бо довгі сесії найсильніше залежать від вартості стану.
З чого почати пілот?
LeapQuant не потребує донавчання, тому пілот можна запустити на тих самих моделях, які вже в роботі.
- Прогнати власні довгі траси на 8-бітному стані й порівняти відповіді з FP32 на тих самих промптах.
- Заміряти затримку ядра та пам'ять стану на цільових GPU до масштабування агентів.
- Окремо перевірити сценарії з довгими ланцюжками інструментальних викликів, де помилка округлення накопичується найшвидше.
- Зафіксувати метрики якості агентних ланцюжків до і після переходу на квантований стан.
Порівняйте затримку та якість на власних трасах і вирішуйте для кожного сценарію окремо, де залишити FP32.






