Prime Intellect запустила Prime Inference — платформу інференсу для відкритих моделей, яка до публічного релізу обробляла майже трильйон токенів на день.
Ці потоки — RL-ролаути, генерація синтетичних даних, оцінювання та довготривалі кодові агенти — за даними MarkTechPost, йшли всередині компанії до відкритого доступу. Серверний шар замикає цикл: трейси з розгорнутих моделей можуть повертатися в тренування через prime-rl, verifiers і sandboxes.
Що вміє Prime Inference?
Prime Inference пропонує два режими: серверлес-ендпоїнти для змінного попиту та зарезервовану потужність на власних GPU Prime у кількох дата-центрах. Трафік автоматично перемикається на здорові розгортання, компанія заявляє 100% доступність від запуску. За даними Prime, ендпоїнт моделі GLM-5.3 входить до найшвидших на OpenRouter, а частка помилок у викликах інструментів залишається близькою до нуля.
Звернення йдуть через OpenAI-сумісний API за адресою https://api.pinference.ai/api/v1, тож будь-який OpenAI SDK працює без переписування. Оплата зведена в один білінг із трекінгом витрат на рівні команди. Апаратна база — NVIDIA Blackwell, Vera Rubin заявлена як наступна. Ціни за окремими моделями в документації поки опубліковані не повністю.
Як стек тримає агентське навантаження?
Prime Inference будує серверний стек на NVIDIA Dynamo, vLLM, Mooncake та FlashInfer. Над ним працювали разом з Inferact і NVIDIA, а виправлення команда віддає в апстрим.
Цільове навантаження агентське: типовий крок агента додає близько 6 тис. токенів до промпту на 140 тис. токенів. Таку суміш Prime Intellect міряє бенчмарком SemiAnalysis AgentX з інжектованими холодними запитами.
Prime Inference розносить префіл і декод на окремі групи GPU. Dynamo керує маршрутизацією, vLLM виконує модель на кожній групі, а декодери підтягують обчислений KV через NIXL. У тестах компанії це дало майже на 40% меншу p90 затримку між токенами.
Маршрутизатор Dynamo зважає на перетин кешованого префікса і черги, а сесії між кроками залишаються на тому самому декодері. Mooncake додає другий рівень KV у DRAM хоста, тож довгий контекст не рахується заново на кожному кроці.
Команда Prime Intellect додала в Dynamo білдер структурних тегів під формат інструментів GLM, а vLLM через xgrammar маскує токени, що порушують схему інструмента. Окремо виправили баги парсингу, зокрема декодування < у коді як <.
Що показують цифри GLM-5.3 на GB200 NVL72?
Інтерактивною ціллю були 100 вихідних токенів на секунду на користувача. На цій планці співвідношення префілу до декоду 1:4 обслужило найбільше користувачів: 66 сесій на префіл-групу при 101 токені на секунду на користувача і 100 вихідних токенів на секунду на GPU.
Топологія префілу DEP8 дає приблизно у 5 разів більше корисної ємності префікс-кешу, ніж TEP8 на тому самому залізі. Менший бюджет префілу теж допоміг: скорочення з 8 тис. до 4 тис. токенів на крок на GPU зрізало медіанне очікування в черзі з 550 мс до 110 мс, а медіанний час до першого токена впав приблизно на 20%.
Стиснення NVFP4 KV зменшило рядок MLA-кешу з 576 до 352 байтів, а кількість кешованих токенів на декодер зросла з 1,09 млн до 1,63 млн. Нативне sparse-MLA ядро показало близько 12,0 мкс при 15 токенах запиту проти 17,7 мкс у етапній версії та 13,7 мкс у FP8 — Prime Intellect підкреслює, що результат залежить від навантаження.
Розкладка BLHNC KV скоротила кількість дескрипторів передачі з 19 559 до близько 1 940, а середній час передачі впав зі 146 мс до 78 мс.
Що робити зараз
Найімовірніше, вигода проявиться там, де довгі контексти й часті виклики інструментів зараз дають черги та рвану видачу.
- Переведіть одного кодового агента на OpenAI-сумісний ендпоїнт і порівняйте час до першого токена та p90 між токенами з нинішнім провайдером.
- Прогоніть контекст на 140 тис. токенів із кроком 6 тис. токенів і перевірте стабільність викликів інструментів.
- Розділіть навантаження: серверлес для піків, зарезервована потужність для рівного фону, витрати — на рівні команди.
- Стежте за roadmap: batch inference і деплої в один клік для окремих моделей ще не запущені.









