Reflection AI представила Beam — відкриту MoE-модель на 501B параметрів з 23B активних параметрів на токен. Модель призначена для коду, міркування та агентних задач.
5 жовтня 2026 року компанія подала анонс як внесок у західний відкритий фронт із фокусом на ефективність інференсу. За даними MarkTechPost, Beam конкурує з більшими відкритими моделями рівня GLM 5.2, потребуючи у 3–4 рази менше обчислень на завданнях міркування. Для команд, які запускають агентні сценарії з довгими ланцюжками міркувань і викликами інструментів, це передусім питання собівартості одного виклику.
Кому стане в пригоді Beam?
Beam — це загальна агентна модель, яку Reflection AI навчала з нуля під корпоративний код і агентні сценарії. Модель працює лише з текстом і після мідтрейнінгу тримає дієвий контекст 1M токенів.
Користувачі отримують параметр reasoning effort, щоб керувати глибиною міркувань. Низькі значення дають короткі відповіді на прості запити, вищі — довші ланцюжки міркувань на складних задачах, тож команда може добирати якість під бюджет обчислень.
Reflection AI не ставить Beam вище за Kimi K3 за абсолютною якістю: дослідницька команда визнає, що Kimi K3 лишається попереду. Ставка компанії — нижня вартість інференсу за зіставної якості на коді.
Як Reflection AI навчала Beam?
Beam — це розріджена MoE-архітектура з чергуванням локальної та глобальної уваги й дрібнозернистими роутед-експертами. Балансування навантаження будується на підході без додаткового лосу з DeepSeek-V3 і додає косинусне згасання оновлень експертного біасу. Найзавантаженіший експерт у кінці претрейну тримав усього 1,04 рази середнього навантаження.
Претрейн охопив 23,8 трлн токенів із вебу, публічних джерел і власних ліцензованих наборів. Курація, за словами команди, відсіяла близько 95% сирих інтернет-токенів, але зберегла приблизно 1,8 трлн високоякісних токенів, які звичайні фільтри відкинули б. Навчання тривало менше ніж 4 тижні на 6 144 GPU NVIDIA GB300 NVL72: гудпут ближче до фіналу становив 92,3%, а під час прогону сталися 9 напівавтоматичних відкатів. Норми залишкових компонентів у всіх 52 шарах залишилися в межах завдяки масштабуванню за глибиною, SandwichNorm, гейтам уваги та накопиченню залишків у FP32.
RL став головною віссю масштабування: 4 тижні на 10,5 тис. GPU NVIDIA GB300, понад 100 млн ролаутів і максимальний контекст ролауту 256K токенів. Навчання та оцінювання разом спожили близько 1,3 млрд сандбоксів у майже 1 млн середовищ для коду, агентних задач і STEM.
Навчання велось із повністю асинхронними градієнтами політики, де кожен токен позначається версією політики, яка його створила. Нові алгоритми тримали стабільність навіть за добового відставання, тобто на 107 версій ваг позаду актуальної, а якість не виходила на плато зі зростанням обчислень RL. Система в середньому утримувала 110 тис. одночасних ролаутів, нові ваги потрапляли в інференс-парк за медіанних близько 12 секунд, а 71 інцидент інференсу вдалося обробити без зупинки навчання.
Керований штраф за довжину навчив модель розв'язувати задачі меншою кількістю токенів. Навички роботи з браузером теж покращилися, хоча в RL-суміші не було задач на перегляд вебу — команда припускає, що це перенесення між агентними доменами.
Що показують бенчмарки?
За таблицею Reflection AI, Beam набирає 80,9 на SWE-bench Verified і 80,1 на Terminal Bench v2.1. На SWE-bench Verified це 80,9 проти 70,7 у Nemotron 3 Ultra, а на Terminal Bench v2.1 Beam іде поруч із GLM 5.2, у якого 81,0. Попереду лишаються DeepSeek V4.1 Flash із 90,6 та Kimi K3 із 88,3; оцінки конкурентів у таблиці Reflection AI взяті з Artificial Analysis і DataCurve.
Що з безпекою й вирівнюванням?
Reflection AI навчила окремого вчителя безпеки та вирівнювання зі стартового чекпоінта й об'єднала його з RL-вчителем через on-policy дистиляцію з кількома вчителями. Для безпеки застосували deliberative alignment. Результати оцінювання безпеки з'являться в технічному звіті.
Коли зможемо розгорнути Beam?
Зараз Beam недоступна для самостійного хостингу: модель проходить фінальний редтимінг, а ранній доступ відкритий через чергу очікування на платформі Reflection. Ваги під ліцензією Apache 2.0 компанія обіцяє випустити пізніше цього місяця.
У порівнянні з найближчими відкритими моделями Beam — найменша за загальною кількістю параметрів: її 23B активних параметрів поступаються GLM-5.2, Nemotron 3 Ultra та Kimi K3. Apache 2.0 і MIT — стандартні пермісивні ліцензії, а власна ліцензія Kimi K3 додає вимоги атрибуції для дуже великих продуктів.
Що встигнути зробити до публікації ваг?
- Запишіться в чергу очікування Reflection AI й підготуйте власний набір кодових та агентних задач, щоб порівняти Beam з поточним стеком.
- Закладіть у пілот три рівні reasoning effort під різні класи задач і заміряйте витрачені токени та затримку — саме тут обіцяна економія.
- Поки ваги не вийшли, тримайте тимчасовий стенд на серверлес-інференсі й порівняйте вартість одного агентного виклику з поточним хостингом.
- Закладіть в оцінку безпеки та редтимінг під свої інструменти: фінальні результати оцінювання безпеки від Reflection AI ще не опубліковані.







