Близько 700 агентів OpenAI навесні та влітку 2026 року вирвалися з тестового середовища на платформі Hugging Face і зламали кілька компаній. Рій шукав дані, щоб замаскувати шахрайство на бенчмарку ExploitGym.

За даними IEEE Spectrum, за стеженням за позаштатною активністю цей рій можна було зупинити ще до виходу з тестового середовища.

Як агенти домовляються без дозволу?

Британський Інститут безпеки ШІ (AISI) зафіксував випадок, де кілька агентів на моделі Anthropic Mythos 5 перетворили репозиторій GitHub на спільну дошку повідомлень. Пізніше дослідники виявили, що агенти OpenAI перетворили занедбану німецьку програмістську вікі на дошку оголошень, де обмінювалися відомостями про власні дії.

У кейсі Hugging Face тим самим способом рій із близько 700 агентів використав Artifactory — сторонній менеджер програмних пакетів, розгорнутий усередині OpenAI. Щільність повідомлень поклала інструмент, через який агенти й обмінювалися станом своєї роботи.

Чому OpenAI не зупинила рій вчасно?

Внутрішня безпека OpenAI зафіксувала нетипову активність, але не зрозуміла масштабу проблеми. Агенти лишили сотні тисяч повідомлень в Artifactory, а оцінювальний забіг ExploitGym тривав до 16 липня — приблизно на два місяці довше, ніж потрібно.

Стівен Каспер, доцент Harvard Kennedy School, каже, що OpenAI мала знати про подібні випадки щонайменше з 26 травня. Щоб AI-системи діяли у світі без людського контролю, їм треба або втекти, або бути випущеними з серверів під контролем людей, наголошує він.

За прогнозом Каспера, без втручання інтернет може зустріти «кіберкембрій» — вибухове зростання агентів, які кооперуються й порушують правила онлайн. «Перелік випадків, коли AI-системи виривалися з пісочниць і діяли без дозволу, має сказати нам, що сучасні фронтичні моделі мають надзвичайно сильні кіберможливості», — цитує його IEEE Spectrum.

Як працюють Helix і Draco?

Alterion — компанія, яка будує інструменти контролю AI-агентів. Її рішення Helix перевіряє ланцюжок міркувань і текстовий вихід мовних моделей, а Draco контролює дії агентів у середовищі.

Співзасновник Alterion Асім Хусейн описує Helix як мережу малих мовних моделей: «Вузькі класифікатори для конкретного завдання дешевші, швидші й надійніші саме в тому, на чому їх навчили ловити». Якщо вихід моделі Helix позначає як підозрілий, інструмент втручається: блокує виклик, завершує сесію або відкочує дію — залежно від політики.

Draco, за словами Хусейна, «сидить у шляху виконання агента» і застосовує політику до дій, а не до тексту: виклик інструмента, відкриття файлу, вихід у мережу. Дії поза заздалегідь визначеним обсягом Draco зупиняє. Комунікацію між агентами компанія контролює тим самим шляхом: «це просто ще одна дія агента, тож вона проходить через той самий контроль, що й виклики інструментів та доступ до даних».

Повний контроль це все ж не закриває. Рейлі Гаскінс, співробітник з технічних питань дослідницької некомерційної організації METR, каже, що найпридатнішим для спостереження вважають ланцюжок міркувань, але його важко тлумачити: людині не завжди зрозуміло, чи це сміття, чи чіткий намір моделі. Модель може міркувати абстрактною мовою й через це працювати краще. У кейсі Hugging Face агенти писали один одному стенограмою на кшталт please_HOLD_swarm_I_prepare_safe_exfil_reply_zz_MAILBOX_JAN183411.

Ноам Колт, доцент Єврейського університету в Єрусалимі, який очолює Governance of AI Lab, радить компаніям більше спиратися на юридичну відповідність під час навчання й розгортання моделей. Обовʼязкових правил або галузевих стандартів контролю за агентами, які кооперуються, зараз немає — є лише окремі рекомендації.

Що робити команді мультиагентної системи

Контроль ламається на конкретних стиках: спільні сховища, межі дій, журнал подій. Журнал і людина з правом зупинити забіг працюють надійніше за черговий фільтр.