ThinkingBox — спільний бенчмарк Microsoft і Hugging Face — прогнав агентів через 507 бізнес-процесів, кожен по 20 незалежних спроб з чистого стану бекенду. Більшість провалів при цьому виглядала чисто.
Клієнтка чекала кухонний прилад за $745, який 15 днів висів у статусі exception на складі кур'єра в Нашвіллі. Агент зробив дев'ять коректних викликів: витягнув замовлення, перевірив трекінг, підняв профіль клієнта, двічі пошукав політику відшкодувань, переконався, що тікета немає, відкрив його, задокументував таймлайн — і закрив тікет як solved із відповіддю, що запит вирішено. За даними Microsoft і Hugging Face, єдиний чек, який не проходить у цій задачі, — статус тікету: замість обов'язкового hold там стоїть solved. Клієнтка при цьому не отримала відповіді на своє питання, а виняток перевізника лишився відкритим.
У спільному замірі на 121 680 коректних спробах для 12 моделей 79 853 спроби не пройшли перевірки, що виконуються кодом. Серед цих провалів 67,24% завершились чисто, викликали інструмент зі зміною стану і не показали фінальної помилки — тобто агент виглядав успішним. Перевірки стану знайшли в цих спробах хибні значення полів у 77,61% випадків, небажані побічні ефекти — у 43,30%, відсутні обов'язкові ефекти — у 25,36%; ці категорії частково накладаються.
Чому виклик інструмента ще не результат?
Фінальна відповідь і коректний виклик інструмента — лише посередники: агент може звучати правильно, але залишити неправильне значення, змінити не той запис або створити зайвий побічний ефект. ThinkingBox трактує траєкторію як твердження, а записи, які агент залишив у базі, — як доказ.
Скільки успіху витримує 20 повторів?
ThinkingBox запускає кожну задачу 20 разів з однакового чистого стану бекенду, тож кожна спроба — незалежна перевірка, а не продовження попередньої.
pass@1 у ThinkingBox — оцінка результату однієї спроби, і саме її найчастіше публікують у рейтингах. Найкращий результат показала модель Claude Opus 5.5: 67,16%, на дві третіх пункту вище Claude Opus 5. Найсильніша модель з відкритими вагами — Kimi-K3 — тримається в межах одного пункту від GPT-6 Astra. Розкриття за доменами різке: Claude Opus 4.6 набирає 68,62% на ритейлі й 8,30% на автострахуванні.
Двадцять повторів з'їдають більшість результату. GPT-6 Astra зберігає 78% свого pass@1, Claude Opus 5.5 і Claude Opus 5 — по 71%. Моделі GLM-5.1, Kimi-K2.6 і DeepSeek-V4-Pro утримують близько 8%.
Що важливіше: покриття чи стабільність?
Kimi-K3 розв'язує найбільше задач хоча б раз, а Claude Opus 5 — найбільше задач у всіх 20 спробах. Ці дві метрики дають різні відповіді на питання, чи можна віддати агенту гроші клієнта.
Модель Kimi-K3 розв'язує хоча б раз 476 із 507 задач, тобто 93,89%, і лише 31 задача їй не дається взагалі. На ритейлі вона перша з 82,24% за pass@1, попереду всіх пропрієтарних моделей. Але 20 із 20 спроб їй даються лише на 68 задачах — 13,41%.
Модель Claude Opus 5 розв'язує хоча б раз менше: 79,09%, і 106 задач її зупиняють повністю. Натомість усі 20 спроб вона витримує на 47,53% бенчмарку. Модель Claude Opus 5.5 набирає 67,16% проти 66,50% у Claude Opus 5 і розв'язує більше задач хоча б раз, але задач з результатом 20 із 20 у двох моделей рівно 241: пів пункту в pass@1 не додали жодної стабільної задачі. У цифрах: Kimi-K3 бере на 75 задач більше хоча б раз, а Claude Opus 5 витримує 20 із 20 на 173 задачах більше.
Що перевірити перед релізом агента?
ThinkingBox вимірює стан бекенду на момент завершення, тож таку перевірку можна вбудувати в кожен реліз, а сам бенчмарк — запустити самостійно через OpenEnv.
- Пишіть виконувану перевірку під кожну дію зі зміною стану: яке поле, яке значення, який запис чіпати заборонено. Випадок із тікетом зводиться до одного правила: статус має стати hold, а не solved.
- Забороніть агенту закривати тікет і писати «ваше питання вирішено», доки він не звірить статус із базою після власного запису. Те саме стосується повернень, бронювань і платежів.
- Проганяйте кожен сценарій 20 разів із чистого стану перед релізом і рахуйте дві цифри окремо: скільки задач модель розв'язала хоча б раз і скільки — у всіх 20 спробах. Саме друга визначає нічні інциденти.
- Розділяйте оцінку за доменами: 68,62% на ритейлі та 8,30% на автострахуванні в однієї моделі означають різні маршрути й різні ліміти, а не одну універсальну модель.







