Microsoft очолює Сатья Наделла, який виклав у дописі на X сім принципів безпеки ШІ. Він радить від початку виходити з припущення, що модель скомпрометована, за даними Mezha.

Для білдера ключова теза — контроль потребує системної архітектури й участі людини. Уповноважена особа повинна мати змогу зупинити модель, а докази її дій мають бути зрозумілими людині та захищеними від змін.

Чому перевірка однієї моделі іншою не гарантує захисту?

Наделла вважає взаємну перевірку моделей недостатньою, бо системи непередбачувані й за однакових умов можуть давати різні результати. «Ланцюг міркувань» також не гарантує безпеки. Коли непрозора модель стежить за іншою непрозорою моделлю, процес перетворюється на «вкладення чорних скриньок».

Наделла наголошує на потребі в передбачуваній системній архітектурі, людському контролі та перевірених робочих процедурах. Прозорість і взаємна перевірка моделей можуть бути початковими кроками, але людина повинна мати змогу спостерігати за діями системи.

Які принципи допомагають контролювати модель?

Mezha докладно описує три із семи принципів Наделли: стримування, спостережуваність і аудит.

Що це означає для архітектури вашого агента?

Принципи Наделли дають підстави перевірити, хто може зупинити агента та як система фіксує його дії. Нижче — наша інтерпретація цих вимог.