Microsoft очолює Сатья Наделла, який виклав у дописі на X сім принципів безпеки ШІ. Він радить від початку виходити з припущення, що модель скомпрометована, за даними Mezha.
Для білдера ключова теза — контроль потребує системної архітектури й участі людини. Уповноважена особа повинна мати змогу зупинити модель, а докази її дій мають бути зрозумілими людині та захищеними від змін.
Чому перевірка однієї моделі іншою не гарантує захисту?
Наделла вважає взаємну перевірку моделей недостатньою, бо системи непередбачувані й за однакових умов можуть давати різні результати. «Ланцюг міркувань» також не гарантує безпеки. Коли непрозора модель стежить за іншою непрозорою моделлю, процес перетворюється на «вкладення чорних скриньок».
Наделла наголошує на потребі в передбачуваній системній архітектурі, людському контролі та перевірених робочих процедурах. Прозорість і взаємна перевірка моделей можуть бути початковими кроками, але людина повинна мати змогу спостерігати за діями системи.
Які принципи допомагають контролювати модель?
Mezha докладно описує три із семи принципів Наделли: стримування, спостережуваність і аудит.
- Стримування. Слід виходити з припущення, що «модель скомпрометована», й одразу обмежувати її можливості. Уповноважена особа повинна мати змогу призупинити або повністю зупинити роботу моделі під час виконання завдання.
- Спостережуваність. Жодна модель не повинна одночасно контролювати поведінку системи й надавати докази її відповідності початковим намірам. Ці докази мають бути зрозумілими людині та захищеними від змін. За словами Наделли, дію, за якою неможливо спостерігати, не можна вважати надійною.
- Аудит. Кожна значуща дія моделі повинна залишати слід у вигляді доказів, які можна відтворити без покладання на саму модель. Наделла пов’язує цю вимогу з тим, що ШІ фактично стає «внутрішнім співробітником» компанії.
Що це означає для архітектури вашого агента?
Принципи Наделли дають підстави перевірити, хто може зупинити агента та як система фіксує його дії. Нижче — наша інтерпретація цих вимог.
- Чи можна зупинити конкретне завдання під час виконання і чи визначено, хто має на це право?
- Чи забезпечує одна й та сама модель і контроль поведінки системи, і докази її відповідності початковим намірам?
- Чи може людина відтворити значущі дії агента за доказами, захищеними від змін, без покладання на саму модель?





