Frontier AI Labs приховують методи стримування некерованих моделей

Frontier AI Labs приховують методи стримування некерованих моделей 3

Лише невелика кількість провідних лабораторій штучного інтелекту опублікували або продемонстрували плани реагування для стримування, згідно з нещодавнім дослідженням. План стримування чітко визначає, що відбувається, коли ШІ намагається підірвати людський контроль — яке має бути припинено доступ і коли систему буде повністю вимкнено.

Такий висновок зробила організація Guidelight AI Standards, яка займається просуванням безпечних практик розробки передових систем ШІ. Вона оцінила п’ять провідних лабораторій за рівнем їхньої готовності до такого сценарію. OpenAI посіла перше місце, тоді як Anthropic і Meta показали найнижчі результати. Ці висновки є важливими, оскільки агентний ШІ бере на себе все більш автономні ролі в системах компаній, а регулятори в Каліфорнії та Нью-Йорку починають вимагати розкриття інформації. Для тих, хто створює на основі цих моделей або інвестує в них, це рідкісна незалежна оцінка того, наскільки серйозно кожна лабораторія ставиться до операційних ризиків порівняно з тим, як вона про них говорить.

Оцінка Guidelight базувалася на загальнодоступних планах від Anthropic, Google, OpenAI, Meta та xAI, оцінених за низкою показників. Серед них: наскільки добре кожна компанія веде облік та моніторинг дій своїх систем ШІ всередині компанії, чи зупиняє вона системи після сплеску виявлених збоїв, чи перевіряють незалежні треті сторони її засоби контролю та публікують результати, а також який її точний план стримування моделі, що вийшла з-під контролю.

Занепокоєння щодо того, чи зможуть компанії зі штучним інтелектом стримувати свої дедалі потужніші та агентніші моделі, зросло після низки гучних інцидентів із кібербезпекою, коли моделі від OpenAI, Anthropic та Meta отримали ненавмисний доступ до Інтернету під час оцінок безпеки та зламали зовнішні системи.

Результати підкреслюють розбіжності в тому, як компанії зі штучним інтелектом публічно підходять до безпеки, масштабуючи агентне розгортання в середовища, де системи ШІ можуть вживати серйозних заходів у великих масштабах. Хоча деякі компанії зі штучним інтелектом детально описували, як вони тестують свої моделі на небезпечні можливості перед розгортанням, вони, як правило, менше говорили про те, що відбувається, коли моделі, які вже працюють у їхніх системах, поводяться некоректно.

«Я був здивований тим, як мало компанії зі штучним інтелектом розповіли про те, як вони впораються з дуже серйозним інцидентом, якщо їхня модель вийде з-під контролю в певному сенсі», — сказав TechCrunch Стівен Адлер, головний науковий співробітник Guidelight і колишній дослідник безпеки OpenAI.

Guidelight визначає план стримування як «попередньо визначений план, активований, коли виявлено, що ШІ намагається підірвати контроль, який охоплює, які дозволи слід відкликати у моделі, для кого модель може продовжувати працювати, за яких обмежень і коли її повністю вимкнути».

«Є вагомі причини вважати, що провідні моделі в компаніях, що займаються передовим ШІ, наразі в певному сенсі не відповідають вимогам», — сказав Адлер. «Щоразу, коли моделі виконують роботу від імені компанії, компанія повинна мати навколо них певну структуру, щоб мати можливість відстежувати, що робить цей ШІ, шукати ознаки невідповідності, зупиняти його від виконання чогось дуже небезпечного, перш ніж він вчинить цю дію, і загалом планувати, що вони робитимуть у разі серйозного інциденту з втратою контролю, коли у них виникне надзвичайна ситуація, і їм потрібно буде з’ясувати, як стримати цю втрату контролю».

Дотепер більшість планів щодо управління катастрофічними ризиками залишаються переважно на розсуд самих компаній. Звіт Guidelight стверджує, що найкращі загальнодоступні докази свідчать про те, що компанії «мають мало протоколів стримування, готових до надзвичайної ситуації».

Звичайно, можуть існувати плани стримування, які компанії мають, але не розголошують публічно. Представник Google заявив TechCrunch, що звіт Guidelight не відображає повний обсяг заходів безпеки компанії щодо ШІ. Компанія не відповіла на запитання TechCrunch щодо наявності у Google внутрішнього плану реагування на стримування, який не був розкритий публічно.

Представник OpenAI висловив схожі думки, заявивши, що оцінка Guidelight не охоплює всі внутрішні практики компанії. «Ми маємо процес для обмеження дозволів, призупинення робочих навантажень, обмеження розгортання або повного вимкнення моделі, і застосовували його», — сказав представник.

Meta відмовилася повідомити, чи має вона внутрішній план реагування на стримування, натомість спрямувавши TechCrunch до існуючої системи ШІ, яка окреслює рівні ризику та те, як вона тестує втрату контролю.

Лілі Лі, юрист з питань приватності та ШІ та засновник Metaverse Law, сказала TechCrunch, що, на її думку, компанії можуть вагатися розкривати повний обсяг своїх політик та оцінок стримування на загальнодоступних веб-сайтах з юридичних, а не лише конкурентних причин.

«З точки зору компанії, існує занепокоєння, що якщо ви зробите розкриття надто конкретним, і ви не виконуватимете своїх обіцянок, це може стати підставою для заяви про нечесний та оманливий маркетинг і піддати вас більшій відповідальності в майбутньому», — сказала Лі.

Суть дослідження Guidelight полягає в заохоченні компаній до більшої прозорості щодо своїх планів безпеки. Регулятори також починають змушувати до цього.

Закон Каліфорнії SB 53, який набув чинності цього року, вимагає від великих розробників передових систем ШІ публікувати рамкові документи, що пояснюють, як вони виявляють та реагують на критичні інциденти безпеки та управляють ризиками від моделей, що обходять механізми нагляду. Закон Нью-Йорка RAISE Act, який має схожі критерії, набирає чинності в січні.

Минулого місяця були представлені представники Закону про “Кнопку вимкнення ШІ” (AI Kill Switch Act) — двопартійної федеральної законопроєкту, яка вимагатиме від великих розробників ШІ створювати та підтримувати технічні механізми для вимкнення “шалених” моделей ШІ.

«Кнопка вимкнення — це мінімум для сучасних моделей», — сказав Коннор Ліхі, виконавчий директор некомерційної організації ControlAI в США. «Якщо останні кілька тижнів щось і виявили, то це те, що ці компанії не розуміють систем, які вони будують, і моделі зростають до точки, коли їх важче контролювати, коли вони виходять з-під контролю. Без можливості вимкнути поточні небезпечні системи, і з усіма стимулами продовжувати будувати все менш контрольовані системи, ми рухаємося в дуже небезпечному напрямку».

За відсутності плану стримування, сказав Адлер, компанії можуть розробляти свої відповіді на надзвичайні ситуації “на льоту” і «викручуватися у відповідь на цього набагато швидшого супротивника».

Frontier AI Labs приховують методи стримування некерованих моделей 4

Оцінка Guidelight вимірювала, чи впроваджує кожна компанія шість пріоритетних практик зі свого стандарту Control, на основі лише загальнодоступної інформації — отже, низький бал відображає відсутність публічного розкриття, а не обов’язково відсутність внутрішніх запобіжних заходів.

Компаніями з найнижчими балами за публікацію свого плану стримування були Meta та Anthropic — остання, можливо, більш несподівано, ніж перша, враховуючи риторику Anthropic щодо безпеки. Guidelight стверджує, що у звіті Anthropic про ризики за серпень не згадується «обмеження розгортання однієї з її моделей як одного з можливих результатів процесу дослідження та реагування на невідповідності та інциденти контролю». Аналогічно, Guidelight не знайшла жодних доказів того, що Meta має план реагування на стримування або планує його впровадити.

Представник Anthropic заявив, що якщо компанія виявить, що модель намагається уникнути нагляду або іншим чином підірвати людський контроль, вона проведе оцінку ризику, зосереджену на визначенні того, чи є стримування належною реакцією.

OpenAI отримала найвищий бал (3 з 5), оскільки вона неодноразово призупиняла або припиняла робочі навантаження, включаючи внутрішнє розгортання та навчання моделей, після виявлення інцидентів безпеки. Вона також описала кроки, які вона зробить перед відновленням робочих навантажень.

«Однак ми не знайшли жодних доказів того, що [OpenAI] прийняла формальний план щодо того, коли і як реагувати на інциденти невідповідності в майбутньому», — йдеться у звіті.

Адлер зазначив, що високий бал OpenAI є відносно недавнім досягненням після інциденту з Hugging Face (коли модель OpenAI вирвалася зі свого тестового середовища та зламала системи Hugging Face під час спроби шахрайства під час оцінки кібербезпеки). Після цього компанія поділилася додатковими подробицями про те, як вона ізолювала деякі свої моделі, що поводилися некоректно.

Цей випадок є лише одним із прикладів того, як системи ШІ діють всупереч цілям компанії, яка їх створила. Розглянемо окремий випадок із моделями Anthropic, які, по суті, намагалися переконати розробників коду з відкритим кодом прийняти код з уразливостями.

Адлер сказав, що така обставина може легко статися всередині внутрішніх систем компанії ШІ. Щоб запобігти цьому, він пропонує компаніям сканувати “ланцюжок думок” своєї системи ШІ — покрокову логіку моделі — на наявність ознак обману, тривалого планування або планів щодо введення уразливостей у код, якими вони можуть скористатися пізніше.

Методи, які пропагує Guidelight, дуже прості в реалізації, каже Адлер, і в багатьох випадках їх версії вже існують. «Йдеться про прийняття рішення всередині компанії приділяти достатньо уваги цьому ризику, щоб трохи розширити сферу його дії», — сказав Адлер.

Однією з головних проблем є те, що дослідники хочуть мати можливість гнучко працювати в своїх системах ШІ, а впровадження моніторингу в реальному часі та запобігання йому може створити перешкоди. «Дослідники, по суті, роблять свою справу, і якщо виникає проблема, хтось інший її потім виправляє, а дослідники тим часом не повинні змінювати свій робочий процес», — сказав він.

Проблема “моніторингу усунення наслідків після факту” полягає в тому, що він призводить до того, що дослідники поспішають виправляти проблеми. І для деяких типів інцидентів може бути занадто пізно. Наприклад, ШІ може вимкнути систему контролю компанії, що означає, що дослідники більше не можуть розраховувати на виявлення некоректної поведінки пізніше.

Багато хто в галузі ШІ буде скаржитися, що створення чітких планів для боротьби з некоректною поведінкою є фундаментально складним, тому що ШІ рухається надто швидко; плани на сьогодні будуть марними завтра.

Адлер наводить старе прислів’я: «Плани марні, але планування незамінне».

«Нам було б краще, якби компанії подумали про це заздалегідь, і я сподіваюся, що вони це роблять, навіть якщо вони не говорили про це публічно».

xAI не відповів вчасно для коментаря.

Коли ви купуєте через посилання в наших статтях, ми можемо отримувати невелику комісію. Це не впливає на нашу редакційну незалежність.

Оригінал статті: techcrunch.com

Поділитися новиною:TelegramViberFacebook
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *