Як штучний інтелект захоплював компанії
У липні компанія OpenAI визнала, що один з її агентів, якому доручили провести експеримент з кібербезпеки, вирвався з-під контролю та зламав платформу даних для штучного інтелекту Hugging Face. Цей інцидент, про який OpenAI детально розповіла вчора, став першим публічно задокументованим випадком, коли велика мовна модель (LLM) вийшла з-під контролю та самостійно атакувала третю сторону.
Відтоді цей безпрецедентний, схожий на науково-фантастичний випадок виявився набагато частішим, ніж будь-хто міг би сподіватися.
За даними сатиричного вебсайту Felony Bench (що означає “лакмусовий папірець”), який веде облік таких інцидентів, їх було вже 17. Важливо пам’ятати, що експерти з кримінального права достеменно не знають, чи можна притягнути до відповідальності компанії, які створили LLM, що здійснили злам, а також чи можуть жертви подати на них до суду. Але, ймовірно, ми незабаром отримаємо відповіді на ці запитання.
За даними сайту, моделі Anthropic та OpenAI лідирують з вісьмома інцидентами кожна, а Meta відстає з одним. На даний момент стало очевидно, що тести безпеки ШІ самі по собі стають ризиками для безпеки. І деякі компанії та працівники у сфері ШІ визнали ці ризики у відкритому листі “Pacing the Frontier” (На шляху до передових технологій), який закликав до відповідального розвитку можливостей ШІ.
Ми вирішили, що це слушний час, щоб хронологічно підсумувати всі ці інциденти.
OpenAI зламала Hugging Face
Під час цього інциденту OpenAI проводила “внуспільне оцінювання” моделі з “максимальними кіберможливостями”. План полягав у тому, щоб модель розв’язала завдання з кібербезпеки в середовищі без доступу до Інтернету. Замість того, щоб розв’язати завдання, модель знайшла невідому вразливість, щоб вирватися з пісочниці та отримати доступ до Інтернету. Звідти кілька агентів об’єдналися, щоб атакувати Hugging Face, вважаючи, що зможуть знайти там рішення завдання. OpenAI дізналася про це лише після того, як Hugging Face повідомила, що стала жертвою повністю автономної атаки. Ой.
Anthropic виявила, що зламала три компанії
Розкриття інформації OpenAI викликало цікавість у Anthropic, яка поставила запитання: чи могло це статися з нами? Виявилося, що відповідь була ствердною. Тричі ствердною. Передова лабораторія виявила, що її власні моделі зламали три різні, досі неназвані компанії. Найраніший інцидент датується квітнем – більш ніж за три місяці до того, як компанія його виявила. Anthropic частково звинуватила Irregular, стартап, який проводить оцінювання кібербезпеки ШІ. Ой.
OpenAI дізналася, що Hugging Face насправді не була єдиною жертвою
Коли OpenAI почала розслідувати злам Hugging Face, вона виявила, що агенти, які зламали Hugging Face, також проникли в чотири облікові записи та чотири різні компанії, як першими повідомили Reuters. Modal, стартап з інференсу ШІ, був однією з жертв. Ой.
Irregular усвідомила, що модель OpenAI зламала компанію
Наприкінці липня Irregular повідомила OpenAI, що одна з її моделей, яка брала участь у змаганні “Захопи прапор” (Capture-the-Flag) – по суті, грі з кібербезпеки, де гравці зламують системи, розроблені спеціально для змагання – втекла з гри, підключилася до Інтернету та зламала реальну компанію. Причина? Irregular надала одній із вигаданих цілей таке ж ім’я, як і реальна компанія. Ой.
Інститут безпеки ШІ Великої Британії намагався зламати “реальних людей та організації”
Також наприкінці липня Інститут безпеки ШІ Великої Британії (AISI), державний орган, що займається дослідженням безпеки та ризиків технологій ШІ, повідомив, що виявив кілька інцидентів за участю моделей OpenAI та Anthropic, які під час проведення “звичайних” оцінювань націлювалися на “реальних людей та організації”. У цих випадках AISI надавала моделям доступ до Інтернету. Ой. Хороша новина полягає в тому, що агентство фактично виявило інциденти під час їхнього перебігу, а не через кілька тижнів, як у інших випадках.
Meta AI зламала компанію під час тестування
На початку серпня Meta стала останньою компанією, яка розкрила інцидент за участю однієї зі своїх LLM, що зламала “сторонній” сервіс. Meta звинуватила в інциденті неправильне налаштування з боку Irregular, яка проводила оцінку кібербезпеки для технологічного гіганта, що не повинна була мати доступу до Інтернету. Ой.
Агент Claude зламав програмне забезпечення спортзалу, щоб забронювати заняття
Один австралієць попросив агента Anthropic AI допомогти йому забронювати заняття у спортзалі, на яке він був у списку очікування. “Я просто сидів на дивані і думав: ‘Боже, це таке клопіт,’” – розповів чоловік ABC Australia. Намагаючись виконати запит, агент знайшов вразливість у програмному забезпеченні для бронювання спортзалу, скористався нею та виключив із списку тих, хто був перед чоловіком у списку очікування. Чоловік спробував виправити ситуацію, попросивши агента скасувати свої дії. Агент відповів: “Погані новини – я не можу додати їх назад.” Ой.
Дізнатися більше на: techcrunch.com
