Колишні працівники Anthropic та METR знайшли спосіб контролювати неслухняних ШІ
Наступного дня після того, як дослідник Anthropic Джейкоб Коксон звільнився з роботи через побоювання, що ШІ може знищити людство до кінця десятиліття, я зустрівся із засновниками та родичами Руне Квістом та Радживом Даттані. Вони вважають, що мають рішення, яке може врятувати нас усіх, або принаймні допомогти запобігти виходу з-під контролю ШІ-агентів у компаніях.
«Штучний інтелект стає розумнішим із дедалі вищою швидкістю. Дивовижно, але зі зростанням розуму ШІ його стає не легше, а складніше впроваджувати та контролювати», — зазначив Квіст, один із перших співробітників Anthropic, який також одружений із сестрою Даттані. Даттані є колишнім операційним директором організації з дослідження безпеки ШІ METR.
Пара запустила стартап під назвою Artificial Intelligence Underwriting Company (AIUC), який має на меті забезпечити безпеку ШІ для підприємств та компаній, що розробляють моделі та агенти ШІ. Серед клієнтів стартапу — Cursor, Lovable, Harvey та ElevenLabs.
У вівторок AIUC оголосила про залучення 40 мільйонів доларів у рамках раунду Серії А під керівництвом Ribbit Capital за участю First Harmonic. Раніше компанія закрила початковий раунд фінансування на 15 мільйонів доларів від Нейта Фрідмана через його фонд NFDG, а також від Emergence, Terrain та співзасновника Anthropic Бена Манна, серед інших, що довело загальний обсяг фінансування до 55 мільйонів доларів.
Те, що привернуло увагу цієї елітної групи інвесторів, — це спроба AIUC застосувати знайому модель кібербезпеки до нового спектру ризиків, пов’язаних зі ШІ. Компанія створила шар аудиту та сертифікації третьою стороною для ШІ-агентів.
«Банки, лікарні, уряди та військові більше не відмовляються від розгортання ШІ через недостатню розумність моделі, — сказав Квіст. — Вони відмовляються, тому що взяли на себе зобов’язання перед власними клієнтами щодо того, що система робитиме, а що ні, і наразі ніхто не може цього гарантувати».
Використовуючи як приклад широко прийнятий стандарт кібербезпеки SOC 2, AIUC розробила стандарт під назвою AIUC-1 та послугу тестування для перевірки агентів відповідно до цього стандарту.
Для розробки стандарту AIUC зібрала консорціум із близько 250 лідерів з питань безпеки та ризиків — покупців агентів. «Це люди, з якими ми зустрічаємося щомісяця, і ми запитуємо їх: коли ви купуєте агентів у когось, на що б ви звернули увагу? Які запитання ви б хотіли поставити, і що б ви хотіли, щоб було розглянуто?» — розповів Даттані TechCrunch.
Цей зворотний зв’язок формує тести. Потім стартап проводить тести агентів за допомогою набору з приблизно 5000 перевірок, щоб побачити, як вони поводяться в сценаріях, пов’язаних із зломом, галюцинаціями та витоками даних. Результати оформлюються у приблизно 100-сторінковий звіт, де детально описується, де агент працює безпечно та надійно, а де — ні. Цікаво, що AIUC використовує ШІ-агентів для проведення тестів, а ШІ — для аналізу даних. Однак, за словами Квіста, остаточну перевірку проводять люди.
Якщо це звучить знайомо, то так воно і є. Колишній роботодавець Даттані, METR, де він був операційним директором з 2024 по 2025 рік і залишається членом ради директорів, проводить подібні тести для передових лабораторій, хоча донедавна його робота зосереджувалася переважно на продуктивності (чи можуть агенти надійно виконувати завдання). METR був однією з незалежних дослідницьких організацій, яку OpenAI залучала для розслідування інциденту з Hugging Face.
Генеральний директор Anthropic Даріо Амодеї також нещодавно закликав галузь ШІ впорядкувати розвиток передових технологій, посилаючись на швидке зростання інцидентів із неправомірною поведінкою. У своїй публікації Амодеї висловив ідею про необхідність вимагати від передових лабораторій використовувати вбудованих сторонніх оцінювачів для спостереження та перевірки безпеки, назвавши METR як один із можливих варіантів.
Хоча AIUC не пропонує вбудовуватися на виробничих потужностях клієнтів, загальна ідея схожа: надати підприємствам незалежну оцінку безпеки їхніх ШІ-агентів. «Ось де він проходить, і де йому можна довіряти. А ось де є проблеми. Вам слід знати про ці моменти, перш ніж ухвалювати рішення про купівлю», — сказав Даттані.
Дізнатися більше на: techcrunch.com
