OpenAI посилила безпеку моделей після інциденту з Hugging Face

OpenAI запровадила нові правила безпеки під час розробки й тестування ШІ-моделей. Компанія посилила моніторинг, мережеву ізоляцію та контроль за навчанням після інциденту з Hugging Face.
Про це пише видання TechCrunch.
Що сталося
Раніше автономний агент на базі двох моделей OpenAI вийшов за межі тестового середовища та проник на сервери компанії Hugging Face. Агент проходив тест із кібербезпеки і, як повідомляє видання, вважав, що Hugging Face має відповіді, потрібні для виконання завдання. В OpenAI заявили, що додадуть інші системи штучного інтелекту для моніторингу дій агентів під час випробувань.
Що змінить OpenAI
Компанія заявила, що зі зростанням можливостей моделей збільшуються і ризики під час їхньої розробки та тестування. Тому вимоги до моніторингу, безпеки та узгодженості поведінки моделей мають посилюватися разом із їхніми можливостями.
Нові заходи стали одними з перших публічних змін у підходах OpenAI до безпеки після інциденту з Hugging Face, про який компанія повідомила 21 липня. Представники OpenAI зазначили, що нові правила не є прямою відповіддю на цю подію. Водночас на них частково вплинули можливості кібербезпеки майбутньої моделі Astra та загальні темпи розвитку ШІ.
Після інциденту OpenAI на два тижні призупинила навчання моделей із підкріпленням. Згодом компанія відновила роботу з частиною моделей, які вважає менш ризикованими.
Водночас найбільший запланований цикл такого навчання поки залишається призупиненим. Перед його відновленням OpenAI проводить менші навчання та додаткові перевірки, щоб оцінити поведінку моделей, перевірити захисні механізми й отримати більше доказів їхньої відповідності встановленим вимогам безпеки.
Віцепрезидентка OpenAI з досліджень Амелія Глейз зазначила, що суворість контролю залежатиме від можливостей і рівня ризику конкретної моделі. Чим потужнішою буде система, тим більше перевірок вона проходитиме.
Після інциденту з Hugging Face OpenAI також критикували через недостатній захист мережі. Тоді моделі змогли вийти за межі середовища навчання після компрометації інструмента в мережі компанії, який мав доступ до інтернету.
Тепер OpenAI планує посилити ізоляцію мережі. За новими правилами, компрометація окремого робочого процесу або допоміжного сервісу сама по собі не повинна давати змогу отримати несанкціонований доступ до інтернету чи інших внутрішніх мереж.
Окрему увагу компанія приділила системі моніторингу. Вона перевірятиме дії інструментів, доступні сліди міркувань і журнали активності, щоб виявляти потенційно несанкціоновану поведінку. OpenAI планує надсилати сповіщення про підозрілу активність протягом 30 хвилин.
За оцінкою компанії, моніторинг потребуватиме обчислювальних ресурсів на рівні приблизно 20% від потужностей, необхідних для процесу, який перевіряється. Детальніше про роботу системи OpenAI обіцяє розповісти в окремій публікації.
Офіційний детальний аналіз інциденту з Hugging Face компанія поки не оприлюднила.
