Новітня модель ШІ: коли оновлення шкодить бізнесу

Наявність найновішої моделі ШІ насправді може бути поганим бізнес-рішенням. Ось як зрозуміти, коли оновлення варте того.
Технічно досконаліша модель ШІ не завжди є розумним бізнес-кроком. Ось як оцінити, чи справді вона варта інвестицій.
Засновники часто припускають, що кожне покращення точності моделі ШІ заслуговує на випуск у продакшн. Але коли врахувати витрати на тестування, розгортання, моніторинг та інженерну роботу, впровадження лише трохи кращої моделі може призвести до гіршого бізнес-результату.
Уявіть, що ваша команда ШІ навчила нову модель, яка працює на 0,2% краще, ніж версія, яка зараз обслуговує клієнтів. Звісно, науковці даних задоволені, а автоматизований конвеєр позначає кандидата як вищий, що спонукає всіх вважати, що він повинен негайно замінити існуючу модель. Але саме тоді починається справжня робота з виробництва.
Кандидат повинен пройти суворі тести безпеки та інтеграції, перш ніж інженери зможуть упакувати його, розгорнути в тестовому середовищі та перевірити його поведінку. Крім того, команда може знадобитися запустити тіньовий або поетапний випуск, оновити правила моніторингу, задокументувати зміни та підготувати комплексний план відкату. До того часу, як ця нова модель нарешті потрапить у продакшн, компанія витратить значно більше, ніж початкова вартість навчання, але клієнти можуть навіть не помітити покращення.
Це підкреслює одне з найдорожчих непорозумінь у прикладній штучній інтелекції: технічно краща модель не є автоматично кращим бізнес-рішенням.
Точність та цінність для бізнесу – це не одне й те саме
Точність вимірює технічну продуктивність, тоді як цінність для бізнесу вимірює, чи ця продуктивність насправді покращує результат, який хвилює вашу компанію.
Розглянемо дві різні системи ШІ. Перша виявляє потенційно шахрайські фінансові транзакції, де невелике збільшення відкликання може допомогти виявити додаткове шахрайство, запобігти збиткам і захистити клієнтів. У цьому сценарії з високими ставками навіть частка відсотка може принести значну цінність, коли система обробляє мільйони транзакцій.
Навпаки, уявіть другу систему, яка узагальнює внутрішні тікети служби підтримки. Подібне покращення в офлайн-метриці тут може бути статистично дійсним, але воно залишається практично непомітним у повсякденних операціях. Співробітники, ймовірно, не закінчать свою роботу помітно швидше, а це означає, що компанія не побачить зниження витрат на підтримку. Хоча технічні покращення в обох сценаріях схожі, економічна цінність значно відрізняється.
Перед затвердженням нової моделі ви повинні визначити, скільки коштує одна одиниця покращення. Ця цінність може бути виражена як:
- Збитки від шахрайства, яких вдалося уникнути
- Додаткові покупки, що були здійснені
- Збережені години роботи співробітників
- Запобігли скаргам клієнтів
- Зменшені помилки прогнозування
- Усунені ручні перевірки
Якщо ваша команда не може пов’язати покращену точність моделі з одним із цих відчутних результатів, компанія ще не має достатньо інформації, щоб обґрунтувати випуск.
Враховуйте повну вартість оновлення моделі
Багато компаній неправильно розраховують вартість оновлення ШІ, розглядаючи лише обчислювальну потужність для навчання, що схоже на оцінку вартості відкриття ресторану, враховуючи лише ціну духовки. Навчання – це лише невелика частина набагато більшої системи.
Як зазначено в дослідженні Google про приховані технічні борги в системах машинного навчання, код моделі становить лише частину системи ШІ для виробництва. Залежності від даних, тестування, моніторинг та підтримуюча інфраструктура створюють значну довгострокову складність. Крім того, фреймворк ML Test Score від Google демонструє, що готовність до виробництва залежить від набагато більшого, ніж від показника якості моделі офлайн.
Реалістичний розрахунок витрат повинен включати:
- Підготовка та валідація даних
- Навчання моделі та експериментування
- Тестування безпеки та конфіденційності
- Оцінка справедливості або стійкості
- Створення контейнерів або пакетів
- Сканування залежностей та вразливостей
- Інтеграційне тестування
- Надання інфраструктури
- Тіньове або поетапне тестування
- Зміни в моніторингу
- Документація та затвердження
- Інженерний огляд
- Ризик інцидентів та відкату
- Потенційне порушення роботи клієнтів
Це розходження має величезне значення, оскільки автоматизований конвеєр навчання може зробити експериментування штучно недорогим. Справді дорога робота часто починається лише після навчання, якраз тоді, коли кандидат вступає в процес випуску продукції.
Впровадьте кожну модель у процес затвердження з чотирьох запитань
У своєму рецензованому дослідженні IEEE Access щодо оцінки ефективності перенавчання я вивчав надзвичайно актуальне питання: коли організація повинна просувати новонавчену модель прогнозування, а не зберігати існуючу?
Після оцінки 2320 контрольованих запусків на чотирьох загальнодоступних наборах часових рядів та чотирьох архітектурах прогнозування результати були чіткими: організаціям не доводиться вибирати між безперервним випуском нових моделей і нескінченним залишенням старої моделі без змін. Натомість, вибіркова політика просування дозволяє зберегти поточну модель, коли очікуване покращення занадто мале, і затвердити нову лише тоді, коли переваги виправдовують операційні витрати.
Засновники можуть застосувати цей принцип без впровадження складного математичного фреймворку, просто вимагаючи від своєї команди відповісти на чотири критичні запитання перед випуском будь-якої моделі:
1. Чи покращила модель результат, релевантний для бізнесу? Не приймайте «оцінка зросла» як повну відповідь. Вимагайте знати, яка метрика покращилася, чому ця метрика важлива, і чи вона безпосередньо корелює з результатом для клієнта або операційним результатом. Покращення лабораторного бенчмарку часто не призводить до реальної вигоди у виробництві.
2. Чи помітять клієнти чи операції різницю? Технічно вимірна зміна все ще може бути комерційно нерелевантною. Оцініть, на скільки рішень, користувачів чи транзакцій вплине зміна, а потім розрахуйте, чи суттєво це покращить дохід, ризик, витрати, швидкість чи загальний клієнтський досвід.
3. Яка повна вартість її випуску? Це має включати навчання, тестування, огляд безпеки, розгортання та інженерну роботу. Важливо, ви також повинні враховувати альтернативні витрати; кожна година, витрачена на випуск незначно кращої моделі, – це година, яку не можна використати для покращення основного продукту, усунення проблеми надійності або створення дуже запитуваної функції.
4. Чи виправдовує покращення витрати та додатковий ризик? Порівняйте очікувану цінність покращення з повною вартістю випуску. Компанія повинна просувати кандидата лише тоді, коли відповідь – однозначне «так». Якщо бізнес-кейс невизначений, дисциплінованим вибором буде зберегти поточну модель, зібрати більше доказів та переоцінити пізніше.
Збереження поточної моделі може бути дисциплінованим рішенням
Оскільки команди ШІ часто винагороджуються за випуск нових моделей, збереження існуючої може помилково сприйматися як стагнація. Насправді, збереження моделі, яка вже відповідає очікуванням клієнтів, має передбачувані витрати та відомий профіль ризику, часто є більш розумним інженерним вибором.
Нова модель, незважаючи на вищий показник офлайн, вносить невизначеність. Вона може зазнати невдачі на незвичайних вхідних даних, порушити подальші системи або генерувати нові помилки. Це означає, що розробка моделі та просування моделі повинні розглядатися як повністю окремі рішення. Ваша команда повинна продовжувати експериментувати та навчати кандидатів, не відчуваючи зобов’язання проштовхувати кожного «переможця» у продакшн.
Ставтеся до просування моделей як до інвестиційного рішення
Засновники застосовують сувору фінансову дисципліну до найму та розробки продуктів; випуски ШІ заслуговують на таку ж ретельність. Оскільки кожна нова модель споживає капітал, операційну увагу та інженерні ресурси, вона повинна забезпечувати відчутну віддачу.
Щоб забезпечити це, вимагайте простий запис для кожного запропонованого випуску, що деталізує технічне покращення, його очікувану цінність для бізнесу, повну вартість розгортання та будь-які нові ризики. З часом ця документація виявить, які оновлення створюють справжню цінність, а які лише роблять внутрішні інформаційні панелі кращими.
Зрештою, мета полягає не в тому, щоб придушити інновації, а в тому, щоб спрямувати їх на результати, які ваші клієнти та бізнес можуть реально відчути. Наступного разу, коли ваша команда ШІ представить більш точну модель, не просто запитуйте, чи вона краща. Запитайте, чи вона достатньо краща.
Ключові висновки
- Впровадження нового інструменту ШІ кожного разу, коли ви вносите незначне оновлення, насправді може призвести до гіршого результату, тому що після всієї роботи, вкладеної в нову модель, клієнт може навіть не побачити покращення з їхнього боку.
- Технічно краща модель не обов’язково робить її кращим бізнес-рішенням.
Засновники часто припускають, що кожне покращення точності моделі ШІ заслуговує на випуск у продакшн. Але коли врахувати витрати на тестування, розгортання, моніторинг та інженерну роботу, впровадження лише трохи кращої моделі може призвести до гіршого бізнес-результату.
Уявіть, що ваша команда ШІ навчила нову модель, яка працює на 0,2% краще, ніж версія, яка зараз обслуговує клієнтів. Звісно, науковці даних задоволені, а автоматизований конвеєр позначає кандидата як вищий, що спонукає всіх вважати, що він повинен негайно замінити існуючу модель. Але саме тоді починається справжня робота з виробництва.
Кандидат повинен пройти суворі тести безпеки та інтеграції, перш ніж інженери зможуть упакувати його, розгорнути в тестовому середовищі та перевірити його поведінку. Крім того, команда може знадобитися запустити тіньовий або поетапний випуск, оновити правила моніторингу, задокументувати зміни та підготувати комплексний план відкату. До того часу, як ця нова модель нарешті потрапить у продакшн, компанія витратить значно більше, ніж початкова вартість навчання, але клієнти можуть навіть не помітити покращення.
Джейачандер Редді Кандакатла•Старший інженер MLOps у Ford Credit
Джейачандер Редді Кандакатла – старший інженер MLOps у Ford Credit та експерт-контриб’ютор…
Останні
-
Фінтех-засновник ділиться 5 цифрами, які показують, чи може ваш бізнес пережити спад
2 дні тому
-
Як зрозуміти, як насправді виглядає ваш бізнес онлайн – і зробити його ще кращим
2 дні тому
-
Цей 27-річний хлопець залишив Уолл-стріт, щоб створити продукт, який «повертає людям час». Він заробив 10 000 доларів за 36 годин.
2 дні тому
Залиште коментар. Будьте доброзичливі. Критикуйте ідеї, а не людей. Прочитайте наші правила спільноти
Схожий контент
ШІ полегшив виконання завдань. Він також змінив найважливішу роботу засновника.
Чому розумні лідери приймають погані рішення під тиском – і це не брак дисципліни
Як зрозуміти, як насправді виглядає ваш бізнес онлайн – і зробити його ще кращим
Фінтех-засновник ділиться 5 цифрами, які показують, чи може ваш бізнес пережити спад
Цей 27-річний хлопець залишив Уолл-стріт, щоб створити продукт, який «повертає людям час». Він заробив 10 000 доларів за 36 годин.
Емоційна стійкість – це стратегія лідерства, а не риса особистості. Ось як її розвивати.
Інформація підготовлена на основі матеріалів: www.entrepreneur.com
