Спеціалісти Waymo: ШІ-проект готовий, коли перевірено його ефективність, а не коли модель добре працює

Небагато компаній стикаються з вищими ставками при розгортанні ШІ, ніж Waymo — компанія з розробки безпілотних автомобілів, що входить до Alphabet та виділилася з Google. Її моделі не просто генерують текст чи автоматизують офісні завдання: вони допомагають транспортним засобам орієнтуватися на непередбачуваних вулицях, реагувати на дії водіїв-людей та приймати миттєві рішення у фізичному світі.
Однак методи, які Waymo використовує для управління цими ризиками — безперервна оцінка, ретельно підібрані дані, людський нагляд та чітко визначені бізнес-результати — пропонують ширший набір інструментів для підприємств, що розгортають ШІ-агентів майже в будь-якій галузі.
Манасі Джоші, директорка з інженерії системної інтелектуальності та машинного навчання Waymo, розповіла на VB Transform 2026, як компанія з розробки автономних транспортних засобів тренує, тестує та розгортає ШІ у великих масштабах. На сьогодні Waymo проїхала понад 220 мільйонів повністю автономних, або «тільки з пасажирами», миль, маючи у 17 разів менше серйозних травм у ДТП, ніж водії-люди на тій самій дистанції, за даними компанії.
Щоб досягти цих вражаючих результатів, Джоші зазначила, що Waymo прийняла так звану «розробку, керовану оцінкою» («eval-forced development») або «орієнтовану на оцінку розробку» («eval-centric development»), зробивши оцінку ключовою частиною інженерії, а не остаточною перевіркою перед розгортанням.
«Стадія, на якій перебувають наші проєкти, може бути легко визначена за рівнем зрілості оцінок, які вони демонструють», — сказала Джоші.
Практично Waymo оцінює готовність проєкту частково, досліджуючи зрілість тестів, пов’язаних з ним. Такий підхід має чіткі наслідки для підприємств, що створюють агентів підтримки клієнтів, помічників з написання коду, фінансових систем чи інших ШІ-додатків: якщо компанія не може надійно виміряти продуктивність системи, вона, можливо, ще не готова впроваджувати цю систему у виробництво.
Оцінки мають тривати після запуску
Джоші зазначила, що значна частина роботи Waymo з якості переключилася на оцінки, зокрема тести, проведені під час навчання моделі, після навчання та в симуляціях відкритого та закритого циклу.
«Оцінка — це не одноразове завдання для запуску моделі», — сказала вона.
Натомість Waymo розглядає оцінку як безперервний процес, що охоплює водіння, симуляцію та валідацію. Її методологія поєднує набори даних, показники ефективності та інфраструктуру, здатну ефективно працювати у великих масштабах.
Для підприємств це означає, що тестування агента перед запуском недостатньо. Команди повинні продовжувати оцінювати його, оскільки змінюються базові моделі, бізнес-процеси, поведінка користувачів та вхідні дані. Ці оцінки також повинні бути пов’язані з реальними бізнес-результатами, а не спиратися виключно на загальні галузеві показники.
Джоші попередила, що вимірювання якості моделі надійні лише настільки, наскільки надійні дані для оцінки, що стоять за ними. Тому Waymo супроводжує свої заяви про ефективність інформацією про властивості наборів даних, що використовуються для тестування її систем.
Тестування рідкісних та небезпечних випадків
Ієрархія оцінювання Waymo залишається обґрунтованою однією головною метою: безпекою.
Компанія використовує власні журнали водіння, деякі сторонні дані та реалістичні симуляції, які піддають її системи впливу сценаріїв, що охоплюють мільярди синтетичних миль. Власники завдань обирають спеціалізовані дані та метрики для ситуацій, пов’язаних з вразливими учасниками дорожнього руху, залізничними переїздами, будівельними зонами та іншими складними середовищами.
Той самий принцип застосовується і за межами автономного водіння. Підприємствам потрібно тестувати не тільки рутинні запити, з якими їхні агенти успішно справляються, але й незвичайні ситуації, де помилки можуть призвести до фінансових, юридичних, безпекових або репутаційних збитків.
Джоші наголосила, що Waymo не передає рішення про випуск повністю автоматизованим системам. Її огляди готовності до виробництва включають ретельний людський нагляд, тоді як внутрішні лідери з безпеки затверджують випуск програмного забезпечення та розширення зон обслуговування.
«Це не керується ШІ, повністю автоматизовано і без людського нагляду», — сказала вона. «На кону людські життя».
Ефективність не повинна досягатися за рахунок надійності
Waymo стикається з іншою проблемою, знайомою командам підприємств, що займаються ШІ: попит на обчислювальні потужності, сховище, пам’ять та мережеві ресурси зростає швидше, ніж доступні ресурси.
Компанія прагне до ефективності у вилученні та зберіганні даних, розподіленому навчанні моделей, дистиляції моделей, симуляції та оцінці. Вона також наголошує на «ефективності даних», обираючи найкорисніші навчальні приклади замість того, щоб розглядати більший обсяг як незмінно кращий.
Waymo почала використовувати трансформери у 2017 році, а згодом розширила їх застосування на великі мовні моделі, візуально-мовні моделі та візуально-мовні-дієві моделі. Джоші зазначила, що компанія зараз використовує генеративні мультимодальні моделі як частину своєї стратегії базових моделей.
Waymo розділяє свої технології між бортовими системами кожного транспортного засобу та позабортовою інфраструктурою, що використовується для розробки моделей, обробки даних та симуляції. Така комбінація змушує компанію оптимізувати як інференс у реальному часі, так і більші системи, що її підтримують.
Агенти потребують власних оцінок
Waymo також використовує ШІ-агентів як внутрішні інструменти для підвищення продуктивності інженерів. Джоші сказала, що агенти допомагають аналізувати розподіли даних, оцінювати ефективність даних та вирішувати проблеми, виявлені в телеметрії транспортних засобів, навчальних запусках та невдалих завданнях з оцінки.
Мета полягає в прискоренні роботи з розслідування, щоб інженери могли приділяти більше часу судженням та складним технічним проблемам. Але Waymo також оцінює цих агентів, щоб переконатися, що вони надають надійні, точні результати, а не спрямовують співробітників на непродуктивні шляхи.
Для керівників підприємств головний урок від Waymo полягає в тому, що агентний ШІ вимагає більше, ніж просто вибір потужної моделі. Організаціям потрібен чітко визначений об’єкт, репрезентативні дані для оцінки, безперервне тестування, інфраструктура, яка може працювати ефективно, та призначені людські особи, які залишаються відповідальними за розгортання.
«Завоювання довіри є надзвичайно важливим», — сказала Джоші.
За даними порталу: venturebeat.com
