Vals прагне стати золотим стандартом у тестуванні ШІ

Vals прагне стати золотим стандартом у тестуванні ШІ 2

Тестування продуктивності (бенчмаркінг) стало галузевою нормою для компаній, що розробляють штучний інтелект (ШІ). Воно допомагає їм підтверджувати можливості своїх моделей, виділятися на тлі конкурентів та рекламувати свою перевагу. Іншими словами, добрі результати бенчмаркінгу зазвичай означають добрий PR.

На жаль, компанії також навчилися обходити застарілі системи тестування. Багато з них є старими і не пристосованими для вимірювання можливостей сучасних моделей.

Стартап Vals, заснований у 2024 році, прагне виправити цю недосконалу систему. Менш ніж за два роки компанія стала помітною в технологічній індустрії. Минулого року вона залучила початкове фінансування від 8VC та Bloomberg Beta. А минулого місяця, після періоду швидкого зростання, Vals отримала 40 мільйонів доларів у рамках раунду серії А під керівництвом Andreessen Horowitz.

Співзасновнику компанії, 25-річному Раяну Крішнану, раніше довелося стажуватися в Palantir. Ще студентом Стенфорду він працював на Microsoft та у шанованій лабораторії штучного інтелекту цього університету. Крішнан каже, що ідея Vals виникла з його власних спостережень про те, як тестування відстає від прогресу галузі, яку воно покликане вимірювати.

«Ми спостерігали, як на ринок швидко виходять нові, дуже потужні моделі, а академічні тести не встигають за цим прогресом», — розповідає Крішнан. Він зазначив, що оскільки ШІ інтегрується в усі сфери суспільства, тести повинні справді перевіряти, чи можуть моделі робити те, що компанії рекламують.

Минулого тижня молодий засновник показав мені двоповерховий офіс своєї компанії на вулиці Фолсом у Сан-Франциско. Це стара цегляна будівля, яка століття тому була пивоварнею. Замість промислового виробництва пива, історична споруда нині є домом для низки стартапів, що прагнуть формувати майбутнє технологічної індустрії.

«Історично, я думаю, оцінка проводилася в дуже абстрактний спосіб, — каже Крішнан. — Наприклад, чи знають моделі достатньо інформації, щоб скласти іспит типу адвокатського?»

Тут Vals прагне відрізнятися. Хоча багато систем тестування пропонують загальнодоступні завдання (що дозволяє компанії тренувати свої моделі проти цих тестів, фактично списуючи), Vals не розкриває своїх конкретних тестових матеріалів. Замість того, щоб вимірювати загальні знання моделі ШІ, Vals також оцінює моделі за їхньою здатністю виконувати складні завдання, пов’язані з конкретними галузями, такими як право, фінанси та програмування.

«Насправді ми розглядаємо реальний вплив моделей, — сказав Крішнан. — Чи можуть вони виконувати роботу, яка створює продукт такої ж якості, як людина, у кожній сфері?»

Ідея полягає в тому, щоб перевірити не лише позитивні, а й негативні наслідки, каже він. Сподівання полягає в тому, щоб проаналізувати, «якщо ці моделі вийдуть з-під контролю у світі, якими будуть негативні наслідки».

Можливості, які вимірює Vals, зростають. Окрім традиційних галузей, стартап продовжує освоювати більш унікальні напрямки. «Ми маємо тест на рекурсивне самовдосконалення. Ми працюємо над проблемами психічного здоров’я, кібербезпеки, біобезпеки і навіть права збройних конфліктів, щоб моделі розуміли, як застосовувати Женевські конвенції», — ділиться Крішнан.

Компанії платять Vals за тестування своїх моделей, що може здатися дивним. Навіщо компанії платити за те, щоб дізнатися, що її модель працює погано? Але ефективне вимірювання допомагає компаніям виявляти та усувати несправності й вдосконалюватися з часом. Крішнан порівнює їхню модель доходу з тим, як студент може заплатити College Board за складання SAT.

У свою чергу, ці оцінки стають ключовими факторами прийняття рішень для компаній, які прагнуть придбати нові моделі ШІ.

Стартап нещодавно повідомив, що його дохід зараз у вісім разів перевищує торішній. Штат також зростає. Vals, який на початку року налічував лише вісім осіб, вже зріс до 25 співробітників. Крішнан сказав, що в міру зростання стартапу планується переїзд до значно більшого офісу, а також наймання ще 10-15 осіб. Компанія також нещодавно запустила програму, спрямовану на надання послуг з оцінки моделей федеральним агентствам.

Крішнан вважає систему бенчмаркінгу його компанії майбутнім того, як компанії ШІ мислитимуть про розвиток свого бізнесу та встановлення громадської довіри.

«Компанії ШІ починають виходити на публічний ринок. SpaceX стала публічною. Anthropic планує це зробити пізніше цього року. Я підозрюю, що OpenAI скоро стане публічною. Я думаю, що оскільки моделі ШІ стають основним елементом економіки та ширше поширюються, типи тестів та оцінок, які ми проводимо, будуть стимулювати їх використання і стануть центральною частиною того, як ці компанії подають публічні звіти або говорять про майбутні інвестиції, які вони зроблять у ШІ», — сказав він.

Дізнатися більше на: techcrunch.com

Поділитися новиною:TelegramViberFacebook
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *