Kog поглиблює свої розробки для максимального використання потужності GPU

Kog поглиблює свої розробки для максимального використання потужності GPU 2

Триває гонитва за прискоренням роботи штучного інтелекту (ШІ), і ринки тепло зустріли компанію Cerebras та її спеціалізовані чипи під час дебютного виходу на біржу у травні. Однак французький стартап Kog робить ставку на те, що з традиційних графічних процесорів (GPU) можна витиснути значно більше потужності.

У травні стартап потрапив на першу сторінку Hacker News з технічним попереднім переглядом, покликаним довести, що “надзвичайно швидке декодування для одного запиту можливе на стандартних датацентрових GPU, якими вже володіють підприємства”. Для свого демо-тестування Kog використовувала GPU AMD MI300X та Nvidia H200.

Дехто був розчарований, дізнавшись, що це не стосується GPU у ноутбуках, але інші побачили потенціал. Оскільки швидкість та вартість інференсу (висновку) тепер є критичним вузьким місцем, обіцянка Kog розкрити нові можливості на наявному обладнанні за допомогою оптимізації програмного забезпечення привернула увагу не лише спостерігачів. “Ми отримали 200 реальних бізнес-запитів”, – розповів TechCrunch генеральний директор Ґаель Делелло.

Виходячи з первинних відгуків, засновник-одинак очікує, що розробка програмного забезпечення стане першим напрямком використання. Досвідчені користувачі Claude Code добре знають, що іноді їм доводиться чекати годинами, щоб отримати результати. Anthropic сама розуміє, що швидкість коштує грошей, і встановлює багаторазову ціну за “швидкий режим” Claude.

Kog сподівається залучити клієнтів, яких відлякують такі затримки, зазвичай тому, що вони покладаються на робочі процеси ШІ для професійних завдань. Але стартап також має партнерів з розробки, які дозволяють користувачам створювати ігри та додатки за допомогою одного запиту, і для яких швидший результат завдяки Kog Inference Engine (KIE) означав би більший дохід, зазначив Делелло.

Компанія усвідомлює, що цей ринок ще не є зрілим. Спостерігаючи за попитом, Kog з’ясувала, що її потенційні клієнти не готові до тонкого налаштування невеликих моделей. “І саме тому з моменту запуску ми повністю зосередилися на прискоренні розробки більших моделей, щоб задовольнити побачений попит”.

Це ставить перед Kog величезне завдання – реалізувати свою обіцянку “прискорення інференсу LLM у 30 разів”. Їхнє демо показало вражаючі 3000 токенів за запит на секунду (TPS), але з оптимізованою невеликою моделлю лише з приблизно 2 мільярдами параметрів – Laneformer 2B, яка тепер є у відкритому доступі.

Всупереч скептикам, Делелло впевнений, що такий самий підхід може так само добре працювати з LLM, розмір яких може бути викликом для чипів інференсу. “У GPU світле майбутнє”, – сказав він. Для генерального директора Kog ідея про те, що вони не дуже придатні для декодування, стала хибним уявленням; новіші GPU мають все більшу пропускну здатність пам’яті, яку лише потрібно розблокувати.

Kog не самотня у думці, що оптимізація програмного забезпечення може допомогти GPU робити більше, ніж зазначено на упаковці. ZML, також з Франції, випустила апаратне незалежне програмне забезпечення, яке обходить Nvidia CUDA для підтримки швидкого інференсу на конкуруючих чипах. Але Делелло зазначив, що Kog більше схожа на лабораторію Hazy Research Стенфордського університету, з ще глибшим фокусом на прискоренні GPU.

Сам Делелло не є дослідником, і його перший стартап Stribe, який брав участь у TechCrunch50 2009, не має нічого спільного з його новим бізнесом – окрім його колишнього співзасновника, який став венчурним капіталістом, Камеля Зеруала, чия фірма Varsity VC спільно очолила посівний раунд Kog.

Отримавши освіту з фізики твердого тіла у французькій École Polytechnique, він пішов працювати в галузь наступальної кібербезпеки, також відомої як “білий хакінг”. За словами Делелло, це сформувало спосіб мислення, який він зараз заохочує впроваджувати у своїй команді. З наукового боку, “існує такий підхід до розуміння законів фізики та законів GPU, щоб максимально їх використовувати”.

Щодо хакінгу, чотириразовий фіналіст турніру CTF на DEFCON сказав, що це навчило його “зворотно проєктувати речі на дуже низькому рівні – аж до мови асемблера та двійкового коду – щоб зрозуміти, як це працює, і спробувати використати це для досягнення мети, для якої воно не було обов’язково призначене”.

Недоліком такого підходу є те, що він вимагає багато ручної роботи і займає багато часу. “Для кожного нового GPU ми присвячуємо кілька тижнів або навіть місяців, щоб глибоко зануритися в деталі та провести дослідження інженерії GPU на цьому обладнанні”. З командою з 11 осіб це обмежує кількість чипів, з якими Kog може працювати, принаймні у найближчому майбутньому.

У довгостроковій перспективі Kog сподівається інтегрувати свою методологію в агентські конвеєри, які дозволять їй підтримувати більше чипів та моделей. Оскільки Європа прагне розбудувати власні можливості в цих двох напрямках, це може надати стартапу переваги суверенітету, адже він вже підтримується Scaleway та отримує фінансування від Bpifrance (Франція) та програми French Tech 2030.

Однак поки що Kog потрібно довести світу, що її підхід працює з LLM. Це також буде ключовим для залучення додаткового фінансування. “Як тільки ми реалізуємо нашу першу велику модель зі швидкістю в 10 разів вищою, що, на мою думку, станеться у вересні, ми зможемо почати демонструвати залученість клієнтів і звідти підняти наш раунд серії А”, – сказав Делелло.

Дізнатися більше на: techcrunch.com

Поділитися новиною:TelegramViberFacebook
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *