Порівняльний аналіз став галузевим стандартом для того, як компанії штучного інтелекту перевіряють функціональність моделі, виділяються серед конкурентів і рекламують свої переваги, коли показники змінюються на їхню користь. Іншими словами, хороший бенчмаркінг майже завжди означає хороший PR.

На жаль, компанії також придумали, як перехитрити традиційні системи порівняльного аналізу. Багато з них старі та не створені для вимірювання можливостей сучасних моделей.

Vals, стартап, заснований у 2024 році, каже, що його місія полягає в тому, щоб виправити цю дуже недосконалу систему. Менш ніж за два роки компанія зарекомендувала себе як сила, з якою слід рахуватися в галузі технологій, і минулого року успішно забезпечила початковий раунд під керівництвом 8VC і Bloomberg Beta. Після стрімкого зростання минулого місяця компанія залучила 40 мільйонів доларів у Серії А під керівництвом Андріссена Горовіца.

Співзасновниця компанії, 25-річна Раянне Крішнан, раніше проходила стажування в Palantir і працювала студентом Стенфордського університету в Microsoft і шкільній лабораторії штучного інтелекту. Крішнан сказав, що Валс народився з його власних спостережень про те, як еталонні показники відстають від прогресу галузей, для вимірювання яких вони були розроблені.

«Ми спостерігали низку високопродуктивних нових моделей, які швидко надходили на ринок і встановлювали академічні стандарти. [were] Оскільки штучний інтелект інтегрований у кожну частину суспільства, Крішнан сказав, що дійсно потрібні критерії, щоб підтвердити, що моделі можуть робити те, що компанії рекламують.

Минулого тижня молодий засновник провів для мене екскурсію двоповерховим офісом своєї компанії на Фолсом-стріт у Сан-Франциско. Ця стара цегляна будівля сторіччя тому була місцем великої пивоварні. Тепер ця історична будівля більше не є місцем промислового виробництва пива, а домом для різноманітних компаній-початківців, які прагнуть побудувати майбутнє індустрії технологій.

«Я думаю, що історично склалося так, що оцінювання інтелекту проводилося дуже абстрактно», — сказав мені Крішнан. «Наприклад, чи знає модель достатньо інформації, щоб скласти тест на адвокатський іспит?»

Тут Вальс намагається виділитися. Хоча багато систем порівняльного аналізу пропонують загальнодоступні тести (що дозволяє компаніям тренувати моделі за цими тестами та, можливо, шахраювати на іспитах), Vals не публікує свої конкретні тестові матеріали. Замість того, щоб вимірювати загальні знання моделей штучного інтелекту, Vals також оцінює моделі за їх здатністю виконувати складні завдання, пов’язані з конкретними галузями, такими як право, фінанси та кодування.

«Те, що ми робимо, — це фактично розглядати реальний вплив моделі», — сказав Крішнан. «Чи можемо ми працювати, щоб виробляти продукти такої ж якості, як і люди, у всіх сферах?»

Ідея полягає в тому, щоб перевірити негативні результати, а також позитивні, каже він. Очікується аналіз того, «який негативний вплив матиме місце, якщо ці моделі вийдуть з-під контролю в усьому світі?»

Можливості, які оцінює Vals, зростають. На додаток до більш традиційних галузей, стартап продовжує розширюватися в більш унікальних областях. “У нас є орієнтири для рефлексивного самовдосконалення. Ми працюємо над моделями для розуміння того, як застосовувати Женевські конвенції щодо психічного здоров’я, кібербезпеки, біозахисту та навіть права збройних конфліктів”, – каже Крішнан.

Компанії платять Vals за тестування їхніх моделей, що може бути дивною концепцією. Навіщо компаніям платити, щоб дізнатися, що їхні моделі не працюють? Але наявність ефективних вимірювань може допомогти компаніям усунути неполадки та покращити їх з часом. Крішнан порівнює їхню модель доходів із тим, як студенти платять радам коледжів за складання SAT.

Крім того, ці оцінки стали важливими факторами прийняття рішень для компаній, які прагнуть придбати нові моделі ШІ.

Нещодавно стартап повідомив, що його дохід у вісім разів перевищує минулорічний. Також збільшується чисельність персоналу. Команда Валса, яка почала цього року лише з восьми гравців, уже потроїлася до 25 гравців. У міру зростання стартапу Крішнан сказав, що планує переїхати у більший офіс і найняти ще 10-15 людей. Компанія також нещодавно запустила програму, зосереджену на наданні оцінки моделей федеральним агентствам.

Крішнан вважає, що його система порівняльного аналізу — це майбутнє того, як компанії зі штучним інтелектом думають про розвиток свого бізнесу та зміцнення суспільної довіри.

«Компанії штучного інтелекту починають виходити на біржу. SpaceX стала публічною, Anthropic заплановано на кінець цього року, і я думаю, що OpenAI також незабаром стане публічною. Оскільки моделі штучного інтелекту стають основою економіки та набувають більшого поширення, типи тестів і оцінок, які ми робимо, стимулюватимуть їх використання та стануть основою того, як ці компанії подають публічні пропозиції та говорять про майбутні інвестиції в штучний інтелект».

Якщо ви робите покупку за посиланнями в наших статтях, ми можемо отримати невелику комісію. Це не впливає на редакційну незалежність.