Голосовий штучний інтелект став однією з найпопулярніших областей штучного інтелекту, оскільки інвестори вкладають мільярди доларів у сценарії використання, починаючи від автоматизації підтримки клієнтів і продажів до створення нотаток для зустрічей і розробки розумних окулярів штучного інтелекту, які використовують голос як основну поверхню взаємодії. Тим часом лабораторії штучного інтелекту швидко випускають моделі, а виробники апаратного забезпечення […]
Голосовий штучний інтелект став однією з найпопулярніших областей штучного інтелекту, оскільки інвестори вкладають мільярди доларів у сценарії використання, починаючи від автоматизації підтримки клієнтів і продажів до створення нотаток для зустрічей і розробки розумних окулярів штучного інтелекту, які використовують голос як основну поверхню взаємодії.
Тим часом лабораторії штучного інтелекту швидко випускають моделі, а виробники апаратного забезпечення намагаються створити для споживачів найкращий досвід взаємодії з їхніми пристроями.
Усі ці нові технології потребують зворотного зв’язку для тестування та вдосконалення. Ісландський стартап Treble прагне бути в центрі індустрії голосового штучного інтелекту, створивши платформу моделювання, яка може вмістити виробників моделей, робототехнічних компаній і виробників побутового обладнання.
Заснована в 2020 році інженерами-акустиками Фіннуром Піндом і Джеспером Педерсеном, компанія залучила 18 мільйонів доларів у рамках розширеного фінансування серії A під керівництвом Paladin Capital Group за участю існуючих інвесторів KOMPAS VC, Frumtak Ventures, EIC і Omega ehf. У 2024 році компанія отримала інвестиції в розмірі 12 мільйонів доларів США, в результаті чого загальний обсяг її фінансування на сьогодні перевищив 40 мільйонів доларів. Клієнтами стартапу є Amazon і Logitech.

Treble має кілька областей, пов’язаних із моделюванням і даними. Для компаній, що займаються голосовим штучним інтелектом, він має платформу генерації синтетичних даних, яку можна використовувати для покращення мови, придушення шуму та навчання моделі. Він також оцінює моделі голосового штучного інтелекту за різних умов і надає відгуки лабораторії. Раніше цього року компанія співпрацювала з Hugging Face, щоб розпочати порівняльний аналіз моделі розпізнавання мовлення в різних реалістичних умовах.
“Штучний інтелект зі звуком — це справді виклик даних, і саме тут у нас є найкращий шанс створити наступне покоління моделей і апаратного забезпечення. На сьогоднішній день майже весь штучний інтелект, пов’язаний зі звуком, створено із записів і даних, зібраних з Інтернету. Ми віримо, що точне фізичне моделювання може бути альтернативним способом створення даних для звуку”, — сказав Піндо TechCrunch.
Стартап також зосереджується на розробці обладнання та тестуванні з точки зору аудіо. Наприклад, ми працюємо з компаніями, що випускають навушники та колонки, щоб створити віртуальні прототипи, щоб допомогти їм зрозуміти, як звучатиме їхня продукція. Ви також можете перевірити, як ваш розумний динамік може розуміти команди на основі розташування динаміка. Нещодавно Treble почав пропонувати симуляційне тестування для розумних окулярів і пристроїв зі штучним інтелектом.
Пінд сказав, що компанія рада працювати над розробкою носимих пристроїв, які можуть покращити слух користувачів.
«Я дуже в захваті від таких пристроїв нового покоління, як навушники та розумні окуляри. [a feature like] Надлюдський слух. Це область, де ви можете чути краще навіть у складних акустичних середовищах. Можливо, ви перебуваєте в ресторані й хочете чути лише людей у радіусі 2 метрів. Або, можливо, ви відвідуєте семінар і хочете вимкнути звук усіх навколо. – сказав він.
Treble посилює свою увагу до фізичного штучного інтелекту, включаючи робототехніку, автомобілебудування та компанії, що займаються виробництвом дронів, і прагне надати цим компаніям звукові можливості за допомогою тестування та моделювання.
Франсуа Рютер, віце-президент Paladin Capital Group, розповів TechCrunch, що платформа Treble, яка імітує різноманітні моделі та пристрої, виділяється. Оскільки задіяно більше областей, важливість платформи зростає.
“Наш аргумент полягає в тому, що в міру того, як все більше продуктів покладається на розуміння звуку, ця інфраструктура ставатиме все більш цінною для голосового штучного інтелекту, пристроїв, що носяться, робототехніки та фізичного штучного інтелекту. Клієнти можуть зберігати власність на свої моделі, продукти та робочі процеси розробки, водночас одержуючи вигоду від спільного фундаменту рівнів рідної акустичної інфраструктури моделювання”, – сказав Рютер.
Якщо ви купуєте за посиланнями в наших статтях, ми можемо отримати невелику комісію. Це не впливає на редакційну незалежність.