Думки, висловлені дописувачами Entrepreneur, є їх власними.

Важливі моменти

  • Впровадження нового інструменту штучного інтелекту кожного разу, коли ви робите невелике оновлення, насправді може стати гіршим. Оскільки після всієї роботи над новою моделлю клієнт може навіть не побачити покращення.
  • Технічно хороші моделі не призводять автоматично до бізнес-рішень.

Засновники часто вважають, що будь-яке вдосконалення точності моделі штучного інтелекту заслуговує на виробництво. Але якщо взяти до уваги зусилля з тестування, розгортання, моніторингу та розробки, розгортання трохи кращої моделі може призвести до гірших бізнес-результатів.

Уявіть, що ваша команда AI навчила нову модель, яка працює на 0,2% краще, ніж версія, яка зараз обслуговує клієнтів. Природно, дослідники даних були щасливі, і автоматизований конвеєр позначив кандидата як хорошого, змусивши всіх повірити, що існуючу модель слід негайно замінити. Але тоді починається справжня виробнича робота.

Кандидати повинні пройти суворе тестування безпеки та інтеграції, перш ніж наші інженери зможуть упакувати його, розгорнути в тестовому середовищі та перевірити його роботу. Крім того, командам може знадобитися виконати тіньові або канаркові випуски, оновити правила моніторингу, задокументувати зміни та підготувати комплексні плани відкату. До моменту, коли ця нова модель нарешті буде комерціалізована, компанія витратила значно більше, ніж початкові витрати на навчання, і клієнти можуть навіть не помітити покращення.

Це підкреслює одну з найбільш дорогих помилок у прикладному штучному інтелекті. Технічно хороша модель не означає автоматично прийнятне бізнес-рішення.

Точність і бізнес-цінність – це не одне й те саме

Точність вимірює технічну продуктивність, а бізнес-цінність визначає, чи справді ця продуктивність покращує результати, які цінує компанія.

Розглянемо дві різні системи ШІ. По-перше, це виявлення потенційно шахрайських фінансових операцій. У цьому випадку невелике збільшення кількості відкликань може допомогти виявити подальше шахрайство, запобігти втратам і захистити клієнтів. У цьому сценарії високих ставок навіть частка відсотка може створити значну цінність, оскільки система обробляє мільйони транзакцій.

І навпаки, уявіть собі другу систему, яка підсумовує запити внутрішньої служби підтримки. Подібні покращення офлайн-метрик тут можуть бути статистично дійсними, але залишаються практично непомітними в повсякденних операціях. Працівники навряд чи закінчать роботу значно раніше. Іншими словами, не можна очікувати зменшення витрат компанії на підтримку. Хоча технічні вдосконалення подібні в обох сценаріях, економічна цінність дуже різна.

Перш ніж затвердити нову модель, вам потрібно визначити, скільки насправді коштує одиниця вдосконалення. Його значення можна виразити так:

  • Уникайте шахрайства
  • Конвертовано додаткові покупки
  • Економія робочого часу співробітників
  • Запобігайте скаргам клієнтів
  • Зменшена помилка передбачення
  • Усунення ручних оглядів

Якщо команда не може пов’язати покращену точність моделі з одним із цих відчутних результатів, компанія ще не має достатньо інформації, щоб виправдати випуск.

Розрахуйте загальну вартість оновлення моделі

Багато компаній неправильно розраховують вартість оновлень штучного інтелекту, розглядаючи лише навчальні обчислення. Це все одно, що оцінити вартість відкриття ресторану, порахувавши лише ціну духовки. Навчання – це лише частина набагато більшої системи.

Як підкреслює наше дослідження прихованої технічної заборгованості в системах машинного навчання, код моделі є лише невеликою частиною робочої системи ШІ. Залежності даних, тестування, моніторинг і підтримка інфраструктури створюють значну довгострокову складність. Крім того, система результатів тестування ML від Google показує, що готовність до виробництва залежить від набагато більшої кількості факторів, ніж показник якості моделі в режимі офлайн.

Реалістичний розрахунок вартості повинен включати:

  • Підготовка та перевірка даних
  • Модельне навчання та експериментування
  • Тестування безпеки та конфіденційності
  • Оцінка справедливості чи надійності
  • Створення контейнера або пакета
  • Сканування залежностей і вразливостей
  • Інтеграційний тест
  • Забезпечення інфраструктури
  • Тіньовий або канарковий тест
  • Моніторинг змін
  • Документація та погодження
  • інженерний огляд
  • Інциденти та ризики відкату
  • Потенційна плутанина клієнтів

Ця різниця дуже важлива, оскільки автоматизовані навчальні конвеєри можуть зробити експерименти штучно дешевими. Часто це справді дорога робота задній Навчання відбувається одразу після того, як кандидат починає процес випуску продукту.

У моєму рецензованому дослідженні IEEE Access щодо показників ефективності перепідготовки я дослідив дуже актуальне питання. Коли організації повинні просувати нещодавно навчені моделі прогнозування, а не підтримувати існуючі моделі прогнозування?

Після оцінки 2320 контрольованих прогонів чотирьох загальнодоступних наборів даних часових рядів і чотирьох прогнозних архітектур результати були очевидними. Організаціям не потрібно вибирати між постійним випуском нових моделей і залишенням старих моделей на невизначений термін. Натомість вибіркова політика просування дозволяє підтримувати поточну модель, якщо очікувані покращення надто малі, і затверджувати нову модель, лише якщо переваги виправдовують експлуатаційні витрати.

Засновники можуть застосувати цей принцип без впровадження складної математичної системи, просто вимагаючи від своїх команд відповіді на чотири ключові запитання перед випуском моделі.

1. Чи покращила ця модель результати, пов’язані з бізнесом? Не сприймайте «оцінки підвищилися» як повну відповідь. Вони хочуть знати, які показники покращилися, чому ці показники важливі та чи безпосередньо вони корелюють із клієнтськими чи операційними результатами. Удосконалення лабораторних тестів часто не призводить до реальних переваг у виробництві.

2. Чи помітить клієнт або оперативний персонал різницю? Навіть технічно вимірні зміни можуть бути комерційно незначними. Оцініть кількість рішень, користувачів і транзакцій, на які вплине ваша зміна, і розрахуйте, чи значно покращить вона дохід, ризик, вартість, швидкість або загальний рівень обслуговування клієнтів.

3. Яка загальна вартість випуску? Це має включати навчання, тестування, перевірки безпеки, впровадження, моніторинг та інженерні зусилля. Важливо також враховувати альтернативні витрати. Кожна година, витрачена на випуск дещо кращої моделі, — це час, який не можна використати для вдосконалення основного продукту, вирішення проблем із надійністю чи створення дуже затребуваних функцій.

4. Чи виправдовує покращення витрати та додатковий ризик? Порівняйте очікувану вартість покращення із загальною вартістю випуску. Компанії повинні просувати кандидатів, лише якщо відповідь однозначна «так». Коли економічне обґрунтування є невизначеним, дисциплінований вибір полягає в тому, щоб зберегти поточну модель, зібрати більше доказів і переоцінити пізніше.

Збереження поточної моделі може бути дисциплінованим рішенням

Команди штучного інтелекту часто отримують винагороду за випуск нових моделей, тому підтримка існуючих моделей може створити хибне враження стагнації. Насправді підтримка моделі, яка вже відповідає очікуванням клієнтів, має передбачувані витрати та відомий профіль ризику, часто є мудрішим інженерним вибором.

Нова модель вносить невизначеність, незважаючи на її кращий результат офлайн. Він може вийти з ладу через незвичайні вхідні дані, заплутати нижчі системи або створити нові помилки. Це означає модель розвитку і модель просування по службі Це потрібно розглядати як абсолютно окреме рішення. Команди повинні продовжувати експериментувати та навчати кандидатів, не відчуваючи обов’язку штовхати всіх «переможців» у виробництво.

Засновники дотримуються суворої фінансової дисципліни при наймі та розробці продукту. Релізи штучного інтелекту заслуговують на таку ж пильну увагу. Кожна нова модель потребує капіталу, оперативної уваги та інженерної пропускної здатності, тому вона має приносити відчутні переваги.

Щоб забезпечити це, вимагайте простого запису кожного запропонованого випуску з детальним описом технічних удосконалень, очікуваної бізнес-цінності, повної вартості впровадження та нових ризиків. Згодом ця документація покаже, які оновлення додають реальну цінність, а які покращують зовнішній вигляд внутрішніх інформаційних панелей.

Кінцева мета полягає не в тому, щоб придушити інновації, а в тому, щоб спрямувати їх на результати, які дійсно відчувають клієнти та компанії. Наступного разу, коли ваша команда штучного інтелекту представить більш точну модель, не питайте просто, чи вона краща. запитай, чи так досить добре.

Важливі моменти

  • Впровадження нового інструменту штучного інтелекту кожного разу, коли ви робите невелике оновлення, насправді може стати гіршим. Оскільки після всієї роботи над новою моделлю клієнт може навіть не побачити покращення.
  • Технічно хороші моделі не призводять автоматично до бізнес-рішень.

Засновники часто вважають, що будь-яке вдосконалення точності моделі штучного інтелекту заслуговує на виробництво. Але якщо взяти до уваги зусилля з тестування, розгортання, моніторингу та розробки, розгортання трохи кращої моделі може призвести до гірших бізнес-результатів.

Уявіть, що ваша команда AI навчила нову модель, яка працює на 0,2% краще, ніж версія, яка зараз обслуговує клієнтів. Природно, дослідники даних були щасливі, і автоматизований конвеєр позначив кандидата як хорошого, змусивши всіх повірити, що існуючу модель слід негайно замінити. Але тоді починається справжня виробнича робота.

Кандидати повинні пройти суворе тестування безпеки та інтеграції, перш ніж наші інженери зможуть упакувати його, розгорнути в тестовому середовищі та перевірити його роботу. Крім того, командам може знадобитися виконати тіньові або канаркові випуски, оновити правила моніторингу, задокументувати зміни та підготувати комплексні плани відкату. До моменту, коли ця нова модель нарешті буде комерціалізована, компанія витратила значно більше, ніж початкові витрати на навчання, і клієнти можуть навіть не помітити покращення.