Claude Opus 5.5 забезпечує продуктивність Fable 5.1 і на 40% нижчу вартість – ZDNETЕліза Беттерс Пікаро/ZDNET

Важливі моменти ZDNET

  • Claude Opus 5.5 може бути дуже корисним для досвідчених користувачів.
  • Можливо, розробники зможуть кодувати швидше за меншу кількість кроків.
  • Anthropic каже, що оновлення є безпечнішим, дешевшим і менш зайвим.

Менш ніж через два місяці після випуску Claude Opus 5 Anthropic повернувся з Opus 5.5. Найбільшою перевагою Opus 5 було те, що він пропонував «майже казкову» продуктивність за половину ціни. Наш заголовок полягає в тому, що наш флагманський AI Opus 5.5 тепер забезпечує продуктивність Fable 5.1 для більшості завдань, зменшуючи витрати на виконання приблизно на 40%.

«Наші клієнти використовують Box AI для величезної кількості контенту, тому швидкість і вартість є головними пріоритетами», — повідомляє Яшодха Бхавнані, віце-президент із продуктів AI у Box. «У нашій оцінці Claude Opus 5.5 використовував третину маркерів, які використовував Opus 5, і його відповіді були на 40% надлишковими без шкоди для точності. Ми очікуємо, що це буде дуже важливо для команд, які керують агентами через вміст у таких сферах, як фінансові послуги та державний сектор».

Anthropic каже, що «найближчими тижнями також випустить Claude Sonnet 5.5 і Haiku 5.5». Opus 5.5 вже доступний.

Я широко використовую Claude Code зі своїм Opus 5, тому особливо сподіваюся, що заявки компанії щодо продуктивності є точними. Компанія заявляє, що може «виробляти продукцію більш ніж на 30% швидше, ніж Opus 5».

Пов’язана стаття: Anthropic об’єднує Claude Chat і Cowork в одне ціле

Ціни на токени та плани передплати розглядаються в сьогоднішньому оголошенні. Ціна токена буде на 20% нижчою, ніж при використанні з Opus 5. Повідомляється також, що Opus 5.5 «вимагає менше токенів для створення робіт вищої якості».

Для користувачів підписки, таких як я, Anthropic збільшує 5-годинний ліміт використання на 20%. По суті, це означає збільшення вашого бензобака на 20% залежно від того, скільки штучного інтелекту ви можете використати протягом 5 годин. Мій план Max не скидається часто, але іноді скидається. Для тих, хто має тарифний план 20 доларів США на місяць, це може бути значною перевагою. Крім того, компанія каже, що оскільки Opus 5.5 дешевший за Opus 5, вона ще більше посилить 5-годинний і тижневий ліміт використання.

Це здається додатковим. Відро на 20% більше і горить на 25% повільніше. Це означає, що ефективне використання Opus 5.5 збільшить вашу продуктивність приблизно на 50%. Це не суттєве покращення якості життя.

Anthropic також каже, що Opus 5.5 спілкується більш природно, ніж попередні моделі. Я був би радий, якби це було трохи менше принизливо. У деяких випадках Opus може бути повністю зіпсований, особливо якщо щось зробити не так.

Пов’язана стаття: Новий тест CAIS показує найбільш шахрайські моделі ШІ

«Багатослівний і заплутаний вихід був моєю найбільшою скаргою щодо моделі Frontier, і Claude Opus 5.5 вирішує це», — говорить Джон Руелас, штатний інженер програмного забезпечення Ramp.

Opus 5.5 “пише, як хороший колега, і дотримується наших правил написання. Специфікація дизайну тепер доступна з мінімальними редагуваннями, і коли я переписав одне з підказок, я віддав перевагу цій версії своїй власній. Коли набір тестів було оптимізовано, я міг легко слідувати цим міркуванням і впевнено відправляти зміни”.

Пройти кордон

Говорячи про те, щоб зробити щось не так, друга половина анонсу Anthropic полягає в тому, що Opus 5.5 стане кращим громадянином ШІ.

Посилаючись на публікацію в блозі генерального директора Даріо Амодея про уповільнення темпів розвитку можливостей штучного інтелекту, Anthropic досяг значних успіхів у серії найкращих практик Opus 5.5, які включають «велике тестування налаштування, передрелізну оцінку зовнішніми організаціями та заходи безпеки в сферах високого ризику, таких як кібербезпека та біологія».

Пов’язана стаття: Чому позиція Міністерства юстиції щодо авторського права OpenAI є реальною загрозою

Вирівнювання — це термін ШІ, який допомагає визначити, наскільки ШІ схильний до шахрайства. Anthropic каже, що Opus 5.5 є «найефективнішою моделлю, яку ми тестували на сьогоднішній день, з особливими покращеннями в кількох поведінках, які сприяли нещодавнім інцидентам кібербезпеки, включаючи упереджені висновки та спроби втечі з пісочниці».

Компанія заявила, що використовувала зовнішніх постачальників тестування разом із «захистами, подібними до Fable 5.1, у сфері кібербезпеки, біології та передової розробки LLM».

Якщо заходи безпеки спрацьовують, запити до штучного інтелекту відновляться з рівня Opus 5.5 до Opus 4.8. На практиці більшість завдань з кібербезпеки переносяться в Opus 4.8, тоді як запити, пов’язані з біологією та розробкою LLM, надсилаються в Opus 5.

Пов’язана стаття: AI зруйнував вашу кар’єрну драбину – 6 нових шляхів до вершини

Вибрані «перевірені організації» тепер можуть подати заявку на участь у Програмі перевірки наук про життя Anthropic, щоб отримати кращий доступ до біологічних досліджень. Користувачі, чия робота з кібербезпеки була схвалена через програму кіберперевірки Anthropic, зможуть почати використовувати Opus 5.5 найближчими тижнями.

Розкриття інформації: Мене особисто схвалили взяти участь у Програмі кіберперевірки в рамках моєї роботи поза ZDNET із захисту національної інфраструктури.

Досвід клієнтів

Маріо Родрігес, директор із продуктів GitHub, сказав про новий випуск: «Розробникам потрібні агенти, які можуть взяти на себе та виконати реальну програмну роботу. У тестах GitHub Copilot CLI та VS Code Claude Opus 5.5 використовувався серед найменшої кількості виміряних токенів і кроків. VS Code використовує більше терміналів, ніж Opus 5, менш ніж за половину кроків. Ми вирішили це завдання. Ми не тільки робимо окремі завдання більш ефективними, але й робимо великі проекти більш досяжними для розробників».

Карл Беннетт є ІТ-директором Deloitte Consulting LLP, великої бухгалтерської фірми. Він сказав: «Навіть при мінімальних зусиллях Claude Opus 5.5 виявляв 72% відомих помилок під час перевірки коду, порівняно з 56% Opus 5 при великих зусиллях. У аналізі консалтингу в США низькі зусилля мислення відповідали налаштуванням високого мислення з половиною результату та пройшли перевірку якості.

Крім того, цей ІТ-директор не «наймає інженерів для написання коду».

Ну тоді ось. Більше потужності, більше безпеки, менше витрат і менше шуму. З моменту останнього великого випуску минуло менше двох місяців, і це величезне покращення.

як ти думаєш Чи плануєте ви перейти від Opus 5 до Opus 5.5, щойно Opus 5 стане доступним? Дайте нам знати в коментарях нижче.


Слідкуйте за мною в соціальних мережах, щоб бути в курсі моїх щоденних проектів. Підпишіться, будь ласка мій щотижневий інформаційний бюлетеньслідкуйте за нами у Twitter/X. @DavidGewirtz,На Facebook Facebook.com/DavidGewirtzв Instagram Instagram.com/DavidGewirtzу блакитному небі @DavidGewirtz.comі на YouTube YouTube.com/DavidGewirtzTV.