28 сентября Anthropic представила Claude Sonnet 5.5 по той же цене, что и Sonnet 5. Компания утверждает, что новая версия работает на 30% быстрее и снижает стоимость задач до 30%. Однако независимая компания, проводившая бенчмаркинг, пришла к другому выводу о стоимости при максимальной нагрузке на модель. Второй релиз через несколько дней после Opus Sonnet 5.5 The post Новая модель Sonnet от Anthropic приближается к Opus по качеству, но требует больше токенов appeared first on BeInCrypto.
28 сентября Anthropic представила Claude Sonnet 5.5 по той же цене, что и Sonnet 5. Компания утверждает, что новая версия работает на 30% быстрее и снижает стоимость задач до 30%.
Однако независимая компания, проводившая бенчмаркинг, пришла к другому выводу о стоимости при максимальной нагрузке на модель.
Sonnet 5.5 — вторая модель в линейке Claude 5.5. Anthropic выпустила Opus 5.5 22 сентября. В тот же день OpenAI также представила GPT-6 Sol и Luna.
Новая модель сохранила расценки Sonnet 5 — $2 за 1 млн входных токенов и $10 за 1 млн выходных. По результатам теста Terminal-Bench 4.0 — это агентный тест на программирование — Anthropic показала 70,6%. Sonnet 5 набрал только 10,3%, Opus 5.5 — 66,4%.
«Opus 5.5 создан для сложных задач, где важна точность и взвешенное решение, а Sonnet 5.5 отлично справляется с типовыми ежедневными задачами, исправлением багов и подготовкой готовых документов, презентаций и таблиц», — отмечает команда.
В Anthropic подчеркнули, что Sonnet 5.5 не открывает новые горизонты возможностей. Поэтому при проверке модели делался упор на риски: может ли она вводить пользователей в заблуждение или помочь в случаях опасного использования.
Sonnet 5.5 снабжен инструментами для кибербезопасности и алгоритмами против нелегального копирования. Они блокируют попытки извлечь методы рассуждения модели и использовать их для обучения конкурентов. Выпуск Claude Haiku 5.5 ожидается в ближайшие недели.
Тем временем OpenAI отказалась от выпуска GPT-6.1 Astra из соображений безопасности. CNBC подтвердила, что модель не прошла внутреннюю оценку компании.
Компания Artificial Analysis присвоила Sonnet 5.5 оценку 56 по своему индексу интеллекта. Это второй результат, всего на 2 балла меньше, чем у Opus 5.5 при максимальной нагрузке.
Аналитики зафиксировали для Sonnet 5.5 результат 64% на тесте Terminal-Bench 4.0, тогда как у Opus 5.5 и GPT-6 Astra — по 60%. На специализированных тестах для работы с данными, таких как GDPval-AA, Sonnet 5.5 показал результаты примерно на уровне Opus 5.5.
Отмечено, что Sonnet 5.5 затрачивает существенно больше токенов для достижения этих показателей.
«При максимальной нагрузке, когда производительность приближается к Opus 5.5, Claude Sonnet 5.5 использует около 193 000 выходных токенов на одну задачу», — говорится в публикации.
Такой объем примерно на 60% выше, чем у Opus 5.5 и Sonnet 5 на максимальной производительности. Это в 7 раз больше показателя GPT-6 Astra при аналогичной нагрузке.
Однако пользователи раннего доступа, опрошенные Anthropic, сообщили о противоположной тенденции по сравнению с Sonnet 5 — но уже на других задачах. Например, Balyasny Asset Management отметил гораздо меньший расход токенов в своих финансовых кейсах.
«В нашем закрытом пакете из 2441 финансовой задачи на вопросы-ответы, извлечение, аналитику и прогнозирование Claude Sonnet 5.5 опередил Sonnet 5 и использовал в среднем 121 000 токенов на ответ, а Sonnet 5 — 497 000», — рассказал старший инженер по искусственному интеллекту в Balyasny Asset Management Джо Пуарьe.
Компания Artificial Analysis тестировала предпродрелизную версию с ошибкой в структурированной выдаче. Позже Anthropic исправила баг. В ближайшее время специалисты собираются повторить тесты.
The post Новая модель Sonnet от Anthropic приближается к Opus по качеству, но требует больше токенов appeared first on BeInCrypto.