qvib.pro
EN

Anthropic Opus 5.5: изменения в промптинге и поведении

Anthropic Opus 5.5: изменения в промптинге и поведении

С каждым новым поколением моделей Anthropic, разработчики сталкиваются с необходимостью адаптации своих подходов к промптингу и архитектуре агентов. Выпуск Claude Opus 5.5 не стал исключением. Anthropic опубликовала подробное руководство, которое раскрывает ключевые изменения в поведении модели и требованиях к промптингу, что критически важно для тех, кто строит сложные ИИ-системы.

Что произошло

28 сентября 2026 года Anthropic опубликовала руководство по промптингу для Claude Opus 5.5 на platform.claude.com, детализирующее поведенческие различия, с которыми, вероятно, столкнутся разработчики при миграции существующих промптов Opus 5. Основные изменения включают: Opus 5.5 больше не принимает запросы на отключение «мышления» (thinking), а его уровень усилий по умолчанию снижен с «высокого» до «среднего». Anthropic утверждает, что Opus 5.5 на «среднем» уровне усилий соответствует или превосходит Opus 5 на «высоком» уровне усилий, но с меньшим количеством шагов и токенов.

Модель генерирует выходные токены более чем на 30% быстрее и, как правило, завершает ту же задачу с меньшим количеством токенов. Однако, уровни усилий не соответствуют одинаковому объёму «мышления» между моделями: Opus 5.5 «думает» больше за ход, особенно на уровнях «xhigh» и «max», что может привести к более длинным ходам и большему количеству выходных токенов, если не установить уровень явно. Руководство рекомендует начинать со «среднего» уровня и тестировать на собственных оценках. Также есть изменения в обработке контекста: «мышление» теперь учитывается в max_tokens, даже если его содержимое не возвращается, что может привести к обрезанию ответов, если max_tokens не увеличен (рекомендуется 128 000). Обновления прогресса теперь приходят как блоки «мышления» progress-update, которые по умолчанию пусты, если thinking.display не настроен на updates. Модель также может завершать ход текстом вместо вызова инструмента, даже если работа ещё не закончена, что требует переработки циклов агентов.

Почему это важно

Эти изменения имеют глубокие последствия для разработки ИИ-агентов. Отсутствие возможности отключить «мышление» и изменение его поведения по умолчанию означает, что разработчикам придётся переосмыслить, как их агенты взаимодействуют с моделью. Агенты, которые ранее полагались на немедленные вызовы инструментов, теперь могут получать промежуточные отчёты о прогрессе, что требует адаптации логики обработки ответов. Повышенная скорость и эффективность Opus 5.5 — это безусловный плюс, но необходимость явного управления уровнем усилий и max_tokens добавляет сложности в настройку.

Новый подход к «мышлению» и его отображению также влияет на пользовательский опыт и отладку. Если клиент не настроен на отображение progress-update, агент может казаться «молчащим» на протяжении всего хода. Кроме того, появление новой категории отказа reasoning_extraction и биологических мер безопасности (перенесённых из Claude Fable 5.1) означает, что разработчикам придётся учитывать новые типы ошибок и отказов, а также, возможно, пересматривать свои запросы, чтобы избежать нежелательных блокировок. Эти изменения подчёркивают, что работа с передовыми LLM требует постоянной адаптации и глубокого понимания их внутреннего поведения.

Что это значит на практике

Для разработчиков, использующих Claude Opus 5.5, эти изменения требуют следующих практических шагов:

  • Пересмотр логики агентов: Адаптируйте циклы агентов для обработки progress-update блоков и случаев, когда модель завершает ход текстом вместо вызова инструмента, даже если задача не выполнена.
  • Явное управление уровнем усилий: Не полагайтесь на унаследованные значения. Начинайте со «среднего» уровня усилий и тщательно тестируйте на своих оценках, чтобы найти оптимальный баланс между производительностью и стоимостью.
  • Увеличение max_tokens: Установите max_tokens на 128 000 для длинных агентных ходов, чтобы избежать обрезания ответов из-за учёта «мышления» в лимите токенов.
  • Настройка отображения «мышления»: Если вашему приложению нужны промежуточные обновления, настройте thinking.display на updates, чтобы видеть содержимое progress-update блоков.
  • Учёт новых категорий отказов: Будьте готовы к отказам типа reasoning_extraction и биологическим мерам безопасности. Избегайте запросов, которые заставляют модель воспроизводить внутренние рассуждения в ответе, и вместо этого читайте суммированные блоки «мышления».
  • Тестирование на реальных задачах: Не полагайтесь только на бенчмарки Anthropic. Проводите собственное тестирование, чтобы убедиться, что модель работает как ожидается в ваших конкретных сценариях.

Источники

Ещё по теме «Модели»

Разобраться глубже