Создание надёжных и эффективных ИИ-приложений требует постоянной оценки и оптимизации. Этот процесс часто бывает трудоёмким и подверженным ошибкам. Anthropic, понимая эту проблему, представила новый инструмент, который обещает автоматизировать значительную часть этого цикла, позволяя разработчикам итеративно улучшать свои приложения с помощью ИИ.
Что произошло
Anthropic анонсировала новые возможности для автоматизации проектирования оценок и итеративной оптимизации (hillclimbing) с помощью Claude. Теперь, используя /claude-api build-eval, разработчики могут создавать оценки прямо внутри своей кодовой базы. Затем, с помощью /claude-api hillclimb, можно улучшать приложение на основе этой оценки, внося изменения по одному за раз, с использованием отложенного набора примеров для предотвращения переобучения.
В качестве примера, Anthropic провела hillclimb на внутреннем бенчмарке поддержки клиентов с целью снижения стоимости и улучшения производительности. Бенчмарк включал 44 тикета: 30 использовались для поиска и 14 были отложены. Изначально система работала на Opus 4.8 с настройками по умолчанию (высокий уровень усилий), достигая 74.4% точности принятия решений на поисковых тикетах и стоимости токенов 4.6 цента за тикет. hillclimb сначала провёл аудит промпта, удалив обязательные ритуалы вызова инструментов, шаг с черновиком и противоречивые правила. Затем он попробовал Opus 5.5 на низком уровне усилий. Это позволило достичь базовой точности в 87.8% и сократить стоимость до 1.9 цента за тикет, что менее чем вдвое меньше начальной стоимости. Часть этой экономии обусловлена ценообразованием Opus 5.5: входные и выходные токены стоят на 20% дешевле, чем на Opus 4.8, а чтение кэша — на 60% дешевле.
Почему это важно
Автоматизация процесса оценки и оптимизации — это критически важный шаг для масштабирования разработки ИИ-приложений. Ручное тестирование и настройка промптов могут быть очень медленными и дорогими. build-eval и hillclimb от Anthropic позволяют значительно ускорить этот цикл, давая разработчикам возможность быстро и систематически улучшать свои модели. Это не только экономит время и деньги, но и помогает создавать более надёжные и производительные ИИ-системы, минимизируя риск переобучения благодаря использованию отложенных наборов данных.
Пример с бенчмарком поддержки клиентов наглядно демонстрирует эффективность подхода. Снижение стоимости более чем в два раза при одновременном повышении точности — это впечатляющий результат, который показывает потенциал автоматизированной оптимизации. Это также подчёркивает важность выбора правильной модели и уровня усилий, а также тщательного аудита промптов. Инструменты, подобные hillclimb, позволяют разработчикам сосредоточиться на высокоуровневых задачах и бизнес-логике, делегируя рутинную работу по настройке и тестированию ИИ.
Что это значит на практике
Для разработчиков и предпринимателей, создающих ИИ-продукты, эти новые возможности Claude означают следующее:
- Быстрая итерация: Используйте
/claude-api build-evalдля быстрого создания оценок и/claude-api hillclimbдля автоматической оптимизации ваших ИИ-приложений, значительно ускоряя цикл разработки. - Оптимизация затрат:
hillclimbможет помочь найти более дешёвые конфигурации моделей (например, Opus 5.5 на низком усилии), которые при этом соответствуют или превосходят требования к производительности. - Повышение качества промптов: Инструмент автоматически аудирует и улучшает промпты, удаляя ненужные элементы и противоречивые правила, что приводит к более чистым и эффективным запросам.
- Предотвращение переобучения: Использование отложенных наборов данных в процессе
hillclimbпомогает гарантировать, что оптимизация не приводит к переобучению модели на тренировочных данных. - Систематическое улучшение: Вместо догадок и ручных экспериментов, вы получаете систематический подход к улучшению производительности и снижению стоимости ваших ИИ-приложений.