qvib.pro
EN

Cognition SWE-2: новый эталон для кодирующих моделей

Cognition SWE-2: новый эталон для кодирующих моделей

Cognition представила SWE-2, свою самую продвинутую модель для кодирования, значительно улучшающую соотношение возможностей и стоимости. Модель достигла 50.0% на бенчмарке FrontierCode 1.1 Main, что всего на один пункт ниже Fable 5.1, но при этом на 64% дешевле.

SWE-2 становится одним из лидеров рынка, предлагая производительность, сравнимую с GPT-5.6 Sol и Fable 5/5.1, но за значительно меньшую цену. Она приближается к GPT-6 Astra с четвертью её стоимости.

SWE-2 доступна в Devin Desktop и CLI, а также будет развернута в Devin Web и Fusion. Улучшения в модели связаны с её способностью принимать более сильные инженерные решения, что приводит к более полным решениям и меньшему количеству обходных путей. Например, на FrontierCode 1.1 Main SWE-2 показывает лучшие результаты, используя на 58% меньше шагов и обходясь на 81% дешевле по сравнению с SWE-1.7.

Ключевые улучшения SWE-2 включают:

  • Качественное написание тестов: Проверка реализации от начала до конца.
  • Лучшая находчивость: Способность находить альтернативные пути, когда основной заблокирован (например, восстанавливая данные из истории Slack).
  • Строгая дисциплина верификации: Модель перепроверяет выводы и собирает доказательства, а не просто соглашается с гипотезами пользователя.

Различные уровни усилий SWE-2 (medium, high, max) позволяют эффективно решать задачи разной сложности, от простых до самых комплексных, с соответствующим планированием и исследованием кодовой базы.

Почему это важно

Выпуск SWE-2 от Cognition — значительный шаг вперед в области кодирующих моделей. Достижение высокой производительности при значительно более низкой стоимости меняет экономику использования ИИ в разработке. Это означает, что больше компаний и разработчиков смогут позволить себе использовать передовые ИИ-модели для автоматизации и оптимизации своих процессов. Улучшенная способность модели к написанию тестов, находчивость и верификация делают её более надежным партнером для разработчиков, уменьшая необходимость в ручной проверке и отладке.

Что это значит на практике

  • Снижение затрат на разработку: Автоматизация задач кодирования и тестирования сократит расходы на облачные ресурсы и время разработчиков.
  • Повышение качества кода: Благодаря улучшенной способности SWE-2 писать тесты и верифицировать решения, можно ожидать более надежного и стабильного кода.
  • Эффективное решение проблем: Находчивость модели поможет преодолевать препятствия в процессе разработки, предлагая альтернативные подходы, когда стандартные пути заблокированы.
  • Доверие к ИИ-решениям: Строгая дисциплина верификации SWE-2 означает, что можно больше доверять выводам и коду, генерируемому моделью, сокращая время на ручную проверку.
  • Гибкость в использовании: Различные уровни усилий SWE-2 позволяют оптимизировать использование модели под конкретные задачи, выбирая баланс между скоростью, стоимостью и сложностью.

Источники

Ещё по теме «Модели»

Разобраться глубже