Потвърдено

Cognition officially released SWE-2 on September 10, 2026, detailing architecture, benchmarks, and cost comparisons.

AI модели

Cognition намалява с 64 на сто разходите за програмиране с изкуствен интелект (AI)

Стартъпът пусна новия си модел SWE-2 като част от асистента Devin, вместо да предлага свободен достъп до софтуера.

Публикувано
NRB — News Republic Brigade

Още връзки

Cognition

Същината

Cognition пусна своя модел за програмиране с изкуствен интелект (AI) SWE-2, базиран на системата с отворени тегла Kimi K3 на Moonshot AI, с обещание за около 64 на сто по-ниски оперативни разходи. Вместо да предостави свободен публичен достъп, стартъпът ограничи модела до своите инструменти Devin, където засиленият интерес бързо натовари сървърите. Първите външни проверки потвърждават стабилно справяне с ежедневни многостепенни работни процеси, но системата остава зад водещите платени алтернативи при сложни операции в конзолен режим.

Акценти

  • Cognition представи модела SWE-2 на 10 септември 2026 г., стъпвайки върху базовия софтуер Kimi K3 на Moonshot AI.
  • Компанията изчислява разхода за изпълнение на една задача със SWE-2 на 1,18 долара спрямо 3,28 долара при Claude Fable 5.1.
  • SWE-2 отчете 92,8 на сто в Terminal-Bench 2.1, но успеваемостта му падна до 27,3 на сто при по-тежкия тест Terminal-Bench 4.
  • Независими изпитатели измериха резултат от 83,75 на сто при специализирания тест KingBench 3.
  • Промоционалният достъп за абонатите на Devin Pro бе удължен до 10 октомври 2026 г. след натоварване на сървърите.

Резултати от сравнителния тест FrontierCode 1.1 Main

проценти
50,9
50
Claude Fable 5.1SWE-2

щрихРезултатът на SWE-2 изостава с 0,9 процентни пункта от постижението на Claude Fable 5.1.

  • Графиката сравнява постигнатите резултати в програмния тест FrontierCode 1.1 Main.
  • FrontierCode 1.1 Main — Стандартен бенчмарк за оценка на точността, с която моделите с изкуствен интелект (AI) решават софтуерни задачи
  • Сравнението показва, че Cognition успява да се изравни с водещите търговски модели, като същевременно свива текущите разходи за работа.

Сравнение на прогнозните разходи за една задача

МоделРазход за задача
SWE-2$1.18
Claude Fable 5.1$3.28
  • Таблицата показва приблизителните финансови разходи за цялостното изпълнение на една програмна задача при двата модела.
  • По-ниските разходи за изпълнение са водещият аргумент на Cognition към компаниите, които използват непрекъсната автоматизирана разработка на код.

Из дневника на редактора

Автоматизацията в програмирането навлиза в нов етап — надпреварата за рекорди в тестовете отстъпва пред строгата икономическа ефективност, където цената на изчислителната мощ е също толкова решаваща, колкото и техническите възможности на модела.

Кой участва

  • Cognition

    Американски стартъп за изкуствен интелект (AI), създател на помощника за автоматизирано програмиране Devin

    цел → Стреми се да намали оперативните разходи при автоматизирано многостепенно програмиране, запазвайки конкурентно ниво спрямо водещите модели

  • Уолдън Йен (Walden Yan)

    Съосновател на Cognition

    цел → Отговаря за потребителския достъп, изчислителния капацитет и внедряването на продуктите

  • Независими оценители и софтуерни инженери

    Софтуерни инженери и независими анализатори, тестващи Devin

    цел → Стремят се да проверят реалните спестявания на разходи и поведението на модела извън рекламните материали

  • Moonshot AI

    Китайска изследователска компания за изкуствен интелект (AI), създала базовата система Kimi K3

    цел → Предоставя отворения базов софтуер, който Cognition доразвива

Накратко

Стартъпът Cognition предпочете по-ниските оперативни сметки пред преследването на абсолютна изчислителна мощ. Компанията залага на тезата, че за бизнеса по-евтиното автоматизирано програмиране е по-важно от победите в тестовете за производителност. Този ход бележи по-широко пренасочване в сектора на изкуствения интелект (AI) — от състезания по сурова мощност към практическите разходи за поддръжка при разработката на софтуер.

Подобна стратегия вероятно ще насърчи инженерните екипи да изпробват автоматизирано писане на код при многостепенни проекти, макар че подобни инструменти все още се затрудняват при изпълнението на дълги технически команди.

Дали този подход ще се наложи, остава неясно, тъй като Cognition запазва модела затворен в собствените си платени инструменти, вместо да позволи на независими изследователи да тестват базовата невронна мрежа директно.

Как се разви

01

Cognition представи новия модел SWE-2

2026-09-10 – 2026-09-10

Cognition представи официално SWE-2 на 10 септември 2026 г. чрез технически доклад и съобщения в социалните мрежи. В тях компанията обясни как е оптимизирала отворения софтуер Kimi K3 на Moonshot AI, за да увеличи скоростта на логическите операции и да намали текущите разходи за изпълнение.

1 източник
02

Тестовете очертават практическите ограничения на модела

2026-09-10 – 2026-09-12

Пускането на SWE-2 веднага предизвика професионален дебат сред програмистите относно финансовите изчисления на Cognition и затворения модел на разпространение. Независими анализатори отбелязаха, че макар SWE-2 да оглавява класацията в теста Terminal-Bench 2.1, оценката му спада рязко до 27,3 | % при по-сложния пакет Terminal-Bench 4 спрямо затворените търговски модели. Тъй като системата се предлага единствено чрез абонамент за Devin, а не чрез отворен програмен интерфейс за външни инженери, специалистите трябваше да оценяват завършени работни процеси, а не прекия изходен код. Големият потребителски интерес бързо натовари сървърите на компанията, което принуди ръководството да осигури допълнителен изчислителен капацитет и да удължи безплатния промоционален достъп.

3 източника

Докъде стигна историята

В момента Cognition поддържа SWE-2 в настолното приложение Devin Desktop и в интерфейса с команден ред, като продължава интеграцията му в платформите Web и Fusion. Платените абонати на Devin Pro запазват безплатен промоционален достъп до модела до 10 октомври 2026 г.

Независимите тестове потвърждават, че моделът изпълнява поетапни инженерни задания по-ефективно от оригиналния Kimi K3. Изследователите обаче нямат възможност да проверят директно базовата архитектура, тъй като Cognition не е публикувала весовете на модела, нито свободен програмен интерфейс. По-широкото навлизане на системата зависи от това дали компанията ще отвори публичен достъп за разработчици и как софтуерът ще се справи с по-дълги програмни задачи без човешка намеса.

Източници