Відкрита інфраструктура, на якій тримається закритий код: Cognition представила SWE-2
10 вересня 2026 року компанія, що розробляє програмувального агента Devin, оголосила про SWE-2 — нову версію своєї спеціалізованої моделі. Структурна суть анонсу — у походженні ваг: компанія не навчала модель із нуля, а застосувала процедуру навчання з підкріпленням, відштовхуючись від Kimi K3, моделі з відкритими вагами на 2,8 трильйона параметрів, яку в липні 2026 року опублікувала китайська компанія Moonshot AI. В офіційному анонсі зазначено, що система — "post-trained from Kimi K3, a 2.8T-parameter model that had already undergone extensive RL". Власним, отже, є навчання з підкріпленням, а не базова модель: у SWE-2 немає відкритих ваг і, судячи з анонсу, немає окремого API.
За наведеними компанією даними бенчмарків, донавчання виводить SWE-2 на 50,0% у FrontierCode 1.1 Main — на 5,8 пункта вище за 44,2% базової моделі Kimi K3, упритул до Fable 5.1 (50,9%) і нижче за GPT-6 Astra (53,3%). У DeepSWE 1.1 результат сягає 73,0% проти 68,5% у Kimi K3, а в Terminal-Bench 2.1 — 92,8%. Картина змінюється на найсвіжішому тесті серії, Terminal-Bench 4: там просідають усі результати, але SWE-2 зупиняється на 27,3% — менше ніж половина від Fable 5.1 (55,8%) і GPT-6 Astra (57,9%). Розрив в анонсі не пояснюють.
У комерційній площині розповідь зміщується з абсолютного першості на співвідношення ціни та результату: компанія заявляє, що досягає "50.0% on FrontierCode 1.1 Main, within one point of Fable 5.1 while being 64% cheaper". Економію пораховано за публічними прайс-листами конкурентів — "list pricing, including public discounts", — тоді як ціни самого SWE-2 в тексті немає. З методологічного боку SWE-2 запроваджує вибірні рівні міркування (medium, high, max), навчені за одну сесію навчання з підкріпленням через штраф за вартість у функції винагороди. Інтеграція обмежена екосистемою Devin: на старті доступна в Desktop і CLI, розгортання в інтерфейсах Web і Fusion триває.
Лишається те, що весь цей розбір спирається винятково на внутрішні вимірювання, які поки не підкріплені незалежною перевіркою. Cognition не каже, чи покрите комерційне використання Kimi K3 угодою з Moonshot AI і яким саме чином; умови ліцензії наразі неможливо перевірити на офіційній сторінці ваг. Коли конкуренція переносить центр ваги на рецепти доведення, а не на саме створення моделей, справжнім вододілом стає вміння перетворити чужу інфраструктуру на закритий продукт.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Я відкрила через WebFetch офіційний анонс на cognition.com/blog/swe-2 (старий домен cognition.ai відповідає перенаправленням 301 на cognition.com) і витягла з нього повну таблицю бенчмарків із результатами конкурентів, дослівні цитати, дату в підписі та відсутність цін, відкритих ваг і API. Звірила це з анонсом в офіційному акаунті Cognition в X і з незалежним матеріалом MarkTechPost від 12 вересня 2026 року, який збігається щодо чотирьох бенчмарків, базової моделі та методу винагороди. Існування та заявлені характеристики Kimi K3 (2,8 трлн параметрів, відкриті ваги, липень 2026 року) перевірила окремо за журналістськими публікаціями; сторінка ваг на Hugging Face відповіла 401, тож ліцензія не підтверджена первинним джерелом — я віднесла її до невизначеностей, а не стала стверджувати. Ще одне повідомлення MarkTechPost — безкоштовний доступ для платних тарифів до 10 жовтня 2026 року — в офіційному тексті відсутнє, і до фактів я його не зараховую.
- Incertezze
- Усі цифри бенчмарків, включно з показниками конкурентів, — це вимірювання Cognition, оприлюднені Cognition: незалежної перевірки наразі немає, а порівняння за вартістю спираються на чужі публічні прайс-листи, тоді як ціну самого SWE-2 не оголошено. Розрив на Terminal-Bench 4 (27,3% проти 55,8% і 57,9%) в анонсі не пояснено. Умови ліцензії Kimi K3 я не перевірила за первинним джерелом: вторинні публікації говорять про пороги за виручкою для комерційного використання, але офіційна сторінка ваг була недоступна. Тому залишається відкритим, чи покрита Cognition угодою з Moonshot AI і яким чином, — сама компанія про це мовчить. Невідомо також, яку частку в результатах, приписаних методу Cognition, дає власний ланцюг навчання Kimi K3. Доступність у Devin Web і Fusion була «у процесі», а не завершена.
- Perché pubblicarla
- Новина тут не в черговому результаті на вершині рейтингу, а в тому, що флагманська американська модель, яку продають як власну, — це донавчання китайської моделі з відкритими вагами, і що заявлена перевага в неї цінова, а не за спроможністю. Найповчальніша цифра — та, яку комунікація не виносить наперед: на найсвіжішому бенчмарку серії Terminal-Bench результат менший за половину показників двох передових моделей. Це показує, наскільки вибір того, який бенчмарк цитувати, визначає всю розповідь. Усі цифри заявлені самою компанією і перевіряються лише на її слово — і читачеві про це варто сказати.