Генеративний інтерфейс на перевірці спеціалізацією: модель OUI-1 від Thesys
Поки моделі з відкритими вагами розвиваються переважно за шкалою кількості параметрів, компанія Thesys спробувала шлях вертикальної спеціалізації й оголосила про OUI-1, подавши її як першу модель з відкритими вагами, присвячену Generative UI, — твердження, що залежить від того, як окреслено саму категорію, і яке ніхто не перевіряв незалежно. Модель отримано LoRA-донавчанням DiffusionGemma 26B-A4B-it від Google, чиї ваги потім злили у формат safetensors bf16; вона має 26 мільярдів параметрів загалом, з них 4 мільярди активних, і контекстне вікно на 16 384 токени. Заявлена в картці моделі на Hugging Face мета — дати змогу генерувати інтерфейси для застосунків на фреймворку OpenUI локально, зменшивши залежність від віддалених API. Щодо розповсюдження, ваги залишаються під дією Gemma Terms of Use — пропрієтарної ліцензії Google з обмеженнями використання, виразно відмінної від схвалених OSI відкритих ліцензій, на відміну від самого фреймворку OpenUI, випущеного під MIT.
Оприлюднені компанією дані про продуктивність приписують OUI-1 результат 71,7 % у Generative UI Benchmark проти 13,0 % у базової моделі. Оцінювання спирається на openui-lang — декларативну мову, яка, за вимірюваннями Thesys, скорочує потрібну кількість токенів до 67 % порівняно з форматом JSON. Проте в тій самій порівняльній таблиці видно, що універсальна модель Qwen3.8 27B показує вищий результат — 78,8 %: отже, заявлена перевага OUI-1 полягає не в абсолютному значенні, а в тому, що близький результат отримано за 4 мільярдів активних параметрів. До того ж будова бенчмарку — 46 брифів, розподілених на п'ять рівнів складності, — має вузький периметр: метрика вимірює виключно формальну коректність виводу, як-от відсутність осиротілих компонентів чи помилок розбору, не вловлюючи ні зручності використання, ні естетичної якості отриманого дизайну.
На рівні запуску підрахунки сходяться не до кінця. Вимоги вказують близько 25,8 ГіБ відеопам'яті для роботи у квантизації FP8 через vLLM, що, за словами Thesys, робить реальною навіть споживчу відеокарту на кшталт RTX 5090; проте початкові тести проводили на одній A100. Показники затримки теж не збігаються: в анонсі йдеться про 1,9 секунди на вивід, а картка моделі заявляє близько секунди на екран на одному GPU — звести обидва числа до однієї конфігурації неможливо. У технічній дискусії на Hacker News пролунали сумніви щодо узгодженості інтерфейсів, які наново генеруються в кожній сесії, щодо труднощів налагодження за недетермінованого виводу і щодо відсутності будь-яких візуальних підтверджень в офіційному оголошенні.
Перенести Generative UI з віддалених API на компактну модель, яку можна розмістити в себе, — раціональне архітектурне рішення для стримування обчислювальних витрат. Залишається, однак, факт: коли один і той самий суб'єкт визначає модель, синтаксис виводу й оцінювальний бенчмарк, отримана метрика вимірює насамперед відповідність правилам, які він сам і накреслив. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я відкрила першоджерело через WebFetch — офіційний блог OpenUI/Thesys від 8 вересня 2026 року — і звірила його з офіційною карткою моделі на Hugging Face: вони збігаються щодо параметрів (26B загалом, 4B активних), базової моделі (DiffusionGemma 26B-A4B-it), ліцензії (Gemma Terms of Use) і результату (71,7 %), але розходяться щодо часу генерації. Сторінка методології підтверджує, що бенчмарк створено й розміщено самою Thesys (46 брифів, 5 рівнів). Як незалежне підтвердження я прочитала розбір explainX: ті самі цифри плюс застереження про самодекларацію і про вищий результат Qwen3.8 27B, — а також гілку Hacker News того самого дня (61 бал, понад 50 коментарів), отриману через API Algolia після помилки 429 на сайті. Теми без доступного офіційного анонсу і вже висвітлені порталом я відкинула.
- Incertezze
- 71,7 % — самодекларована цифра: бенчмарк створено, розміщено й запущено Thesys, яка водночас є авторкою моделі та випробовуваного формату openui-lang; перевірки третьою стороною наразі немає. У таблиці, опублікованій самою Thesys, Qwen3.8 27B набирає 78,8 %, тобто більше за OUI-1: заявлене першість стосується співвідношення результату й активних параметрів, а не абсолютного результату. Формулювання "перша модель з відкритими вагами для Generative UI" незалежно не перевіряється і залежить від того, як визначити категорію. Ліцензія — Gemma Terms of Use з обмеженнями Google на використання: відкриті ваги не означає відкритий код. Незрозуміло, наскільки ретельно оптимізували системні промпти конкурентних моделей у порівнянні. Заявлений час генерації розходиться: блог (1,9 с) і картка моделі (близько 1 с), без вказівки, до якого обладнання належить кожна цифра. Нарешті, бракує будь-якої міри якості чи зручності згенерованих інтерфейсів: бенчмарк перевіряє лише формальну валідність виводу.
- Perché pubblicarla
- Новина свіжа (8 вересня), її можна перевірити за відкритими першоджерелами, і портал її ще не висвітлював. Але головне — це хрестоматійний випадок для нашого кута зору: компанія оголошує про першість у бенчмарку, який сама ж і побудувала, а в опублікованій нею таблиці стоїть універсальна модель із кращим результатом. Розповісти про це варто саме для того, щоб показати різницю між "першою моделлю для Generative UI", "найкращим результатом" і "найкращим результатом на активний параметр" — трьома різними твердженнями, які анонс тримає разом. До того ж тут порушено вузол відкритих ваг під ліцензією Gemma, які в сенсі OSI відкритими не є.