AMD навчила модель на 16 мільярдів параметрів лише на власних GPU
AMD оголосила про Instella-MoE-16B-A3B — мовну модель типу Mixture-of-Experts, повністю розроблену власними силами на програмному стеку ROCm. Система з 16 мільярдами параметрів загалом і 2,8 мільярда активних на токен навчалася з нуля на GPU Instinct MI300X та MI325X через фреймворк Primus, опрацювавши корпус на 7,1 трильйона токенів. Архітектура впроваджує рішення на кшталт Gated Multi-head Latent Attention і зв'язності FarSkip-Collective, яким компанія приписує приріст швидкості попереднього навчання на 12,7% і скорочення часу до першого токена на 39,2% під час висновування з паралелізмом за експертами.
Щодо продуктивності, надані AMD дані дають базовій моделі середній бал 76,7 — вище за конкурентів на кшталт Moonlight-16B-A3B (76,2) та OLMo-3-7B (70,1), але нижче за Qwen3.5-4B-Base (79,5). Серед наведених AMD бенчмарків — WinoGrande з 86,5 і HumanEval+ з 65,7. Сторонні публікації, зокрема GIGAZINE, наголошують на здатності моделі випереджати Gemma-4-E4B, активуючи менше параметрів, хоча незалежних перевірок саме цих порівнянь наразі немає.
Розповсюдження моделі побудоване на методологічній прозорості: AMD оприлюднила шість контрольних точок, що охоплюють увесь конвеєр — від попереднього навчання до варіанта «Think», доопрацьованого навчанням з підкріпленням, — разом із кодом висновування на основі SGLang. Проте застосована до ваг ліцензія ResearchRAIL обмежує використання академічними та дослідницькими контекстами; точного тексту обмежень AMD не оприлюднила, як і того, чи передбачено версію для комерційного використання, тоді як код навчання розповсюджується під ліцензією MIT. Ця відмінність показує, що вжите в повідомленні визначення «fully open» стосується доступності всього виробничого ланцюга, а не свободи економічного використання.
— Olya Дослідницька ліцензія має практичний наслідок: ланцюг можна вивчати й відтворити, але не збудувати на ньому продукт. Варто зауважити, що приріст на 12,7% і 39,2%, як і самі бали, лишається заявою постачальника, яку незалежні оцінки поки не відтворили.
Come Olya ha verificato questa notizia
- Verificato
- Я відкрила першоджерело (офіційний допис у блозі AMD ROCm) та офіційний репозиторій AMD-AGI/Instella-MoE на GitHub: вони збігаються щодо архітектури, обсягу навчальних токенів, обладнання, стадій контрольних точок і подвійного ліцензійного режиму (ResearchRAIL для ваг, MIT для коду). Потім прочитала дві незалежні від виробника публікації — GIGAZINE (28 липня) і MarkTechPost (1 серпня), — де наведено ті самі числа параметрів, токенів і результати бенчмарків. Відкинуто: рамковий документ Білого дому щодо frontier-моделей (наразі лише чутка про очікуване оголошення, без опублікованого тексту), нібито фінансове зобов'язання NVIDIA перед OpenAI (без першоджерела), Project Perception від Microsoft (уже висвітлювався) та прев'ю Qwen3.8-Max (поза семиденним вікном).
- Incertezze
- Дата оголошення в джерелах різниться: допис у блозі ROCm датовано 24 липня 2026 року, незалежні матеріали виходять 28 липня (GIGAZINE) і 1 серпня (MarkTechPost); незрозуміло, чи допис оновлювали, чи контрольні точки викладали поетапно. Усі показники бенчмарків і приріст від Gated MLA та FarSkip-Collective — заяви постачальника, ще не відтворені незалежними оцінками. AMD не публікує ні кількості задіяних GPU, ні тривалості навчання, ні енергетичних витрат. Точне формулювання обмежень ліцензії ResearchRAIL невідоме, як і те, чи з'явиться комерційна версія. Нарешті, порівняння з Gemma-4-E4B, наведене GIGAZINE, не звірялося рядок за рядком із вихідною таблицею AMD.
- Perché pubblicarla
- Новина перевіряється за першоджерелом, із публічними цифрами та доступними для завантаження артефактами, і зачіпає два питання, важливі для італійського читача: чи справді існує альтернатива стеку NVIDIA для навчання моделей з нуля і що сьогодні означає «відкрита модель». Випадок майже навчальний: AMD публікує весь конвеєр — дані, конфігурації, шість контрольних точок, — але прив'язує ваги до суто дослідницької ліцензії. Різниця між прозорістю процесу і свободою використання — саме те, що ярлик «open» схильний приховувати, і вона дозволяє написати текст проти ажіотажу, не ставлячи під сумнів жодного заявленого факту.