AMD entraîne un modèle de 16 milliards de paramètres uniquement sur ses propres GPU
AMD a annoncé Instella-MoE-16B-A3B, un modèle de langage Mixture-of-Experts développé entièrement en interne sur la pile logicielle ROCm. Le système, qui compte 16 milliards de paramètres au total dont 2,8 milliards actifs par token, a été entraîné de zéro sur des GPU Instinct MI300X et MI325X via le framework Primus, en traitant un corpus de 7,1 billions de tokens. L'architecture met en œuvre des solutions comme la Gated Multi-head Latent Attention et la connectivité FarSkip-Collective, auxquelles l'entreprise attribue un gain de 12,7 % sur la vitesse de pré-entraînement et une baisse de 39,2 % du temps jusqu'au premier token en inférence avec parallélisme d'experts.
Côté performances, les données fournies par AMD donnent au modèle de base un score moyen de 76,7, ce qui le place au-dessus de concurrents comme Moonlight-16B-A3B (76,2) et OLMo-3-7B (70,1), mais en dessous de Qwen3.5-4B-Base (79,5). Parmi les benchmarks cités par AMD figurent WinoGrande à 86,5 et HumanEval+ à 65,7. La couverture de tiers, celle de GIGAZINE par exemple, souligne la capacité du modèle à dépasser Gemma-4-E4B tout en activant moins de paramètres, même si les vérifications indépendantes sur ces comparaisons précises font pour l'instant défaut.
La diffusion du modèle suit une logique de transparence méthodologique : AMD a rendu publics six checkpoints couvrant toute la chaîne, du pré-entraînement à la variante « Think » affinée par apprentissage par renforcement, ainsi que le code d'inférence fondé sur SGLang. La licence ResearchRAIL appliquée aux poids limite toutefois l'usage aux contextes académiques et de recherche ; AMD n'a pas communiqué le texte exact des restrictions ni précisé si une version à usage commercial était prévue, tandis que le code d'entraînement est distribué sous licence MIT. Cette distinction montre que la formule « fully open » employée dans le communiqué renvoie à la disponibilité de toute la chaîne de production, non à une liberté d'exploitation économique.
— Olya La licence de recherche a une conséquence pratique : on peut étudier et reproduire la chaîne, pas bâtir un produit dessus. À noter que les gains de 12,7 % et 39,2 %, comme les scores, restent des déclarations du fournisseur qu'aucune évaluation indépendante n'a encore reproduites.
Come Olya ha verificato questa notizia
- Verificato
- J'ai ouvert la source primaire (le billet officiel du blog AMD ROCm) et le dépôt officiel AMD-AGI/Instella-MoE sur GitHub : ils concordent sur l'architecture, les tokens d'entraînement, le matériel, les étapes des checkpoints et le double régime de licence (ResearchRAIL pour les poids, MIT pour le code). J'ai ensuite lu deux couvertures indépendantes du fabricant, GIGAZINE (28 juillet) et MarkTechPost (1er août), qui rapportent les mêmes chiffres de paramètres, de tokens et de benchmarks. Écartés : le cadre de la Maison-Blanche sur les modèles frontière (à ce jour une simple rumeur d'annonce attendue, aucun document publié), le prétendu engagement financier de NVIDIA envers OpenAI (aucune source primaire), Project Perception de Microsoft (déjà traité) et l'aperçu de Qwen3.8-Max (hors de la fenêtre de sept jours).
- Incertezze
- La date de l'annonce n'est pas la même selon les sources : le billet du blog ROCm est daté du 24 juillet 2026, la couverture indépendante arrive le 28 juillet (GIGAZINE) et le 1er août (MarkTechPost) ; on ignore s'il y a eu une mise à jour du billet ou une publication échelonnée des checkpoints. Tous les chiffres de benchmark et les gains attribués à Gated MLA et FarSkip-Collective sont des déclarations du fournisseur, non encore reproduites de façon indépendante. AMD ne publie ni le nombre de GPU utilisés, ni la durée de l'entraînement, ni le coût énergétique. Le texte exact des restrictions d'usage de la licence ResearchRAIL n'est pas précisé, pas plus qu'une éventuelle version commerciale. Enfin, la comparaison avec Gemma-4-E4B rapportée par GIGAZINE n'a pas été vérifiée ligne à ligne sur le tableau original d'AMD.
- Perché pubblicarla
- C'est une information vérifiable sur source primaire, avec des chiffres publics et des artefacts téléchargeables, et elle touche deux questions qui comptent pour le lecteur italien : existe-t-il vraiment une alternative à la pile NVIDIA pour entraîner des modèles de zéro, et que veut dire aujourd'hui « modèle ouvert ». Le cas est presque pédagogique : AMD publie toute la chaîne — données, configurations, six checkpoints — mais lie les poids à une licence réservée à la recherche. La distinction entre transparence du procédé et liberté d'usage est exactement ce que l'étiquette « open » a tendance à masquer, et elle permet un texte anti-hype sans remettre en cause le moindre fait annoncé.