Mardi 11 août 2026
Édition nº 412 · ParisIndice d'attention IA : 11 articles / 7 j
Fil actif — 17:40
Le quotidien de
l'intelligence artificielle

ia-actualité.fr

Modèles · Recherche
Régulation · Usages

Analyse · Recherche

Cinq modèles open-weight en neuf jours : la prime à la capacité s'effondre

GLM-5.3, Qwen3.8, Hy4, MiniMax M3, DeepSeek V4-Vision : cinq poids ouverts en neuf jours banalisent contexte long et multimodalité. Le modèle devient la partie pas chère.

Cinq modèles open-weight en neuf jours : la prime à la capacité s'effondre

En neuf jours, entre le 21 et le 29 août, cinq laboratoires ont publié des modèles à poids ouverts qui, il y a un an encore, auraient chacun mérité une conférence de presse. Aujourd'hui, ils se télescopent dans le flux comme des mises à jour de routine. Ce n'est pas un détail de calendrier : c'est le symptôme d'un basculement. Les trois fonctionnalités qui justifiaient il y a peu un abonnement premium — contexte d'un million de tokens, multimodalité native, licence permissive — sont devenues la norme d'entrée de gamme. La conséquence est brutale pour les éditeurs : le modèle est en train de devenir la partie la moins chère de la chaîne.

La rafale d'août

Le décompte donne le vertige. Le 21 août, DeepSeek pousse V4-Flash-Vision-Exp, qui égale son aîné sur le texte et « approche ou dépasse Opus 4.8 » sur les tâches d'agents visuels. Le 24, MiniMax ouvre M3 (428 milliards de paramètres en mélange d'experts, contexte d'un million de tokens, multimodal natif texte-image-vidéo). Le 26, coup double : Z.ai sort GLM-5.3-Flash (320 milliards de paramètres, 18 actifs, licence MIT) et Alibaba dévoile Qwen3.8-Flash, avant-goût de l'architecture Qwen4. Le 28, Tencent enchaîne avec Hy4 Preview (770 milliards de paramètres, 49 actifs), donné en tête sur SWE-bench Pro.

5
Modèles open-weight majeurs publiés en neuf jours
1 M
Tokens de contexte, désormais standard sur le segment « flash »
MIT
Licence d'un modèle de 320 milliards de paramètres (GLM-5.3-Flash)
0,15 $
Coût par million de tokens en entrée (GLM-5.3-Flash)

Le point commun n'est pas la taille — elle varie de 125 à 770 milliards de paramètres — mais la trajectoire des prix et des licences. GLM-5.3-Flash s'affiche à 0,15 dollar le million de tokens en entrée et 0,50 en sortie ; Qwen3.8-Flash à 0,16 et 0,47. Des tarifs qui étaient, il y a dix-huit mois, ceux de modèles bien moins capables et fermés.

La thèse : la capacité ne se vend plus

L'analyse que l'on peut tirer de cette séquence tient en une phrase, empruntée à la synthèse qu'en fait le cabinet Requesty : « le modèle est désormais la partie pas chère, et la partie coûteuse, c'est tout ce qu'il y a autour — réglages d'effort, taux de cache, choix du fournisseur, comportement en cas d'échec. » Autrement dit, la valeur migre du poids du modèle vers l'ingénierie d'exécution.

Trois basculements se conjuguent. D'abord, le contexte d'un million de tokens n'est plus un argument différenciant : il est présent sur des modèles de milieu de gamme. Ensuite, la multimodalité native — et non plus des encodeurs greffés après coup — devient le défaut. Enfin, et c'est le plus lourd de conséquences, des licences permissives comme MIT s'appliquent désormais à des modèles de 320 milliards de paramètres. Un acheteur peut télécharger, modifier et déployer sans redevance un modèle proche de la frontière. La question « quel modèle est le meilleur ? » cède la place à « quelle infrastructure d'exécution me coûte le moins cher à qualité donnée ? ».

Ce que ça change pour l'Europe et les entreprises

Pour un DSI européen, cette commoditisation est une aubaine et un piège. Une aubaine, parce que des poids ouverts et performants, déployables sur site, résolvent d'un coup les questions de coût, de dépendance et de conformité — on peut faire tourner un modèle chinois open-weight sur une infrastructure européenne sans qu'aucune donnée ne sorte. Un piège, parce que la profusion déplace la difficulté vers l'intégration : choisir, héberger, router, mettre en cache, surveiller les régressions à chaque nouvelle version hebdomadaire.

La leçon dépasse la seule Chine, d'où proviennent quatre des cinq modèles cités. Elle vaut avertissement pour tous ceux dont le modèle d'affaires repose sur la vente d'accès à un modèle brut : cette rente-là fond à vue d'œil. La valeur défendable se loge désormais dans les couches applicatives — agents, outils verticaux, orchestration — et dans la qualité de l'exécution. La course aux paramètres continue de faire les titres ; la vraie bataille, elle, s'est déjà déplacée ailleurs.