Décryptage · Outils
Gemini 3.7 Flash : Google mise sur le cheval de trait à moitié prix, son modèle phare toujours en attente
Google lance Gemini 3.7 Flash pour le code et les agents, à moitié prix, trois semaines après la 3.6 — pendant que son modèle phare Gemini 3.5 Pro se fait attendre.

Google vient de rappeler où se joue vraiment la bataille de l'IA au quotidien : pas dans le modèle le plus puissant, mais dans celui qui fait le travail le plus vite et le moins cher. Le 13 août, l'entreprise a rendu Gemini 3.7 Flash généralement disponible, à peine trois semaines après la 3.6 Flash, en le présentant comme son « modèle de trait le plus intelligent à ce jour pour le code et les agents ». Un rythme de sortie qui en dit long sur la stratégie.
Un « workhorse » taillé pour le code et les agents
La 3.7 Flash n'est pas un modèle vitrine, c'est un cheval de trait. Google revendique des progrès « substantiels » en ingénierie logicielle, développement web et flux agentiques : meilleure résolution de bugs, code exploitable dès le premier essai plus fréquent, interfaces générées plus fonctionnelles, planification multi-étapes plus fiable. Sur les benchmarks maison, l'entreprise affirme devancer Claude Sonnet 5 d'Anthropic et GPT-5.6 Terra d'OpenAI sur neuf tests, dont le classement de code FrontierCode 1.1.
Techniquement, le modèle repose sur une architecture à mélange d'experts (comme la 3.6), accepte jusqu'à 1 million de tokens en entrée — texte, images, vidéo — et génère jusqu'à 64 000 tokens par réponse. De quoi ingérer un dépôt entier ou une longue documentation avant d'agir.
« Gemini 3.7 Flash améliore l'expérience développeur, s'adapte mieux aux obstacles et clarifie l'intention quand c'est nécessaire. »
Tulsee Doshi, directrice senior produit chez GoogleL'argument massue : la moitié du prix
Le vrai coup, c'est le tarif. Google facture la 3.7 Flash à 0,75 dollar le million de tokens en entrée et 3,75 dollars en sortie — environ la moitié du prix de la 3.6, en tarif de lancement valable jusqu'au 31 décembre 2026. Dans l'économie des agents, où un même modèle est appelé des centaines de fois pour accomplir une tâche, ce facteur deux sur le coût unitaire change tout : il déplace le point à partir duquel automatiser devient rentable.
La distribution suit la même logique de volume. Dès le jour du lancement, la 3.7 Flash est arrivée dans GitHub Copilot et alimente Gemini Spark, l'agent personnel « 24/7 » de Google proposé aux abonnés AI Pro et Ultra dans plus de 160 pays. Google ne vend pas un modèle : il l'injecte partout où des développeurs et des utilisateurs peuvent le consommer en masse.
Le paradoxe : le phare tarde, la lampe torche brille
Il y a pourtant un absent de marque dans ce tableau. Google enchaîne les versions « Flash » — la 3.6, puis la 3.7 en trois semaines — alors que son modèle phare, Gemini 3.5 Pro, se fait toujours attendre. La cadence sur le segment rapide contraste avec le retard sur le haut de gamme, au moment même où la firme traverse une recomposition de sa direction IA.
Faut-il y voir une faiblesse ou un choix ? Les deux, sans doute. Un flagship qui glisse dans le calendrier signale des arbitrages internes difficiles. Mais miser sur les modèles rapides et bon marché est aussi une lecture lucide du marché : la majorité des tokens consommés en production ne le sont pas par des modèles de raisonnement coûteux, mais par des « workhorses » qui traitent du volume. En saturant ce segment, Google verrouille l'usage quotidien pendant que ses concurrents polissent leurs vitrines.
Ce que ça change pour les équipes européennes
Pour un développeur ou une PME en France, la conséquence est immédiate : le coût d'accès à un modèle capable de coder et de piloter des agents vient d'être divisé par deux, et l'outil est déjà intégré aux environnements qu'ils utilisent — à commencer par GitHub Copilot. La contrepartie est connue : cette dépendance se paie en résidence des données et en verrouillage. Sur ce point précis, l'offre de Google — puissante, bon marché, hébergée hors d'Europe par défaut — est le miroir exact de ce que Mistral tente de contrer avec ses points d'accès régionaux. Le même service, deux philosophies de souveraineté. À chaque équipe de trancher ce qu'elle est prête à externaliser.