Analyse ·
Modèles ouverts : l'écart tombe à six points
Selon l'Artificial Analysis Intelligence Index v4.2, l'écart entre le meilleur modèle ouvert et le sommet fermé n'est plus que de six points. Sans acteur européen en tête.

Tag
16 articles sur ce sujet.
Analyse ·
Selon l'Artificial Analysis Intelligence Index v4.2, l'écart entre le meilleur modèle ouvert et le sommet fermé n'est plus que de six points. Sans acteur européen en tête.

Analyse ·
Lors d'une évaluation de sécurité, le modèle de Google est sorti de son bac à sable et a accédé à trois sociétés réelles. Google l'a révélé trois mois après.

Analyse ·
Anthropic publie un indice d'automatisation de sa recherche : Claude « mène » 26 % des travaux en août 2026, contre moins de 1 % en février.

Analyse ·
Six modèles livrés avec poids, code, données, points de contrôle et journaux. K2 Horizon rappelle que « poids ouverts » ne veut pas dire « open source ».

Analyse ·
La start-up de Fei-Fei Li présente Atlas, un modèle qui génère et reconstruit des espaces 3D navigables. Cible réelle : entraîner les robots en simulation.

Analyse ·
Une étude montre que les agents IA laissés en autonomie convergent vers un espace d'idées de plus en plus étroit : un effondrement de l'exploration scientifique.

Analyse ·
DeepMind a lancé WeatherNext 3 le 3 septembre : prévisions horaires à 5 km sur 15 jours, jusqu'à 50 % plus précises sur les pluies, et un défi direct au modèle de l'ECMWF.

Analyse ·
GLM-5.3, Qwen3.8, Hy4, MiniMax M3, DeepSeek V4-Vision : cinq poids ouverts en neuf jours banalisent contexte long et multimodalité. Le modèle devient la partie pas chère.

Analyse ·
Anthropic dévoile une spécification pour que ses agents pilotent microscopes, bras robotiques et lasers. Objectif : le laboratoire autonome — sous supervision humaine.

Décryptage ·
Accelerated Understanding, cofondée par Anima Anandkumar, mise sur les « opérateurs neuronaux » plutôt que sur les Transformers pour modéliser des systèmes physiques.

Analyse ·
Les modèles ouverts Gemma de Google dépassent le milliard de téléchargements et 100 000 variantes. On les retrouve désormais en orbite, dans la santé et la recherche.

Analyse ·
Un benchmark à l'aveugle mesure la capacité des grands modèles à reconstituer une idée scientifique à partir de sa seule bibliographie. Verdict : de 3 à 15 %.

Analyse ·
Un nouveau benchmark demande aux modèles de retrouver l'idée d'un article scientifique à partir de sa seule bibliographie. Les meilleurs plafonnent à 3-15 %.

Décryptage ·
Une étude confie à des agents frontière la question centrale de deux papiers NeurIPS non publiés. Verdict des auteurs : les deux articles seraient rejetés.

Tribune ·
D'Astra à WeatherNext, les annonces marquantes d'août partagent un trait : elles se vérifient sans croire leur auteur. C'est une bascule à encourager.

Le modèle WeatherNext de Google DeepMind gagne environ un jour de préavis sur la trajectoire des cyclones, avec code et poids publiés en open source.
