Analyse ·
Reconstruction : les IA échouent à retrouver les idées de recherche
Un benchmark à l'aveugle mesure la capacité des grands modèles à reconstituer une idée scientifique à partir de sa seule bibliographie. Verdict : de 3 à 15 %.

Tag
3 articles sur ce sujet.
Analyse ·
Un benchmark à l'aveugle mesure la capacité des grands modèles à reconstituer une idée scientifique à partir de sa seule bibliographie. Verdict : de 3 à 15 %.

Analyse ·
Un nouveau benchmark demande aux modèles de retrouver l'idée d'un article scientifique à partir de sa seule bibliographie. Les meilleurs plafonnent à 3-15 %.

Décryptage ·
Une étude confie à des agents frontière la question centrale de deux papiers NeurIPS non publiés. Verdict des auteurs : les deux articles seraient rejetés.
