Analyse

IA et recherche scientifique : pourquoi les petits modèles gagnent

On demande à un laboratoire de « faire de l’IA », et il regarde d’abord les modèles les plus gros. C’est souvent le plus petit qui gagne, et il tient chez lui.

Une personne penchée sur l’oculaire d’un microscope, le visage éclairé d’une lumière rouge
Le bon modèle est celui qui tient sur votre tâche

Dans les organisations scientifiques que nous accompagnons, la conversation sur l’IA commence presque toujours de la même façon : quel est le meilleur modèle, et combien coûte son abonnement. La question paraît raisonnable. Elle conduit pourtant, dans neuf cas sur dix, à envoyer des données de recherche chez un fournisseur étranger pour des tâches qu’un modèle bien plus modeste traiterait aussi bien, sur une machine posée dans le couloir. C’est le paradoxe de l’IA en recherche scientifique : la puissance s’achète, la pertinence se choisit.

L’édition 2026 de l’AI Index de Stanford apporte, sur l’IA et la recherche scientifique, un ensemble de résultats qui vont tous dans le même sens (Stanford HAI, AI Index 2026) : la taille n’est pas le bon critère, la spécialisation gagne, et les performances sont très inégales selon les domaines. Pour un laboratoire, c’est une excellente nouvelle — et elle change la conversation.

L’IA en recherche scientifique dépasse les chimistes, et échoue sur des tâches simples

Le rapport donne deux images à tenir ensemble. Sur ChemBench, un ensemble de plus de 2 700 questions de chimie, les meilleurs modèles dépassent la moyenne des experts humains (AI Index 2026, p. 233). Le même passage note qu’ils trébuchent sur des tâches élémentaires, ce qu’aucun chimiste ne ferait.

Dès qu’on demande davantage que de répondre, les scores s’effondrent. Sur ReplicationBench, qui consiste à reproduire les résultats d’un article d’astrophysique, les modèles restent sous les 20 % (AI Index 2026, p. 237). Sur UnivEARTH, cent quarante questions d’observation de la Terre, les agents atteignent 33 %, et le code qu’ils produisent échoue dans près de six cas sur dix (AI Index 2026, p. 248).

Il n’y a pas de contradiction. Répondre à une question fermée dans un domaine bien couvert par la littérature est une tâche ; conduire un raisonnement long, avec des données réelles et des outils, en est une autre. Pour un laboratoire, la conclusion est opérationnelle : l’IA se juge tâche par tâche, jamais en bloc. C’est la même discipline que celle décrite dans l’article qui ouvre cette série.

Il y a une manière simple d’en tirer parti sans attendre. Prenez trente questions de votre domaine dont vous connaissez la réponse, mélangez-y cinq cas où la bonne réponse est « on ne sait pas », et faites-les passer au modèle que l’on vous propose. En une demi-journée, vous saurez ce qu’aucune démonstration commerciale ne vous dira : où il est bon, où il invente, et s’il sait reconnaître qu’il ignore.

Les petits modèles battent les géants

C’est le résultat le plus frappant de l’édition. MSAPairformer, avec 111 millions de paramètres, dépasse les meilleures méthodes antérieures sur la prédiction d’effets de variants, pour une fraction du budget de calcul (AI Index 2026, p. 261). GPN-Star, avec 200 millions de paramètres, fait mieux qu’un modèle de 40 milliards — environ deux cents fois plus gros — sur plusieurs tâches du même type (AI Index 2026, p. 265).

La formulation compte : « sur plusieurs tâches », pas « partout ». Un petit modèle spécialisé ne remplace pas un grand modèle généraliste sur tout ; il le bat là où il a été conçu pour travailler. C’est précisément la situation d’un laboratoire, qui n’a pas besoin d’un modèle capable de tout, mais d’un modèle capable de sa tâche.

Le coût suit la taille. Un modèle de quelques centaines de millions de paramètres tient dans la mémoire d’une machine de bureau bien équipée, s’exécute sans abonnement et, surtout, se fige : on garde la version qui a servi, on la rejoue à l’identique, et l’on peut expliquer un résultat deux ans plus tard. Dans un contexte réglementé, ce n’est pas un détail de confort.

Une précision technique s’impose, car elle évite un projet inutile. Passer à un modèle compact ne veut pas dire l’entraîner. Dans l’immense majorité des cas, il s’agit d’exécuter un modèle publié tel quel et de lui donner accès aux bons documents — les vôtres. L’entraînement spécialisé, lui, relève du laboratoire de recherche, avec les compétences et le calcul qui vont avec. Confondre les deux fait renoncer des équipes qui auraient obtenu l’essentiel en trois semaines.

La spécialisation l’emporte sur la généralité

Le rapport rend compte d’un concours de conception de protéines visant le virus Nipah. Sur 1 026 propositions testées expérimentalement, 99 se lient effectivement à la cible — et aucune ne la neutralise (AI Index 2026, p. 265). La méthode spécialisée engagée dans le concours obtient les meilleurs résultats, avec une réserve que nous tenons à rapporter : elle n’avait soumis que neuf propositions.

Ce double constat est le plus honnête du chapitre. Oui, les approches dédiées prennent l’avantage. Non, la conception assistée n’a pas encore produit l’effet recherché sur cette cible. Un laboratoire qui lit cela y trouvera de quoi lancer un projet, et de quoi refuser une promesse : entre « se lie » et « neutralise », il y a toute la différence entre un résultat de criblage et un médicament.

Le rapport ajoute une observation qui va à rebours du reste du secteur : les modèles d’IA pour la science viennent en majorité d’institutions académiques et publiques, et beaucoup sont le fruit de collaborations internationales (AI Index 2026, p. 233). Là où l’IA généraliste est produite à plus de 90 % par l’industrie, la science garde donc une part d’autonomie — et des modèles publiés, que l’on peut exécuter soi-même.

En santé, des gains réels et des preuves minces

Les outils de prise de notes cliniques montrent des gains substantiels : jusqu’à 83 % de temps de rédaction en moins, selon des systèmes de santé américains qui rapportent leurs propres résultats (AI Index 2026, p. 277). La donnée est américaine et déclarative ; elle mérite d’être citée, pas transposée telle quelle à un cabinet français.

La revue qui suit est plus sévère. Sur plus de 500 études d’IA clinique passées en revue, 5 % seulement utilisent de vraies données cliniques, et près de la moitié reposent sur des questions de type examen (AI Index 2026, p. 278). Autrement dit, la littérature évalue surtout la capacité des modèles à réussir des tests, rarement leur effet sur des patients. C’est le genre d’écart qu’un comité scientifique repère en trente secondes, et qu’un argumentaire commercial passe volontiers sous silence.

Ce que cette revue suggère pour la négociation est immédiat. Devant un outil vendu comme validé, trois questions suffisent : sur quelles données l’évaluation a-t-elle porté, combien de cas, et le résultat a-t-il été reproduit par une équipe indépendante ? Si les réponses tiennent à des questions d’examen et à une démonstration, l’outil peut être utile, mais il n’est pas prouvé. La distinction est familière à tout comité scientifique ; elle se perd curieusement quand le sujet devient logiciel.

Ce que cela ouvre pour les données sensibles

Mettez les trois constats bout à bout : un modèle compact suffit souvent, il tourne sur du matériel ordinaire, et les modèles scientifiques sont publiés plus souvent qu’ailleurs. La conséquence est directe pour qui manipule des données précliniques, des dossiers réglementaires ou des résultats non publiés : il devient possible de faire de l’IA sérieuse sans que rien ne sorte du périmètre.

Les usages qui se prêtent le mieux à cette bascule ne sont pas les plus spectaculaires. Chercher dans dix ans d’études internes, classer des publications entrantes, extraire des valeurs d’un rapport d’essai, préparer un résumé qu’un expert validera : ce sont des tâches bornées, vérifiables, et dont la valeur tient au fait qu’elles portent sur vos données, pas sur celles du monde entier. Le cadre juridique et les couches à maîtriser sont détaillés dans notre article sur la souveraineté numérique ; le côté matériel et exploitation, dans faire tourner un LLM dans l’entreprise.

La course à la taille est un débat d’éditeurs. Pour un laboratoire, la question utile est plus étroite et plus exigeante : ce modèle-là, sur cette tâche-là, avec mes données, fait-il mieux que ce que nous faisons aujourd’hui, et puis-je le prouver ? Les résultats rassemblés cette année montrent qu’on peut répondre oui bien plus souvent qu’on ne le croit — et sans rien confier à personne.

Questions fréquentes

Qu’est-ce qu’un small language model ?

Un modèle de langage de taille réduite — quelques centaines de millions à quelques milliards de paramètres — conçu pour une famille de tâches plutôt que pour tout faire. Il tient en mémoire sur du matériel ordinaire, coûte peu à exécuter, et se fige sur une version précise.

L’IA dépasse-t-elle les chercheurs ?

Sur certaines épreuves fermées, oui : les meilleurs modèles dépassent la moyenne des experts sur un examen de chimie de plus de 2 700 questions. Sur la réplication d’un article d’astrophysique, ils restent sous les 20 %. La performance dépend entièrement de la tâche.

Peut-on utiliser l’IA sur des données de recherche confidentielles ?

Oui, à condition que le modèle s’exécute sur une infrastructure maîtrisée et que sa version soit figée. Les modèles compacts publiés rendent cette option réaliste : les données ne quittent pas le périmètre, et un résultat peut être rejoué à l’identique lors d’un audit.

Source : Stanford HAI, Artificial Intelligence Index Report 2026, publié le 29 juin 2026 sous licence CC BY-ND 4.0. Les numéros de page renvoient au fichier PDF. Les gains rapportés sur la prise de notes cliniques proviennent de systèmes de santé américains et sont auto-déclarés. Cet article est une analyse de Maeliom ; il n’est ni une traduction ni une adaptation du rapport, et n’est ni affilié à Stanford University ni approuvé par elle.


Article suivant

IA et emploi : qui formera les seniors de demain ?

Lire

Une transformation à accompagner ?