La question qui revient dans toutes les réunions de direction — « est-ce que l’IA est prête ? » — n’a pas de réponse, et c’est ce qui la rend dangereuse. Selon la tâche que l’on a en tête, la réponse honnête va de « depuis deux ans » à « pas du tout », sans qu’aucune règle simple permette de deviner laquelle s’applique. Les limites de l’IA ne se déduisent pas : elles se constatent.
L’édition 2026 de l’AI Index de Stanford en donne l’illustration la plus nette qu’on ait lue (Stanford HAI, AI Index 2026). Les limites de l’IA ne dessinent pas une frontière régulière que l’on franchirait année après année : elles forment une ligne de crête irrégulière, excellente ici, absurde trois centimètres plus loin. D’où l’objet de cet article : une grille pour savoir de quel côté tombe une tâche donnée.
Les limites de l’IA tiennent dans une médaille d’or et une horloge
L’année 2025 a vu un modèle décrocher une médaille d’or aux Olympiades internationales de mathématiques, une épreuve où les meilleurs lycéens du monde échouent régulièrement (AI Index 2026, p. 72). La même famille de modèles lit correctement une horloge à aiguilles dans 50,6 % des cas, quand des humains y parviennent à 90,1 % (AI Index 2026, p. 96).
Le rapprochement n’est pas une anecdote amusante : c’est un avertissement méthodologique. Un dirigeant qui déduit d’une démonstration impressionnante que l’outil saura faire « le reste » se trompe dans les deux sens. Il surestimera l’IA sur des tâches apparemment simples — lire un plan, compter des objets, comparer deux dates —, et il la sous-estimera sur des tâches qu’il croit hors de portée. C’est le même écart que celui mesuré dans l’article qui ouvre cette série, entre ce qu’on déclare et ce qu’on déploie.
Les agents progressent vite et échouent encore
Sur OSWorld, une épreuve qui demande d’accomplir de vraies tâches dans un environnement de bureau — ouvrir un fichier, remplir un formulaire, enchaîner des applications —, le taux de réussite est passé d’environ 12 % à 66,3 % en un an, à six points de la référence humaine mesurée à 72,35 % (AI Index 2026, p. 73 et 113).
Deux lectures de ce chiffre sont possibles, et elles sont toutes les deux vraies. La trajectoire est spectaculaire et rend toute prévision à deux ans hasardeuse. Et un échec sur trois reste un échec sur trois : sur un processus qui tourne cent fois par jour, cela fait trente-trois reprises manuelles, ou trente-trois erreurs si personne ne regarde. La question n’est donc pas la performance du modèle, mais ce que coûte son échec dans votre processus.
L’IA confond savoir et croyance
Le mot d’hallucination de l’IA recouvre des réalités très différentes, et le rapport a le mérite de les séparer. Sur un banc d’essai de questions difficiles, les taux mesurés vont de 22 % à 94 % selon les modèles (AI Index 2026, p. 136). Sur un exercice plus proche des usages d’entreprise — résumer un document fourni —, les mêmes modèles tombent entre 1,8 % et 5,4 %. Citer le premier chiffre sans le second, ou l’inverse, revient à raconter deux histoires opposées avec le même rapport.
Le résultat le plus dérangeant est ailleurs. Lorsqu’une affirmation fausse est présentée au modèle comme la croyance de l’utilisateur, ses performances s’effondrent : un modèle qui distinguait le vrai du faux à plus de 90 % tombe à 14,4 % (AI Index 2026, p. 138). Traduit en langage de bureau : l’outil a tendance à abonder dans votre sens. Celui qui arrive avec une idée préconçue et demande confirmation l’obtiendra, et repartira renforcé dans son erreur.
Cette propriété a une conséquence directe sur le choix des cas d’usage. Une IA est d’autant plus fiable que la réponse attendue est vérifiable par quelqu’un d’autre que celui qui a posé la question. C’est aussi ce qui plaide pour confier les décisions fermées à des mécanismes plus simples, comme nous l’avons montré dans toutes les décisions ne méritent pas un LLM.
Où sont les vrais gains
Les études rassemblées cette année dessinent une ligne claire. Là où la tâche est répétitive, cadrée et mesurable, les gains sont substantiels : 14 à 15 % de tickets traités en plus par heure dans le support client, 26 % de contributions supplémentaires chez des développeurs équipés, environ 50 % de production publicitaire par salarié dans le marketing (AI Index 2026, p. 174). Trois métriques différentes, trois études différentes : elles ne s’additionnent pas et ne se transposent pas telles quelles.
Là où la tâche demande du jugement, du contexte ou une connaissance fine de l’existant, le résultat se dégrade, et parfois s’inverse. L’étude la plus instructive porte sur des développeurs expérimentés travaillant sur leur propre code : équipés d’outils d’IA, ils ont mis environ 19 % de temps en plus, tout en étant convaincus d’avoir été plus rapides (AI Index 2026, p. 219). Le résultat attend d’être répliqué. Mais l’écart entre la perception et la mesure, lui, est un fait d’expérience que nous rencontrons dans presque toutes les missions.
Le cas de l’IA au service client mérite une nuance, parce que c’est le premier auquel on pense et le plus souvent mal posé. Le gain mesuré porte sur des agents humains assistés, pas sur un robot qui répond seul : l’outil suggère, la personne décide et envoie. Substituer au lieu d’assister change la nature du risque — une réponse fausse part alors sans que personne ne l’ait vue, et le coût se compte en clients, pas en minutes.
Une grille en quatre critères pour choisir ses cas d’usage
De tout ce qui précède, nous tirons quatre questions. Elles ne demandent aucune compétence technique, et se posent avant tout essai. Si une seule reçoit une réponse négative, l’usage n’est pas interdit : il demande un garde-fou explicite, ou il attend.
| Critère | La question à se poser | Si la réponse est non |
|---|---|---|
| Tâche structurée | Le travail attendu tient-il dans une consigne qu’on peut écrire en cinq lignes ? | Découpez la tâche avant d’automatiser quoi que ce soit. |
| Résultat mesurable | Saura-t-on dire, dans un mois, si cela a fonctionné — en temps, en volume, en erreurs ? | Prenez la mesure de départ maintenant : après, il sera trop tard. |
| Erreur rattrapable | Que se passe-t-il si la réponse est fausse et que personne ne le voit ? | Réservez l’usage aux brouillons internes, jamais aux sorties qui engagent. |
| Validation humaine | Quelqu’un est-il nommément chargé de relire, et en a-t-il le temps ? | Ne lancez pas : une relecture que personne n’assure n’existe pas. |
Trois usages passent cette grille dans presque toutes les PME : le tri et le routage des demandes entrantes, la préparation d’une première version d’un document qui sera relu, et l’extraction d’informations dans des documents structurés. Trois autres la passent rarement : la réponse directe à un client sans relecture, l’analyse qui fonde une décision d’investissement, et tout ce qui touche à une obligation réglementaire.
Une fois les usages choisis, il reste à écrire ce que chacun a le droit d’en faire : c’est l’objet de la charte IA. Et il reste à regarder ce que ces choix font à l’apprentissage du métier, ce que nous développons dans qui formera les seniors de demain.
La bonne nouvelle de cette édition n’est pas que l’IA progresse : c’est que ses limites deviennent documentées, donc utilisables. Une entreprise qui sait nommer la tâche, mesurer le résultat et désigner le relecteur n’a pas besoin de prévoir ce que l’outil saura faire l’an prochain. Elle saura le tester en une semaine, et décider sur des faits plutôt que sur une démonstration.
Questions fréquentes
Quelles sont les limites de l’intelligence artificielle ?
Elles ne suivent pas la difficulté apparente d’une tâche. Un modèle peut décrocher l’or aux Olympiades de mathématiques et lire une horloge à aiguilles une fois sur deux. Les limites se constatent tâche par tâche, avec un essai mesuré, jamais par déduction.
Pourquoi l’IA hallucine-t-elle ?
Parce qu’elle produit la suite la plus plausible, pas la plus vraie, et qu’elle ne dispose d’aucun moyen interne de signaler son ignorance. Les taux mesurés varient énormément selon l’exercice : de 1,8 % sur un résumé de document fourni à plus de 90 % sur des questions difficiles.
Quels sont les meilleurs cas d’usage de l’IA en entreprise ?
Ceux qui réunissent quatre conditions : une tâche que l’on peut décrire en cinq lignes, un résultat mesurable, une erreur rattrapable, et un relecteur désigné. En pratique : tri des demandes entrantes, premières versions de documents relus, extraction d’informations dans des pièces structurées.
Source : Stanford HAI, Artificial Intelligence Index Report 2026, publié le 29 juin 2026 sous licence CC BY-ND 4.0. Les numéros de page renvoient au fichier PDF. Les taux d’hallucination cités proviennent de deux bancs d’essai distincts, l’un composé de questions difficiles, l’autre d’un exercice de résumé ; ils ne sont pas comparables entre eux. Cet article est une analyse de Maeliom ; il n’est ni une traduction ni une adaptation du rapport, et n’est ni affilié à Stanford University ni approuvé par elle.