Un courriel arrive. Le workflow IA de l’entreprise l’envoie à un grand modèle de langage avec une consigne simple : facture, réclamation ou prospection ? La réponse met plusieurs secondes à venir, chaque appel est facturé, et elle arrive parfois sous une forme que le logiciel suivant ne sait pas lire : une phrase au lieu d’un mot, une catégorie qui n’existe pas.
Rien de tout cela n’est une panne. C’est le fonctionnement normal d’un outil conçu pour écrire, à qui l’on demande de trier. Avant d’automatiser davantage, la question mérite d’être posée : est-ce le bon outil pour ce geste-là ?
Système 1, Système 2 : la distinction que l’automatisation a oubliée
Dans Système 1 / Système 2. Les deux vitesses de la pensée, le psychologue Daniel Kahneman décrit deux régimes de pensée. Le premier est rapide, automatique, presque sans effort : reconnaître un visage, sentir qu’une phrase sonne faux. Le second est lent, délibéré, coûteux : poser une multiplication, peser deux options, construire un argument.
Les grands modèles de langage actuels, surtout lorsqu’ils raisonnent pas à pas avant de répondre, relèvent du second régime. Ils excellent quand il faut construire une réponse : synthétiser un dossier, rédiger un courrier, expliquer un écart.
Or, dans un logiciel, la plupart des décisions relèvent du premier. Ce ticket concerne-t-il la facturation ou le support technique ? Ce document est-il un bon de commande ou un devis ? Personne ne rédige la réponse à ces questions : on la reconnaît. Et un processus en pose des centaines par jour.
En adoptant l’IA générative, l’automatisation a importé un outil du Système 2 pour des gestes du Système 1. Cela fonctionne, la plupart du temps. Mais c’est un choix par défaut, pas un choix de conception.
Ce que la sortie de Jev dit du marché
Le 15 septembre 2026, la société américaine TypeSafe AI a présenté Jev, qu’elle décrit comme le premier « System One Model ». Son fondateur, Diogo Almeida, est passé par OpenAI, où il a travaillé sur les méthodes d’entraînement qui ont conduit à ChatGPT.
Jev ne produit pas de texte. Il reçoit l’état d’un programme et des questions dont la forme est fixée à l’avance (choisir parmi des options, situer sur une échelle, répondre par oui ou par non), et renvoie pour chacune une réponse typée assortie d’une probabilité. Selon l’éditeur, il répondrait en 70 à 500 millisecondes, 40 à 200 fois plus vite que les modèles de pointe, pour 0,042 dollar par million de tokens en entrée, la sortie n’étant pas facturée.
Le produit compte moins que le signal. Un chercheur qui a contribué à faire de la conversation la forme dominante de l’IA considère qu’elle n’est pas la bonne forme pour automatiser. Le marché commence à distinguer l’outil qui écrit de l’outil qui décide.
Ce qu’on ne sait pas encore
Beaucoup. Les performances annoncées ont été mesurées par TypeSafe sur ses propres évaluations, et n’ont pas été reproduites de manière indépendante à la date où nous écrivons. L’éditeur affirme qu’une réponse hors du format prévu est impossible ; c’est son affirmation, pas un constat. L’accès passe par une liste d’attente. Le modèle renvoie des probabilités sans justification, ce qui pose la question de l’explication d’une décision après coup, relevée par DataCamp.
Enfin, TypeSafe indique que son service est aujourd’hui opéré depuis la côte Ouest des États-Unis. Pour une entreprise européenne qui ferait passer ses flux métier par ce type de modèle, ce point n’a rien d’un détail. Nous y consacrons un article à part.
Quatre gestes qui relèvent du réflexe dans un workflow IA
Dans les processus que nous observons, les étapes confiées à l’IA se ramènent le plus souvent à quatre gestes. Aucun ne demande d’écrire.
Trier
Trier, c’est ranger un élément entrant dans une catégorie connue : c’est une classification. Un cabinet reçoit chaque matin des courriels qui doivent rejoindre le bon dossier ; une PME industrielle, des bons de livraison, des factures et des certificats de conformité. Le tri ne demande pas de comprendre tout le document, seulement de reconnaître ce qu’il est.
Aiguiller
Aiguiller, c’est décider où va un élément une fois qu’on sait ce qu’il est : vers quelle personne, quelle équipe, quel outil, et parfois quel modèle. Une demande client part vers le commercial du secteur, vers le support ou vers la comptabilité. Dans une chaîne plus élaborée, le routage choisit aussi le traitement suivant : une question simple reçoit une réponse type, une question complexe part vers un modèle plus lent ou vers un humain.
Noter
Noter, c’est situer un élément sur une échelle. Le scoring d’un prospect entrant, la priorité d’un ticket, le niveau de risque d’une demande de remboursement : dans chaque cas, on veut une position sur une échelle courte, pas un commentaire. Une PME qui reçoit beaucoup de demandes de devis n’a pas besoin d’une analyse de chacune, mais de savoir lesquelles traiter aujourd’hui. La note est utile si elle est rapide, stable d’un jour à l’autre, et accompagnée de son degré de confiance.
Contrôler
Contrôler, c’est vérifier ce qu’un autre a produit, et de plus en plus souvent ce qu’un autre modèle a produit. La réponse rédigée par un assistant respecte-t-elle le format attendu ? Contient-elle une donnée personnelle qui ne devrait pas sortir ? Ce garde-fou passe sur chaque sortie : il doit être rapide, peu coûteux, et dire quand il n’est pas sûr. Le confier au même type de modèle que celui qu’on contrôle revient à demander à un rédacteur de relire son propre texte.
Dans les quatre cas, le besoin est le même : une réponse choisie dans une liste fermée, obtenue vite, avec un niveau de confiance exploitable.
Pourquoi le LLM est un mauvais aiguilleur
Les grands modèles de langage font très bien ce pour quoi ils ont été conçus. Mais trois de leurs caractéristiques jouent contre eux dès qu’on leur demande d’aiguiller.
La lenteur et le coût à l’unité. Un LLM produit sa réponse mot après mot. Pour choisir entre trois catégories, il génère du texte, parfois un raisonnement complet, avant d’arriver au mot utile. Sur une étape appelée des milliers de fois par jour, ce détour se paie en secondes et en factures.
L’assurance sans calibrage. Un LLM répond avec le même aplomb, qu’il soit sûr ou qu’il devine. Le ton ne dit rien de la fiabilité. C’est la forme la plus discrète de l’hallucination en IA : non pas une invention spectaculaire, mais une catégorie plausible et fausse, présentée comme certaine, que personne ne vérifiera parce que rien ne la signale.
Le format. La réponse est du texte, que le logiciel doit relire pour en extraire la décision. Une virgule en trop, une catégorie légèrement reformulée, et l’étape suivante échoue ou, pire, se trompe sans le dire.
On peut atténuer ces défauts. La plupart des fournisseurs proposent désormais des sorties structurées qui contraignent le format, et l’on peut demander au modèle d’indiquer sa confiance, sans garantie que ce chiffre en soit une mesure fidèle. Cela améliore l’outil. Cela ne change pas le registre : on continue de faire rédiger une décision qui ne demande qu’un réflexe.
Le vrai sujet : la probabilité et le seuil
Une fois ce tri fait, l’essentiel reste à décider, et ce n’est pas une question d’outil. La valeur d’une décision automatisée ne tient pas à la décision elle-même, mais à ce que l’on fait de son niveau de confiance.
Le principe est simple. Chaque décision arrive avec une probabilité. Au-dessus d’un seuil de confiance fixé à l’avance, le logiciel agit seul : le courriel est classé, le ticket routé, la demande notée. En dessous, la décision part ailleurs, vers une personne ou vers un modèle plus lent qui prendra le temps de raisonner. Le réflexe traite le courant ; la délibération est réservée aux cas qui la méritent. C’est une manière précise de placer l’humain dans la boucle : là où il est utile, pas partout.
Ce seuil n’est pas un paramètre technique. Il traduit une question d’organisation : combien d’erreurs l’entreprise accepte-t-elle sur cette étape, et qui les rattrape ? Un tri de courrier entrant tolère quelques erreurs, qu’un assistant corrigera en passant. Une décision de remboursement, beaucoup moins. Le même modèle, avec la même précision, peut convenir parfaitement à la première étape et être dangereux sur la seconde.
C’est aussi ce qui rend un agent IA d’entreprise digne de confiance. Un agent enchaîne de nombreux aiguillages avant de produire quoi que ce soit de visible. S’ils sont faits sans seuil, ses erreurs se composent en silence. Un agent n’est jamais plus fiable que ses aiguillages.
Rien de tout cela ne se règle dans le code. Cela se conçoit avant, avec ceux qui connaissent le processus, comme toute transformation qui touche l’organisation plus que l’outil.
Relire son workflow IA en trois questions
Avant de changer d’outil, trois questions suffisent à relire un processus existant.
- Quelles étapes produisent une réponse fermée : une catégorie, une destination, une note, un oui ou un non ?
- Pour chacune, que coûte une erreur, et qui la rattrape aujourd’hui ?
- Quel niveau de confiance justifie d’agir sans intervention humaine ?
Ces trois questions valent quel que soit l’outil retenu : un modèle de décision comme Jev, un petit modèle exécuté en local, ou une simple règle métier. La réponse est d’ailleurs souvent la règle. Le guide pratique consacré à Jev le rappelle lui-même : ce qu’un programme peut calculer exactement, de manière déterministe, ne se demande pas à un modèle.
Reprenons le courriel du début. Dans un workflow repensé, il est d’abord trié par un outil conçu pour trier, en une fraction de seconde. Si la catégorie est sûre, il rejoint son dossier sans que personne ne le voie. Si elle ne l’est pas, il part vers quelqu’un qui tranchera, et cette hésitation devient une information : elle montre où le processus est ambigu. Le grand modèle de langage n’intervient que là où il faut écrire : répondre au client, résumer la réclamation.
Automatiser, c’est d’abord décider qui décide. Reste une question, que l’on pose rarement assez tôt : qui voit passer toutes ces décisions ?
Questions fréquentes
Qu’est-ce qu’un workflow IA ?
Un workflow IA est un processus automatisé dont certaines étapes sont confiées à un modèle d’intelligence artificielle : trier des messages, router des demandes, noter des dossiers, rédiger des réponses. La plupart de ces étapes sont des décisions fermées ; seules quelques-unes demandent réellement de produire du texte.
Faut-il un LLM pour automatiser une classification ?
Pas nécessairement. Une classification attend une réponse choisie dans une liste fermée, vite, avec un niveau de confiance. Un grand modèle de langage peut le faire, mais lentement et sans calibrage fiable. Un modèle de décision, un petit modèle local ou une règle métier conviennent souvent mieux, selon le volume et le coût d’une erreur.
Qu’est-ce qu’un System One Model ?
C’est le nom donné par TypeSafe AI, en septembre 2026, à une catégorie de modèles qui ne génèrent pas de texte : ils reçoivent l’état d’un programme et des questions typées, et renvoient des décisions structurées avec des probabilités. Le nom renvoie au Système 1 de Daniel Kahneman, la pensée rapide et intuitive.
Sources : TypeSafe AI, présentation des System One Models et de Jev (15 septembre 2026) ; The Register (16 septembre 2026) ; DataCamp ; DEV Community, guide pratique ; The Rundown AI ; AI News. Les performances citées sont celles déclarées par l’éditeur, non reproduites de manière indépendante en septembre 2026.