L’IA locale désigne un usage de l’intelligence artificielle générative dans lequel le modèle tourne sur des machines que l’entreprise contrôle — ses propres serveurs ou postes — plutôt que chez un fournisseur en ligne. Les questions posées, les documents analysés et les réponses produites ne quittent pas ces machines. Il y a quelques années, faire tourner un grand modèle de langage, ou LLM, en local relevait du laboratoire de recherche. Ce n’est plus le cas : des modèles ouverts performants existent, des outils simples permettent de les exécuter, et le matériel nécessaire tient sur un bureau.
Ce qui suit reste du côté de la décision : pourquoi le faire, ce qu’on peut en attendre, ce que cela coûte, et quand une autre option vaut mieux. Ce n’est pas un tutoriel.
Pourquoi installer un LLM en local
La première raison est la confidentialité, et elle est plus forte qu’on ne le croit. Une offre en ligne peut s’engager contractuellement à ne pas conserver ni réutiliser les données ; il faut alors la croire, et croire ses propres sous-traitants. Un modèle local ne promet rien : il n’y a simplement aucun tiers vers qui les données pourraient partir. La CNIL recommande d’ailleurs de privilégier les systèmes locaux quand des données personnelles de clients ou de collaborateurs sont en jeu.
Trois autres raisons s’y ajoutent. La maîtrise : le modèle ne change pas du jour au lendemain parce que son éditeur l’a mis à jour, et un usage qui fonctionne continue de fonctionner. L’indépendance : pas de dépendance à la politique tarifaire ni à la disponibilité d’un fournisseur. Et la prévisibilité des coûts : une fois le matériel acquis, l’usage n’est plus facturé à la requête.
La raison qui ne tient pas, en revanche, est la mode. Une entreprise dont les usages ne portent pas sur des données sensibles gagnera rarement à exploiter son propre matériel plutôt qu’à souscrire une offre professionnelle bien encadrée.
Ce qu’un modèle local sait faire, et ne sait pas faire
Les modèles ouverts ont beaucoup progressé. L’éditeur français Mistral AI, par exemple, publie plusieurs de ses modèles sous licence Apache 2.0, que l’on peut exécuter sur son propre matériel ; d’autres éditeurs font de même. Des outils comme Ollama rendent leur installation accessible sans compétence de recherche.
| Un modèle local sait bien | Un modèle local fait moins bien |
|---|---|
| Résumer un document, un échange, une réunion | Le raisonnement long et complexe, où les plus grands modèles fermés gardent l’avantage |
| Rédiger et reformuler des textes courants | Les connaissances récentes, faute d’accès à Internet par défaut |
| Classer, extraire des informations, remplir un tableau | Servir beaucoup d’utilisateurs à la fois sans matériel dimensionné |
| Chercher dans les documents de l’entreprise et y répondre | Les tâches très spécialisées sans adaptation préalable |
La recherche dans ses propres documents mérite une mention particulière. C’est souvent l’usage le plus utile d’un modèle local : interroger en langage courant une base de contrats, de procédures ou de dossiers techniques, sans que ces documents quittent l’entreprise. Le modèle n’a pas besoin d’être le plus grand du marché pour cela ; il a besoin d’accéder aux bons documents.
Cet usage demande un travail qu’on sous-estime : préparer les documents. Un modèle ne répond bien qu’à partir de sources à jour, rangées, dont on connaît la version valable. Une base de procédures où coexistent trois versions contradictoires produira des réponses contradictoires, avec la même assurance. Le chantier le plus long d’un projet d’IA locale est souvent celui-là, et il profite à l’entreprise bien au-delà de l’outil.
Le compromis doit être assumé. Pour les tâches les plus exigeantes, les meilleurs modèles fermés restent devant. La bonne question n’est pas de savoir si un modèle local est le meilleur du marché, mais s’il est suffisant pour l’usage visé — et pour la plupart des usages d’une PME, il l’est.
Le matériel : ordres de grandeur
Pour tourner vite, un modèle doit tenir entièrement en mémoire. La quantité de mémoire disponible borne donc la taille des modèles utilisables ; la vitesse de cette mémoire détermine en grande partie la rapidité des réponses. Le calcul de base est simple : un modèle dont les paramètres sont stockés sur 4 bits occupe environ un demi-octet par paramètre, soit une douzaine de gigaoctets pour un modèle de vingt-quatre milliards de paramètres — auxquels s’ajoute la mémoire nécessaire au contexte de la conversation.
Deux familles de machines de bureau illustrent ce qui est accessible en septembre 2026, à titre d’ordre de grandeur et non de recommandation :
- le Mac Studio d’Apple, dont la version M5 Ultra, annoncée le 25 août 2026, peut recevoir jusqu’à 512 Go de mémoire unifiée avec une bande passante de 1,2 To/s, à partir de 5 499 dollars aux États-Unis ;
- le DGX Spark de NVIDIA, doté de 128 Go de mémoire unifiée et présenté par son fabricant comme capable d’exécuter des modèles jusqu’à 200 milliards de paramètres, dont le prix public est passé à 4 699 dollars en février 2026.
Ces chiffres évoluent vite, et les prix en France diffèrent des prix américains : ils se vérifient au moment d’acheter. Ils montrent surtout un ordre de grandeur. Le matériel capable de faire tourner un modèle utile pour une équipe coûte aujourd’hui le prix d’un poste de travail haut de gamme, pas celui d’une salle de serveurs.
Le nombre d’utilisateurs compte autant que la taille du modèle. Une machine qui répond confortablement à une personne peut ralentir nettement quand dix requêtes arrivent en même temps. Le dimensionnement se fait donc à partir de l’usage réel — combien de personnes, quelles requêtes, à quels moments — et se vérifie par un essai de charge avant de s’engager, pas par la fiche technique.
Le coût du matériel n’est pas le seul. Il faut compter l’installation et la configuration, la mise à jour des modèles, la sécurité de la machine et de ses accès, l’électricité, et le temps de quelqu’un pour s’en occuper. Une machine locale sans responsable finit par devenir un risque de plus plutôt qu’une protection.
IA locale, cloud souverain, cloud américain : le comparatif
| Critère | Local | Cloud souverain qualifié | Offre pro d’un fournisseur américain |
|---|---|---|---|
| Où vont les données | Nulle part | Chez un hébergeur européen | Chez le fournisseur, parfois en Europe |
| Droit applicable à l’opérateur | Celui de l’entreprise | Européen, sans loi extraterritoriale | Américain, Cloud Act compris |
| Performance des modèles | Modèles ouverts | Modèles ouverts, parfois plus grands | Les plus grands modèles fermés |
| Coût | Matériel à l’achat, puis exploitation | Abonnement ou consommation | Abonnement par utilisateur ou consommation |
| Effort d’exploitation | Le plus élevé | Moyen | Le plus faible |
Aucune colonne ne gagne partout. Le local offre la garantie la plus forte au prix de l’effort le plus élevé ; l’offre professionnelle américaine offre les meilleurs modèles et le moins d’effort, au prix d’une dépendance juridique ; le cloud souverain se situe entre les deux, à condition de vérifier ce qu’il protège réellement. Le choix se fait usage par usage, selon la sensibilité des données — c’est le raisonnement développé dans ce que l’IA souveraine change pour une entreprise.
Pour démarrer, la démarche la plus sûre tient en trois temps. Choisir un usage précis, portant sur des données qu’on ne veut pas voir sortir. L’essayer sur un matériel modeste ou emprunté, avec un modèle ouvert, pendant quelques semaines, en mesurant ce qu’il fait gagner. Puis décider, à partir de cette mesure, s’il faut investir, confier l’exécution à un prestataire, ou revenir à une offre en ligne pour cet usage.
Il existe enfin une voie intermédiaire pour une entreprise qui veut la garantie du local sans en porter l’exploitation : confier l’exécution à un prestataire qui fait tourner les modèles sur son propre matériel, en France, sans tiers dans le trajet. C’est le principe de l’offre IA souveraine de Maeliom, ouverte en accès anticipé.
Questions fréquentes
Un LLM local est-il aussi bon que ChatGPT ?
Pas pour les tâches les plus complexes, où les grands modèles fermés gardent l’avantage. Pour les usages courants — résumer, rédiger, classer, chercher dans ses documents — les modèles ouverts actuels suffisent le plus souvent.
Faut-il des compétences techniques pour installer un LLM on premise ?
Moins qu’avant : des outils comme Ollama simplifient l’installation. Mais l’exploitation — sécurité, mises à jour, accès des utilisateurs — demande quelqu’un de responsable dans la durée.
Combien d’utilisateurs une machine locale peut-elle servir ?
Cela dépend du modèle, de la mémoire, de la longueur des requêtes et du nombre de requêtes simultanées. La seule réponse fiable vient d’un essai de charge sur le matériel et le modèle retenus, avant de s’engager.
Sources : Apple, Mac Studio avec M5 Max et M5 Ultra (25 août 2026) ; NVIDIA, DGX Spark et annonce de prix (25 février 2026) ; Mistral AI, liste des modèles ; CNIL, déployer une IA générative (juillet 2024). Prix et caractéristiques relevés en septembre 2026.