Analyse

IA locale : faire tourner un LLM dans l’entreprise, sans le cloud

Faire tourner un modèle de langage sur son propre matériel est devenu réaliste pour une PME. Ce n’est ni un projet de laboratoire, ni une solution à tout.

Vue aérienne d’une ville illuminée la nuit, dans des tons turquoise
Le modèle tourne sur place ; les données ne prennent la route de personne

L’IA locale désigne un usage de l’intelligence artificielle générative dans lequel le modèle tourne sur des machines que l’entreprise contrôle — ses propres serveurs ou postes — plutôt que chez un fournisseur en ligne. Les questions posées, les documents analysés et les réponses produites ne quittent pas ces machines. Il y a quelques années, faire tourner un grand modèle de langage, ou LLM, en local relevait du laboratoire de recherche. Ce n’est plus le cas : des modèles ouverts performants existent, des outils simples permettent de les exécuter, et le matériel nécessaire tient sur un bureau.

Ce qui suit reste du côté de la décision : pourquoi le faire, ce qu’on peut en attendre, ce que cela coûte, et quand une autre option vaut mieux. Ce n’est pas un tutoriel.

Pourquoi installer un LLM en local

La première raison est la confidentialité, et elle est plus forte qu’on ne le croit. Une offre en ligne peut s’engager contractuellement à ne pas conserver ni réutiliser les données ; il faut alors la croire, et croire ses propres sous-traitants. Un modèle local ne promet rien : il n’y a simplement aucun tiers vers qui les données pourraient partir. La CNIL recommande d’ailleurs de privilégier les systèmes locaux quand des données personnelles de clients ou de collaborateurs sont en jeu.

Trois autres raisons s’y ajoutent. La maîtrise : le modèle ne change pas du jour au lendemain parce que son éditeur l’a mis à jour, et un usage qui fonctionne continue de fonctionner. L’indépendance : pas de dépendance à la politique tarifaire ni à la disponibilité d’un fournisseur. Et la prévisibilité des coûts : une fois le matériel acquis, l’usage n’est plus facturé à la requête.

La raison qui ne tient pas, en revanche, est la mode. Une entreprise dont les usages ne portent pas sur des données sensibles gagnera rarement à exploiter son propre matériel plutôt qu’à souscrire une offre professionnelle bien encadrée.

Ce qu’un modèle local sait faire, et ne sait pas faire

Les modèles ouverts ont beaucoup progressé. L’éditeur français Mistral AI, par exemple, publie plusieurs de ses modèles sous licence Apache 2.0, que l’on peut exécuter sur son propre matériel ; d’autres éditeurs font de même. Des outils comme Ollama rendent leur installation accessible sans compétence de recherche.

Un modèle local sait bienUn modèle local fait moins bien
Résumer un document, un échange, une réunionLe raisonnement long et complexe, où les plus grands modèles fermés gardent l’avantage
Rédiger et reformuler des textes courantsLes connaissances récentes, faute d’accès à Internet par défaut
Classer, extraire des informations, remplir un tableauServir beaucoup d’utilisateurs à la fois sans matériel dimensionné
Chercher dans les documents de l’entreprise et y répondreLes tâches très spécialisées sans adaptation préalable

La recherche dans ses propres documents mérite une mention particulière. C’est souvent l’usage le plus utile d’un modèle local : interroger en langage courant une base de contrats, de procédures ou de dossiers techniques, sans que ces documents quittent l’entreprise. Le modèle n’a pas besoin d’être le plus grand du marché pour cela ; il a besoin d’accéder aux bons documents.

Cet usage demande un travail qu’on sous-estime : préparer les documents. Un modèle ne répond bien qu’à partir de sources à jour, rangées, dont on connaît la version valable. Une base de procédures où coexistent trois versions contradictoires produira des réponses contradictoires, avec la même assurance. Le chantier le plus long d’un projet d’IA locale est souvent celui-là, et il profite à l’entreprise bien au-delà de l’outil.

Le compromis doit être assumé. Pour les tâches les plus exigeantes, les meilleurs modèles fermés restent devant. La bonne question n’est pas de savoir si un modèle local est le meilleur du marché, mais s’il est suffisant pour l’usage visé — et pour la plupart des usages d’une PME, il l’est.

Le matériel : ordres de grandeur

Pour tourner vite, un modèle doit tenir entièrement en mémoire. La quantité de mémoire disponible borne donc la taille des modèles utilisables ; la vitesse de cette mémoire détermine en grande partie la rapidité des réponses. Le calcul de base est simple : un modèle dont les paramètres sont stockés sur 4 bits occupe environ un demi-octet par paramètre, soit une douzaine de gigaoctets pour un modèle de vingt-quatre milliards de paramètres — auxquels s’ajoute la mémoire nécessaire au contexte de la conversation.

Deux familles de machines de bureau illustrent ce qui est accessible en septembre 2026, à titre d’ordre de grandeur et non de recommandation :

  • le Mac Studio d’Apple, dont la version M5 Ultra, annoncée le 25 août 2026, peut recevoir jusqu’à 512 Go de mémoire unifiée avec une bande passante de 1,2 To/s, à partir de 5 499 dollars aux États-Unis ;
  • le DGX Spark de NVIDIA, doté de 128 Go de mémoire unifiée et présenté par son fabricant comme capable d’exécuter des modèles jusqu’à 200 milliards de paramètres, dont le prix public est passé à 4 699 dollars en février 2026.

Ces chiffres évoluent vite, et les prix en France diffèrent des prix américains : ils se vérifient au moment d’acheter. Ils montrent surtout un ordre de grandeur. Le matériel capable de faire tourner un modèle utile pour une équipe coûte aujourd’hui le prix d’un poste de travail haut de gamme, pas celui d’une salle de serveurs.

Le nombre d’utilisateurs compte autant que la taille du modèle. Une machine qui répond confortablement à une personne peut ralentir nettement quand dix requêtes arrivent en même temps. Le dimensionnement se fait donc à partir de l’usage réel — combien de personnes, quelles requêtes, à quels moments — et se vérifie par un essai de charge avant de s’engager, pas par la fiche technique.

Le coût du matériel n’est pas le seul. Il faut compter l’installation et la configuration, la mise à jour des modèles, la sécurité de la machine et de ses accès, l’électricité, et le temps de quelqu’un pour s’en occuper. Une machine locale sans responsable finit par devenir un risque de plus plutôt qu’une protection.

IA locale, cloud souverain, cloud américain : le comparatif

CritèreLocalCloud souverain qualifiéOffre pro d’un fournisseur américain
Où vont les donnéesNulle partChez un hébergeur européenChez le fournisseur, parfois en Europe
Droit applicable à l’opérateurCelui de l’entrepriseEuropéen, sans loi extraterritorialeAméricain, Cloud Act compris
Performance des modèlesModèles ouvertsModèles ouverts, parfois plus grandsLes plus grands modèles fermés
CoûtMatériel à l’achat, puis exploitationAbonnement ou consommationAbonnement par utilisateur ou consommation
Effort d’exploitationLe plus élevéMoyenLe plus faible

Aucune colonne ne gagne partout. Le local offre la garantie la plus forte au prix de l’effort le plus élevé ; l’offre professionnelle américaine offre les meilleurs modèles et le moins d’effort, au prix d’une dépendance juridique ; le cloud souverain se situe entre les deux, à condition de vérifier ce qu’il protège réellement. Le choix se fait usage par usage, selon la sensibilité des données — c’est le raisonnement développé dans ce que l’IA souveraine change pour une entreprise.

Pour démarrer, la démarche la plus sûre tient en trois temps. Choisir un usage précis, portant sur des données qu’on ne veut pas voir sortir. L’essayer sur un matériel modeste ou emprunté, avec un modèle ouvert, pendant quelques semaines, en mesurant ce qu’il fait gagner. Puis décider, à partir de cette mesure, s’il faut investir, confier l’exécution à un prestataire, ou revenir à une offre en ligne pour cet usage.

Il existe enfin une voie intermédiaire pour une entreprise qui veut la garantie du local sans en porter l’exploitation : confier l’exécution à un prestataire qui fait tourner les modèles sur son propre matériel, en France, sans tiers dans le trajet. C’est le principe de l’offre IA souveraine de Maeliom, ouverte en accès anticipé.

Questions fréquentes

Un LLM local est-il aussi bon que ChatGPT ?

Pas pour les tâches les plus complexes, où les grands modèles fermés gardent l’avantage. Pour les usages courants — résumer, rédiger, classer, chercher dans ses documents — les modèles ouverts actuels suffisent le plus souvent.

Faut-il des compétences techniques pour installer un LLM on premise ?

Moins qu’avant : des outils comme Ollama simplifient l’installation. Mais l’exploitation — sécurité, mises à jour, accès des utilisateurs — demande quelqu’un de responsable dans la durée.

Combien d’utilisateurs une machine locale peut-elle servir ?

Cela dépend du modèle, de la mémoire, de la longueur des requêtes et du nombre de requêtes simultanées. La seule réponse fiable vient d’un essai de charge sur le matériel et le modèle retenus, avant de s’engager.

Sources : Apple, Mac Studio avec M5 Max et M5 Ultra (25 août 2026) ; NVIDIA, DGX Spark et annonce de prix (25 février 2026) ; Mistral AI, liste des modèles ; CNIL, déployer une IA générative (juillet 2024). Prix et caractéristiques relevés en septembre 2026.


Article suivant

ChatGPT et RGPD : encadrer l’usage de l’IA dans l’entreprise

Lire

Une transformation à accompagner ?