IA en local : quelle configuration pour faire tourner un modèle chez soi
Jérémie Calos
10 août 2026

C'est devenu la question qu'on me pose le plus souvent, devant le choix du boîtier et devant le watercooling. « Il me faut quoi pour faire tourner une IA chez moi ? » Et dans neuf cas sur dix, la personne en face a déjà une idée en tête : un gros processeur.
Mauvaise piste. Je vais vous épargner l'erreur d'achat que j'ai vue passer une dizaine de fois cette année.
Ce qui a rendu tout ça possible n'est pas la puissance des cartes graphiques. C'est la compression des modèles. Des versions allégées atteignent aujourd'hui un niveau exploitable dans une empreinte mémoire qui tient sur du matériel grand public.
Le seul chiffre qui compte
La VRAM. Point.
Un modèle doit tenir intégralement dans la mémoire de la carte graphique. Tant qu'il y tient, tout va bien. Dès qu'il déborde sur la mémoire système, la vitesse ne baisse pas de quelques pourcents : on perd couramment 90 % du débit, un ordre de grandeur entier. On passe de quelque chose de fluide à quelque chose d'inutilisable, sans palier intermédiaire.
C'est la seule contrainte réellement bloquante de toute la chaîne.
Les paliers, en quantification 4 bits
| VRAM | Taille de modèle | Ce que ça donne vraiment |
|---|---|---|
| 8 Go | 7 à 8 milliards | Reformulation, résumé, aide au code sur fichiers courts. 40 à 60 tokens/s |
| 12 à 16 Go | 13 à 14 milliards | Le point d'équilibre coût-usage. 25 à 35 tokens/s |
| 24 Go | 30 à 32 milliards | Comparable aux services en ligne d'entrée de gamme sur beaucoup de tâches |
| 48 Go et plus | 70 milliards | Deux cartes de 24 Go, avec la configuration qui va avec |
Pour situer ces débits : on lit autour de 10 tokens par seconde. Tout ce qui dépasse ce seuil donne l'impression d'une réponse qui s'écrit plus vite qu'on ne la lit. En dessous, on attend.
Le calcul
Un modèle publié en 16 bits pèse environ 2 Go par milliard de paramètres. La quantification réduit la précision des poids pour comprimer cette empreinte, contre une perte de qualité.
Le passage de 16 à 8 bits retire 50 % de l'empreinte et reste quasi indolore : je n'ai jamais réussi à le distinguer à l'usage. La descente à 4 bits en retire 75 % et reste largement acceptable, c'est le format livré par défaut dans les distributions grand public. En dessous, la dégradation devient perceptible, surtout sur le raisonnement et sur le code.
La règle de dimensionnement tient en une ligne : nombre de milliards × 0,6, plus 1 à 2 Go pour le contexte. Un modèle de 14 milliards demande donc autour de 10 Go. Voilà pourquoi les cartes de 12 Go sont le vrai seuil d'entrée confortable, et pourquoi les 8 Go plafonnent si vite.
Le processeur ne sert à rien ici
Je vais être franc, parce que c'est là que part l'argent.
Une fois le modèle chargé en VRAM, le processeur et la mémoire vive n'interviennent quasiment pas dans la vitesse de génération. Mettre 400 € de plus dans un CPU haut de gamme pour de l'inférence locale, c'est du gaspillage pur. La même somme placée en VRAM change tout, parce qu'elle change la taille du modèle que vous pouvez charger, et c'est le seul levier qui compte sur la qualité des réponses.
Quand un vendeur vous oriente vers le processeur pour un usage IA, il vend son stock, pas votre besoin.
Portable
Sur ultrabook, l'inférence sur processeur seul fonctionne, mais tourne autour de 3 à 6 tokens par seconde sur un modèle de 7 milliards. C'est en dessous de la vitesse de lecture, et ça décourage en une semaine.
Le boîtier graphique externe règle le problème, avec une nuance que peu de gens connaissent : la bande passante de la liaison n'affecte pratiquement pas la vitesse de génération une fois le modèle chargé en VRAM. Elle allonge le temps de chargement initial, rien de plus. C'est précisément l'inverse du jeu vidéo, où la latence de transfert pèse à chaque image.
L'inférence IA est le meilleur cas d'usage de l'eGPU, et de loin. J'ai détaillé les configurations, les boîtiers et les débits mesurés dans mon guide eGPU pour l'IA locale.
Et les Mac
L'architecture à mémoire unifiée d'Apple permet d'allouer une grande partie de la mémoire vive au modèle. Résultat : des tailles de modèles hors de portée d'une carte dédiée équivalente en prix, contre une vitesse de génération plus modeste.
C'est le seul cas où mon conseil habituel s'inverse. Pour charger gros sans monter une machine à deux cartes, une configuration Apple bien dotée en mémoire fait le travail.
Ce que ça remplace, et ce que ça ne remplace pas
Un modèle local de 14 milliards ne remplace pas les grands modèles en ligne sur du raisonnement complexe. Qui vous dit le contraire vous vend quelque chose.
Il les remplace très bien sur trois usages précis. Le traitement de documents confidentiels qui ne doivent pas quitter le poste. L'automatisation répétitive, où le coût par requête finit par compter. Et le travail hors connexion.
C'est aussi la meilleure façon de comprendre ce que ces outils font réellement, au lieu de suivre les annonces. Pour ceux qui veulent suivre l'évolution des modèles et de leurs usages professionnels sans le bruit habituel, TasksGenius publie des analyses et des tests d'outils orientés usage concret en entreprise.
Par où commencer, concrètement
N'achetez rien tout de suite.
Installez un moteur d'inférence grand public, chargez un modèle de 7 à 8 milliards en 4 bits, et mesurez le débit obtenu sur votre configuration actuelle. Ça prend vingt minutes.
Beaucoup découvrent à ce moment-là que leur carte existante suffit à leur usage réel, et que le facteur limitant n'était pas le matériel mais la taille du modèle qu'ils avaient choisi. C'est le test que je fais faire systématiquement avant de conseiller le moindre achat.
Questions fréquentes
Combien de VRAM pour débuter sérieusement ? 12 Go. En dessous, vous êtes limité aux modèles de 7 à 8 milliards et vous atteindrez le plafond en quelques semaines si l'usage vous plaît.
Deux cartes de 12 Go valent-elles une carte de 24 Go ? Pour l'inférence, une seule carte de 24 Go est nettement plus simple et plus rapide. Le multi-GPU fonctionne mais ajoute de la configuration et des pertes au découpage du modèle.
AMD ou NVIDIA pour l'IA locale ? NVIDIA reste le chemin le moins pénible : l'écosystème logiciel est mûr et tout fonctionne du premier coup. Chez AMD ça marche, mais vous passerez du temps sur l'installation.
La quantification abîme-t-elle beaucoup le modèle ? De 16 à 8 bits, non. De 8 à 4 bits, la perte existe mais reste acceptable sur la majorité des usages. En dessous de 4 bits, le raisonnement et le code décrochent nettement.
Faut-il un SSD rapide ? Il accélère le chargement du modèle, pas la génération. Un SSD correct suffit, inutile de viser le haut du panier pour cet usage.
