Ton PC portable devient ton premier serveur d’IA en local

Hors ligne, ton portable répond à une question. Sans rien changer, il répond ensuite exactement à la même question, envoyée cette fois par une deuxième appli installée sur le même portable. Ce deuxième usage transforme le portable que tu utilises déjà en un petit serveur d’IA personnel que tes autres applis et scripts peuvent interroger.

Ici, on fait tourner un modèle téléchargé, on ne l’entraîne pas. Si tu n’as pas encore vérifié que ton portable a assez de RAM ou de VRAM, commence par consulter notre guide sur la RAM nécessaire à ton portable pour l’IA en local. Si tu sais déjà que ta machine convient, passe à la suite.

Les quatre couches d’une installation d’IA en local

Une installation d’IA en local repose sur trois couches distinctes, auxquelles peut s’ajouter une quatrième, facultative. Si tu sais à quoi chacune correspond, tu suivras plus facilement les étapes de ce guide.

Les poids du modèle correspondent au fichier que tu télécharges, par exemple une version quantifiée d’un petit modèle pesant 3,4 Go. Ce chiffre indique la taille du fichier téléchargé sur le disque, pas la quantité de RAM nécessaire une fois le modèle lancé.

Le moteur d’inférence est le logiciel qui charge ces poids et répond aux requêtes. Ici, c’est Ollama : il dispose de sa propre API HTTP locale et permet à ton portable de fournir de l’IA à d’autres applis.

L’interface est ce qui envoie la requête : le chat intégré à Ollama, un petit script ou une autre appli. C’est elle qui détermine si ton instruction reste sur le portable ou est envoyée ailleurs.

Un index de documents facultatif permet à un modèle de chat de chercher dans tes fichiers. Il utilise pour cela un modèle de vectorisation distinct et dispose de son propre espace de stockage. Il n’est pas créé automatiquement et nous ne l’aborderons pas ici.

En bref, une appli ou un script contacte Ollama à l’adresse 127.0.0.1:11434. Ollama charge alors le modèle téléchargé. L’historique des conversations enregistré par l’interface est conservé à un autre endroit : supprimer le modèle ne l’efface pas.

Avant d’installer Ollama : ton portable a-t-il une configuration proche de celle de l’un de ces modèles ?

Avant d’installer quoi que ce soit, prends deux minutes pour noter la quantité de RAM de ton portable, son système d’exploitation, son processeur et l’espace libre sur son SSD. S’il a de la mémoire graphique dédiée (VRAM), note aussi combien il en a. Pour une explication détaillée des besoins en RAM et en VRAM de l’IA en local, consulte notre guide sur la RAM nécessaire à ton portable pour l’IA en local.

Les deux portables ci-dessous existent bel et bien et sont actuellement proposés sur refurbed. Tous deux sont reconditionnés : des professionnels les ont testés, nettoyés et remis en état, et chacun bénéficie d’une garantie de 12 mois. L’un est un modèle Apple Silicon d’entrée de gamme ; l’autre, un PC Windows doté de sa propre mémoire graphique dédiée. Avec l’un comme avec l’autre, tu peux suivre toutes les étapes ci-dessous.

Installer Ollama sur macOS, Windows ou Linux

Sur macOS ou Windows, installe l’application officielle d’Ollama ; sous Linux, suis ses instructions d’installation. Une fois l’installation terminée, lance Ollama. Sous Linux, exécute ollama serve si aucun serveur n’est déjà à l’écoute.

Dans sa version actuelle, l’application propose une utilisation en local et des options dans le cloud. Choisis le tag d’un modèle téléchargé sur ton portable : tu n’as pas besoin de te connecter à un compte pour le faire tourner en local.

Pour suivre ce guide, télécharge le modèle qwen3.5:4b-q4_K_M (3,4 Go). Utilise le tag exact : un libellé générique comme « latest » peut, sans que tu le saches, désigner un modèle bien plus volumineux que celui que tu as testé. Ces 3,4 Go correspondent à la taille du téléchargement sur le disque. Ils ne permettent pas de savoir de combien de RAM le modèle aura besoin pour répondre aux requêtes.

Télécharge ton premier modèle et discute avec lui

Deux commandes suffisent pour commencer à discuter avec un modèle :

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

La première télécharge le modèle ; la seconde ouvre un chat interactif avec lui. Ne te contente pas d’un simple bonjour : confie-lui une petite tâche concrète, par exemple en écrivant « Transforme ces trois notes de réunion en liste d’actions. N’invente pas de dates. »

Quand tu as terminé, saisis /bye pour quitter le chat.

Appelle l’API : l’IA tourne maintenant en local sur ton ordinateur portable

Dans le terminal, le chat te sert d’interface avec le moteur. Appelle maintenant directement ce même moteur, comme le ferait une autre appli.

Sur macOS ou Linux :

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Définis l’inférence locale en une phrase."}],"stream":false,"options":{"num_ctx":4096}}'

Sur Windows, dans PowerShell :

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Définis l’inférence locale en une phrase."}],"stream":false,"options":{"num_ctx":4096}}'

Dans la réponse, repère message.content. En réglant stream sur false, tu reçois une réponse complète, et non une suite de fragments. Pour ce premier essai, num_ctx: 4096 fixe une taille de contexte modeste, bien inférieure au maximum annoncé pour le modèle.

Ce que la réponse t’apprend

Ollama ne renvoie pas seulement le texte généré dans message.content. Sa réponse contient aussi des champs utiles pour comprendre les temps de traitement : load_duration, prompt_eval_count, prompt_eval_duration, eval_count et eval_duration.

Ces champs te permettent de distinguer le temps de chargement du modèle en mémoire du temps nécessaire pour générer ta réponse. Un simple chiffre en « tokens par seconde » ne fait pas cette distinction. La première requête après le démarrage d’Ollama est généralement la plus lente, car le modèle doit d’abord être chargé en mémoire. Ce délai ne se retrouve pas dans la suivante.

Les chiffres exacts dépendent entièrement de ton portable : nous n’indiquons donc aucune valeur type. Compare ces champs entre deux essais sur le même portable plutôt que de te fier à une seule vitesse annoncée.

Modèles chargés ou téléchargés : ps, ls et déchargement après inactivité

Pour les opérations de base, trois commandes suffisent.

ollama ps affiche les modèles actuellement chargés. La colonne du processeur indique pour chacun 100 % GPU, 100 % CPU ou une répartition entre les deux.

ollama ls liste tous les modèles que tu as téléchargés.

ollama rm qwen3.5:4b-q4_K_M supprime ce modèle téléchargé si tu n’en as plus besoin.

Par défaut, Ollama décharge un modèle au bout de cinq minutes d’inactivité. Si ollama ps n’affiche aucun modèle chargé, envoie une nouvelle requête avant d’en déduire qu’il y a un problème.

Connecte une deuxième appli à l’API locale compatible avec OpenAI

Ton PC portable fournit désormais de l’IA à une deuxième appli, en plus du chat intégré. Dirige-la vers ta machine plutôt que vers un service cloud.

La plupart des applis qui te permettent de saisir une adresse d’API compatible avec OpenAI demandent trois informations : une URL de base, un nom de modèle et une clé API. Indique http://localhost:11434/v1/ comme URL de base et qwen3.5:4b-q4_K_M comme nom de modèle.

Le champ de la clé API peut dérouter. Certaines applis clientes ou certains SDK refusent qu’il reste vide. La documentation d’Ollama donne donc api_key='ollama' comme valeur de remplacement dans ce cas : le serveur local ne vérifie jamais cette valeur. Cette chaîne n’authentifie rien : elle sert à remplir un champ de formulaire, pas à faire office de mot de passe.

Cette compatibilité se limite à certaines fonctions de chaque API. Si tu veux envoyer des images ou utiliser l’appel d’outils, par exemple, teste la fonction voulue avec ton appli : toutes ne sont pas automatiquement prises en charge.

Pour prouver que le modèle tourne en local, coupe Internet et repose la question

Même après les étapes précédentes, ton portable pourrait encore, en théorie, accéder à Internet à ton insu. Pour en avoir le cœur net, fais ce test.

Une fois le modèle téléchargé, coupe le Wi-Fi de ton portable ou débranche son câble réseau. Répète ensuite la même requête que tout à l’heure, dans le chat ou via l’API. Si tu obtiens une vraie réponse sans aucune connexion, tu as la preuve que le modèle tourne en local.

Une réponse ne prouve pas que le modèle tourne en local si elle n’arrive que lorsque tu es connecté, si elle vient de https://ollama.com plutôt que de localhost, ou si tu utilises le tag d’un modèle cloud plutôt que celui d’un modèle téléchargé. Avec Ollama, une requête locale reste sur ta machine ; ses modèles cloud passent par un service hébergé distinct.

IA en local : les précautions pour protéger tes données

La confidentialité ne s’improvise pas. Mieux vaut savoir ce qui protège tes données et ce qui ne les protège pas.

Par défaut, Ollama n’écoute que sur 127.0.0.1:11434 : seules les applis de ton portable peuvent s’y connecter. Garde ce réglage. Ne définis pas OLLAMA_HOST=0.0.0.0 et ne redirige pas le port 11434 pour le rendre accessible depuis Internet : Ollama ne vérifie pas la valeur de la clé API factice évoquée plus haut. Exposer ce port, c’est laisser la porte ouverte plutôt que de la fermer à clé.

Tu peux désactiver complètement les fonctions cloud d’Ollama, mais ce n’est pas indispensable : avec le tag d’un modèle local téléchargé, l’inférence se fait déjà sur ton portable. Ajoute {"disable_ollama_cloud": true} dans ~/.ollama/server.json ou définis OLLAMA_NO_CLOUD=1, puis redémarre Ollama pour que le réglage choisi prenne effet.

Pour accéder à cette installation depuis une autre pièce ou un autre appareil, il faut un réseau privé et un proxy qui authentifie les accès. C’est une configuration à part, plus avancée, que ce guide n’aborde pas. Exposer directement le port n’est pas la bonne méthode.

Si quelque chose coince

Voici les problèmes les plus fréquents et les premiers points à vérifier.

Connexion refusée. Vérifie que l’application Ollama est lancée ou que ollama serve tourne, puis réessaie.

La première réponse est lente ; les suivantes sont plus rapides. Ce décalage vient du chargement du modèle, pas de sa vitesse de génération. Pour distinguer les deux, consulte les champs de la réponse mentionnés plus haut.

Tout te paraît bien plus lent que prévu. Lance ollama ps : la commande peut indiquer que le modèle tourne uniquement sur le CPU ou qu’il utilise à la fois le CPU et le GPU. Vérifie que ton GPU et ses pilotes sont compatibles avec ton système d’exploitation.

La mémoire commence à manquer ou l’application plante. Choisis le tag d’un modèle plus petit, réduis num_ctx et ferme les autres applis gourmandes en mémoire avant de réessayer.

Le disque se remplit. Lance ollama ls pour voir les modèles téléchargés, puis supprime ceux que tu n’utilises pas avec ollama rm.

Si cette méthode ne te convient pas, par exemple parce que tu veux parcourir les modèles dans une interface graphique ou régler plus finement l’utilisation du CPU et du GPU, LM Studio et llama.cpp valent le détour. Mieux vaut alors changer de moteur que faire tourner deux installations en parallèle.

L’IA en local sur ton PC portable : questions fréquentes

As-tu encore besoin d’Internet après l’installation ? Non. Une fois le modèle téléchargé, tu peux discuter avec lui et appeler son API entièrement hors ligne.

La clé API de remplacement protège-t-elle l’accès à ton API ? Non. Le serveur local d’Ollama accepte toute valeur non vide sans la vérifier. La clé demandée par certaines applis n’est donc pas une mesure de sécurité.

Ce que tu écris au modèle reste-t-il sur ton portable ? Oui, si tu utilises le tag d’un modèle local téléchargé. Ollama propose aussi des modèles cloud distincts, qui passent par un service hébergé. La différence tient au tag que tu choisis, pas à un réglage par défaut caché.

As-tu besoin d’une carte graphique dédiée ? Non. Un portable qui s’appuie uniquement sur son processeur peut faire tourner un petit modèle, généralement plus lentement. ollama ps indique exactement comment une requête donnée a été traitée.

Et si tu veux un modèle plus gros ou différent ? Vérifie d’abord ta RAM et ta VRAM, puis remplace le tag dans les mêmes commandes ollama pull et ollama run. Pour comprendre en détail les besoins en RAM et en VRAM, consulte notre guide sur la RAM nécessaire à ton portable.

Le modèle se souviendra-t-il de tes documents par la suite ? Non. Un modèle de chat ne retient pas durablement le contenu d’un dossier à lui seul. Pour chercher dans tes fichiers, il te faut un index de documents distinct. C’est une configuration facultative que ce guide n’aborde pas.

À toi de jouer : utilise ton serveur d’IA personnel

Choisis une tâche concrète et confie-la au chat intégré comme à la deuxième appli que tu viens de connecter. Demande-leur, par exemple, de résumer une note personnelle, de regrouper un lot de fichiers en nommant chaque groupe ou de t’expliquer un court extrait de code en termes simples.

Quel que soit ton choix, note le tag exact du modèle, la version du moteur, le réglage du contexte, l’URL et la tâche elle-même. Grâce à ces détails, tu pourras reproduire le résultat plus tard ou permettre à quelqu’un d’autre de le faire.

Si ton portable manque de RAM ou de VRAM pour cette installation, passer à un portable mieux doté en mémoire mérite réflexion. Le prochain article de cette série expliquera comment composer une petite sélection de modèles : un pour le chat, un pour le code et un pour la recherche.

PC portable reconditionné adapté à l’IA en local, proposé sur refurbed

Inscrivez-vous à notre newsletter pour la première fois et économisez 15 €!

Ne manquez plus aucune offre.

Retrouvez les informations sur l'utilisation des données personnelles dans notre politique de confidentialité.