Les modèles disponibles
La bibliothèque officielle d'Ollama référence des modèles open-weight : Llama (Meta), Gemma (Google), Qwen (Alibaba), DeepSeek, Mistral. Un modèle open-weight, ce sont les poids déjà entraînés, prêts à tourner chez soi, sans le code d'entraînement ni les données qui ont servi à le construire.
Installer Ollama
macOS
Deux options : l'interface graphique, à télécharger en .dmg, ou la ligne de commande.
# Via le script officiel
curl -fsSL https://ollama.com/install.sh | sh
# Ou via Homebrew
brew install ollama
L'interface graphique s'installe aussi via Homebrew, avec brew install --cask ollama-app.
Windows
L'installateur se télécharge depuis le site et guide l'installation. Une commande PowerShell fait le même travail :
irm https://ollama.com/install.ps1 | iex
Linux
curl -fsSL https://ollama.com/install.sh | sh
Pas d'interface graphique native sur Linux, seulement la ligne de commande.
Lancer un modèle
Une commande télécharge le modèle s'il n'est pas déjà présent, puis ouvre une conversation dans le terminal.
ollama run llama3.2:3b
/bye termine la session. Sur une configuration modeste, un modèle Mistral comme ministral-3:3b reste utilisable sans faire ramer la machine.
Les commandes essentielles
ollama pull llama3.2:3b # télécharger un modèle sans le lancer
ollama run llama3.2:3b # lancer une discussion avec un modèle
ollama list # lister les modèles installés
ollama ps # voir les modèles chargés en mémoire
ollama rm llama3.2:3b # supprimer un modèle
Quel modèle choisir selon sa machine
Les modèles existent en plusieurs tailles, 1B, 3B, 7B, 70B. Ce chiffre correspond au nombre de paramètres, en milliards. Compter environ 1 Go de mémoire par milliard de paramètres, avec une marge pour le reste du système, donne une bonne idée de ce qui tient sur sa machine.
Un Copilot local dans VS Code
VS Code peut brancher un modèle Ollama directement dans le chat GitHub Copilot, via l'extension Ollama officielle du Marketplace. Une fois Ollama lancé, le modèle local apparaît comme option dans le chat, au même titre que les modèles distants, et sans qu'un forfait Copilot soit nécessaire pour s'en servir de cette façon.
Les limites
Un modèle de 3 milliards de paramètres sur un ordinateur portable ne rivalise pas avec Claude ou GPT et leurs modèles de plusieurs centaines de milliards de paramètres, exécutés sur des fermes de GPU. L'intérêt d'Ollama se joue ailleurs : traiter un document sensible sans qu'il quitte la machine.
Mon avis
Garder les données sur sa machine, c'est le seul vrai intérêt d'Ollama. Pour écrire un mail ou résumer un texte public, Claude ou ChatGPT restent plus rapides et plus justes, portés par des modèles largement hors de portée d'un ordinateur portable. Sur un document confidentiel qu'on refuse de voir transiter par un serveur externe, Ollama devient la seule option raisonnable.
L'intégration VS Code est le complément qui change l'usage au quotidien. Le modèle local apparaît dans la même fenêtre de chat que Copilot, sans abonnement, pour les cas où le code non plus ne doit pas sortir de la machine.
Sur un PC classique, on ne s'approche jamais du niveau de Claude ou ChatGPT, à moins d'avoir du matériel de guerre, plusieurs GPU haut de gamme que peu de configurations personnelles réunissent.