Comment installer et utiliser Ollama pour lancer une IA en local
Pour installer Ollama et lancer une IA en local, il suffit d’installer le logiciel, de télécharger un modèle compatible avec l’ordinateur, puis de l’utiliser depuis un terminal ou une application graphique. Ce guide explique également comment choisir un modèle, vérifier les performances, appeler Ollama depuis une API et résoudre les problèmes les plus fréquents.
Qu’est-ce qu’Ollama ?
Ollama est un outil qui permet d’exécuter des modèles d’intelligence artificielle directement sur un ordinateur. Il fonctionne sur Windows, macOS et Linux et propose une interface en ligne de commande ainsi qu’une API locale.
Ollama ne constitue pas un modèle d’IA en lui-même. Il sert plutôt de moteur d’exécution pour des modèles comme :
- Llama de Meta ;
- Mistral ;
- Gemma de Google ;
- Qwen ;
- DeepSeek ;
- d’autres modèles de langage ou modèles multimodaux compatibles.
Une fois le modèle téléchargé, les conversations peuvent être traitées localement, sans envoyer les prompts à un service distant. Cette caractéristique est utile pour la confidentialité, le travail hors ligne et la maîtrise des coûts.
Pourquoi utiliser une IA locale avec Ollama ?
Une meilleure confidentialité
Les prompts, documents et réponses restent sur la machine lorsque le modèle est exécuté localement. Cette approche convient notamment aux données professionnelles, aux informations personnelles ou aux documents confidentiels.
Il faut toutefois rester vigilant : le téléchargement initial du modèle nécessite une connexion Internet, et une application tierce connectée à Ollama peut éventuellement transmettre des données à un serveur distant.
Une utilisation sans abonnement
Ollama est gratuit à installer. Les principaux coûts concernent :
- le matériel nécessaire ;
- l’espace de stockage ;
- la consommation électrique ;
- éventuellement une application complémentaire ou un service cloud.
Les licences des modèles sont différentes selon les éditeurs. La gratuité d’Ollama ne signifie donc pas que chaque modèle peut être utilisé sans restriction commerciale.
Un contrôle complet du modèle
L’utilisateur peut choisir :
- la taille du modèle ;
- le niveau de quantification ;
- la température des réponses ;
- le nombre de tokens générés ;
- le comportement du système ;
- l’emplacement de stockage des modèles.
Une intégration simple avec d’autres outils
Ollama expose une API locale sur l’adresse `http://localhost:11434`. Cette API peut être utilisée depuis :
- une application Python ;
- un script JavaScript ;
- une interface web ;
- un outil de recherche documentaire ;
- un éditeur de code ;
- une application de productivité.
Quelle configuration faut-il pour Ollama ?
Ollama fonctionne sans carte graphique dédiée, mais les performances dépendent fortement du matériel.
| Mémoire disponible | Modèles généralement adaptés |
|---|---|
| 4 à 8 Go de RAM | Modèles de 1 à 3 milliards de paramètres |
| 8 à 16 Go de RAM | Modèles de 7 à 9 milliards de paramètres quantifiés |
| 16 à 32 Go de RAM | Modèles de 14 milliards de paramètres |
| 32 Go de RAM ou davantage | Modèles de 32 milliards de paramètres et plus |
Ces indications restent approximatives. Le système d’exploitation, la longueur du contexte et les autres logiciels ouverts consomment également de la mémoire.
Espace disque nécessaire
La taille du fichier téléchargé varie selon le modèle et sa quantification. À titre indicatif :
- un modèle de 3 milliards de paramètres peut occuper quelques gigaoctets ;
- un modèle de 7 ou 8 milliards de paramètres nécessite souvent entre 4 et 6 Go ;
- un modèle de 14 milliards de paramètres peut dépasser 9 Go ;
- un modèle de 32 milliards de paramètres peut nécessiter 20 Go ou davantage.
Il est recommandé de conserver au moins 10 à 20 Go d’espace libre pour commencer confortablement.
Carte graphique ou processeur ?
Ollama peut utiliser :
- le processeur, sur pratiquement toutes les machines compatibles ;
- le GPU intégré des Mac Apple Silicon via Metal ;
- certaines cartes NVIDIA ;
- certaines configurations AMD ou Vulkan, selon le système et les pilotes.
Une carte graphique accélère généralement la génération. Si la mémoire vidéo est insuffisante, Ollama peut répartir le calcul entre le GPU et le processeur, avec une baisse de performance.
Comment installer Ollama sur Windows ?
Étape 1 : télécharger l’installateur
- Accédez au site officiel d’Ollama.
- Téléchargez l’installateur Windows.
- Lancez le fichier téléchargé.
- Suivez les étapes affichées à l’écran.
- Ouvrez PowerShell ou Windows Terminal.
L’installation native ne nécessite pas obligatoirement WSL. Ollama peut fonctionner directement sous Windows.
Étape 2 : vérifier l’installation
Exécutez la commande `ollama --version`.
Si une version s’affiche, le programme est correctement installé. Si Windows indique que la commande est introuvable, fermez puis rouvrez le terminal. Un redémarrage peut également être nécessaire.
Étape 3 : vérifier le serveur local
Ollama démarre généralement son service en arrière-plan. Pour le lancer manuellement, utilisez `ollama serve`.
L’API locale est normalement disponible à l’adresse `http://localhost:11434`.
Comment installer Ollama sur macOS ?
Étape 1 : télécharger l’application
- Téléchargez l’application Ollama depuis le site officiel.
- Ouvrez le fichier d’installation.
- Faites glisser Ollama dans le dossier Applications si cette étape est demandée.
- Lancez l’application.
- Autorisez son exécution si macOS affiche un avertissement de sécurité.
Sur les Mac équipés d’une puce Apple Silicon, Ollama peut exploiter le GPU intégré via Metal. Les performances varient selon la quantité de mémoire unifiée disponible.
Étape 2 : tester le terminal
Ouvrez l’application Terminal puis saisissez `ollama --version`.
Pour démarrer le serveur manuellement, utilisez `ollama serve`. L’application Ollama doit rester active si le service n’est pas lancé automatiquement.
Comment installer Ollama sur Linux ?
La méthode officielle la plus simple consiste à utiliser le script d’installation fourni par Ollama. Dans un terminal, exécutez `curl -fsSL https://ollama.com/install.sh | sh`.
Cette commande télécharge et installe le programme. Pour des raisons de sécurité, vérifiez toujours que la commande provient bien du site officiel avant de l’exécuter.
Vérifiez ensuite l’installation avec `ollama --version`.
Sur de nombreuses distributions, l’installateur configure un service système. Les commandes suivantes permettent de contrôler ce service :
- `sudo systemctl status ollama` pour vérifier son état ;
- `sudo systemctl start ollama` pour le démarrer ;
- `sudo systemctl restart ollama` pour le relancer ;
- `journalctl -u ollama` pour consulter les journaux.
Si le serveur n’est pas configuré comme service, lancez-le avec `ollama serve`.
Comment installer Ollama avec Docker ?
Docker est utile pour isoler Ollama ou l’intégrer à une infrastructure existante. Une installation CPU peut être lancée avec la commande `docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama`.
Pour utiliser une carte NVIDIA, il faut ajouter la prise en charge GPU de Docker et utiliser l’option adaptée, généralement `--gpus=all`.
Cette méthode demande davantage de configuration. Pour un premier usage sur un ordinateur personnel, l’installation native est généralement plus simple.
Comment télécharger un modèle dans Ollama ?
Après l’installation, choisissez un modèle dans la bibliothèque officielle d’Ollama. Pour télécharger un modèle, utilisez la commande `ollama pull llama3.2`.
Le nom exact dépend du modèle et de sa variante. Exemples courants :
- `ollama pull llama3.2` ;
- `ollama pull llama3.2:1b` pour une version plus légère ;
- `ollama pull qwen2.5:7b` ;
- `ollama pull mistral` ;
- `ollama pull gemma3`.
Les noms, tailles et versions disponibles peuvent évoluer. Consultez la fiche du modèle avant de lancer le téléchargement, notamment pour vérifier la licence, la langue et les besoins matériels.
Comment lancer une IA locale avec Ollama ?
Une fois le modèle téléchargé, lancez-le avec `ollama run llama3.2`.
Ollama ouvre alors une conversation dans le terminal. Saisissez une question, puis appuyez sur Entrée.
Exemples de demandes :
- `Résume ce texte en cinq points.`
- `Explique la différence entre une API REST et une API GraphQL.`
- `Rédige une description de produit en français.`
- `Traduis ce paragraphe en anglais professionnel.`
Pour quitter la conversation, utilisez généralement la commande `/bye`, le raccourci Ctrl+D ou Ctrl+C selon le terminal.
Dans l’interface interactive, la commande `/help` affiche les fonctions disponibles. Les commandes peuvent varier selon la version installée.
Quelles commandes Ollama faut-il connaître ?
Les commandes essentielles sont les suivantes :
- `ollama list` affiche les modèles installés ;
- `ollama pull nom_du_modele` télécharge un modèle ;
- `ollama run nom_du_modele` lance une conversation ;
- `ollama show nom_du_modele` affiche les informations du modèle ;
- `ollama ps` liste les modèles actuellement chargés en mémoire ;
- `ollama stop nom_du_modele` arrête un modèle ;
- `ollama rm nom_du_modele` supprime un modèle ;
- `ollama cp modele_source modele_copie` crée une copie sous un autre nom ;
- `ollama help` affiche l’aide générale.
La commande `ollama ps` est particulièrement utile pour vérifier si le modèle utilise le CPU, le GPU ou les deux.
Comment choisir le bon modèle ?
Pour un ordinateur peu puissant
Privilégiez un modèle de 1 à 3 milliards de paramètres. Il sera plus rapide et consommera moins de mémoire, mais ses réponses seront souvent moins précises sur les tâches complexes.
Les variantes légères sont adaptées à :
- la reformulation ;
- la classification ;
- les réponses courtes ;
- les petits scripts ;
- les usages hors ligne basiques.
Pour un usage général
Les modèles de 7 à 9 milliards de paramètres offrent généralement un bon compromis entre qualité et rapidité. Ils conviennent à la rédaction, à la traduction, au résumé et à l’assistance au développement.
Pour la qualité maximale en local
Les modèles de 14 milliards de paramètres ou davantage produisent souvent de meilleures réponses, mais ils nécessitent plus de RAM, plus d’espace disque et davantage de temps de génération.
Un modèle plus grand n’est toutefois pas toujours meilleur. La qualité dépend aussi de l’entraînement, de la langue, de la quantification et de la formulation du prompt.
Comment appeler Ollama avec son API ?
Ollama propose une API locale accessible sur le port 11434.
Pour générer une réponse, utilisez par exemple la commande suivante :
`curl http://localhost:11434/api/generate -d '{"model":"llama3.2","prompt":"Explique le fonctionnement d’un réseau neuronal en trois phrases.","stream":false}'`
L’option `"stream":false` demande une réponse complète plutôt qu’un flux de tokens.
Pour utiliser une conversation avec plusieurs messages, l’endpoint `/api/chat` est plus adapté. Exemple :
`curl http://localhost:11434/api/chat -d '{"model":"llama3.2","messages":[{"role":"user","content":"Donne trois idées de sujets pour un blog tech."}],"stream":false}'`
La liste des modèles disponibles peut être récupérée avec `curl http://localhost:11434/api/tags`.
Ollama propose également une compatibilité avec certaines bibliothèques OpenAI via l’adresse `http://localhost:11434/v1`. Cette compatibilité facilite l’intégration avec des applications existantes, mais les fonctions disponibles peuvent différer selon les bibliothèques.
Utiliser Ollama depuis Python
Le paquet Python officiel peut être installé avec `pip install ollama`.
Une requête de chat peut ensuite être réalisée avec une instruction du type `from ollama import chat; response = chat(model='llama3.2', messages=[{'role': 'user', 'content': 'Résume ce texte.'}])`.
Pour un projet réel, prévoyez une gestion des erreurs lorsque le serveur est arrêté, lorsque le modèle n’est pas installé ou lorsque la mémoire disponible est insuffisante.
Comment personnaliser un modèle avec un Modelfile ?
Ollama permet de créer une variante personnalisée à partir d’un modèle existant.
Créez un fichier nommé `Modelfile` contenant par exemple les lignes suivantes :
- `FROM llama3.2`
- `PARAMETER temperature 0.2`
- `SYSTEM Tu es un assistant spécialisé dans la rédaction technique en français.`
La température basse favorise des réponses plus prévisibles. Une température plus élevée produit davantage de variété, mais peut aussi augmenter les incohérences.
Créez ensuite le modèle avec `ollama create assistant-fr -f Modelfile`, puis lancez-le avec `ollama run assistant-fr`.
D’autres paramètres peuvent être configurés, notamment :
- le nombre maximal de tokens générés ;
- la longueur du contexte ;
- la température ;
- les séquences d’arrêt ;
- le prompt système.
La personnalisation du modèle ne modifie pas ses connaissances de base. Elle agit principalement sur son comportement et son format de réponse.
Ollama peut-il analyser des fichiers PDF ?
Ollama seul ne constitue pas automatiquement un moteur de recherche dans les fichiers PDF. Pour interroger des documents, il faut généralement ajouter une interface ou un système de RAG, c’est-à-dire une récupération de passages pertinents avant la génération.
Les solutions complémentaires peuvent :
- extraire le texte des documents ;
- découper ce texte en passages ;
- créer des représentations vectorielles ;
- rechercher les passages les plus pertinents ;
- les transmettre au modèle Ollama.
Des interfaces comme Open WebUI peuvent fournir une expérience graphique et, selon la configuration, des fonctions de documents et de recherche locale.
Comment ajouter une interface graphique à Ollama ?
Ollama se contrôle nativement depuis le terminal. Pour une expérience plus proche de ChatGPT, il est possible d’utiliser une interface comme Open WebUI.
Le principe consiste à :
- installer Docker ;
- lancer Open WebUI ;
- le connecter au serveur Ollama ;
- ouvrir l’interface dans un navigateur, souvent sur le port 3000.
Ollama et Open WebUI doivent pouvoir communiquer sur le réseau local. Avec Docker, l’adresse de connexion peut nécessiter `host.docker.internal` ou une configuration réseau spécifique selon le système.
L’interface graphique simplifie la gestion des conversations, des modèles et parfois des documents, mais elle ajoute une couche logicielle supplémentaire à maintenir.
Comment améliorer les performances d’Ollama ?
Plusieurs réglages peuvent faire une différence :
- Choisir un modèle adapté à la RAM disponible. Un modèle trop volumineux entraînera des ralentissements ou des erreurs.
- Fermer les applications gourmandes. Les navigateurs avec de nombreux onglets peuvent consommer plusieurs gigaoctets.
- Utiliser un modèle quantifié. Il occupe moins de mémoire, avec une baisse de qualité généralement limitée.
- Réduire la longueur du contexte. Un contexte très long augmente la consommation mémoire.
- Éviter de charger plusieurs modèles en même temps. La commande `ollama stop nom_du_modele` libère les ressources.
- Installer les pilotes graphiques appropriés. Un GPU mal configuré peut laisser Ollama fonctionner uniquement sur le CPU.
- Placer les modèles sur un SSD. Les chargements sont plus rapides que sur un disque dur classique.
La vitesse dépend également du nombre de tokens générés par seconde. Une génération lente sur un ordinateur sans GPU est normale, surtout avec un modèle de grande taille.
Peut-on utiliser Ollama depuis un autre ordinateur ?
Par défaut, Ollama écoute généralement sur la machine locale. Cette configuration est la plus sûre.
Pour autoriser des connexions réseau, la variable `OLLAMA_HOST` peut être configurée avec une adresse comme `0.0.0.0:11434`. Cette modification expose potentiellement l’API à d’autres appareils du réseau.
Ne publiez pas directement le port 11434 sur Internet. L’API locale ne doit pas être considérée comme un service public sécurisé avec authentification complète. Pour un accès distant, utilisez plutôt un VPN, un tunnel sécurisé ou un proxy correctement configuré avec authentification et chiffrement.
Combien coûte l’utilisation d’Ollama ?
Le logiciel Ollama peut être installé gratuitement. Le coût réel dépend de l’équipement :
- un ordinateur existant ne génère pas de coût matériel immédiat ;
- une carte graphique peut représenter plusieurs centaines d’euros ;
- les modèles occupent de l’espace disque ;
- les longues générations augmentent la consommation électrique.
L’utilisation locale évite les coûts à la requête d’une API distante, mais elle peut être moins rapide ou moins performante qu’un service cloud haut de gamme.
Quand privilégier Ollama plutôt qu’une IA en ligne ?
Ollama est particulièrement adapté lorsque :
- la confidentialité est prioritaire ;
- une connexion Internet n’est pas toujours disponible ;
- les tâches sont répétitives et automatisables ;
- le budget d’API doit rester limité ;
- l’utilisateur souhaite tester plusieurs modèles ;
- un contrôle local du traitement est nécessaire.
Une IA en ligne reste souvent préférable lorsque la meilleure qualité disponible, les modèles les plus récents, la recherche web intégrée ou une puissance de calcul élevée sont prioritaires.
Résoudre les problèmes fréquents
La commande `ollama` est introuvable
Fermez et rouvrez le terminal. Si le problème persiste, vérifiez l’installation et le chemin système. Sous Windows, un redémarrage peut être nécessaire pour actualiser la variable PATH.
Le message « connection refused » apparaît
Le serveur Ollama n’est probablement pas démarré. Lancez `ollama serve`, vérifiez l’application sur macOS ou contrôlez le service avec `systemctl` sous Linux.
Le modèle est trop lent
Utilisez un modèle plus petit, réduisez le contexte, fermez les programmes inutiles et vérifiez la détection du GPU avec `ollama ps`.
Ollama manque de mémoire
Supprimez les modèles inutilisés avec `ollama rm nom_du_modele`, arrêtez les modèles actifs avec `ollama stop nom_du_modele` et choisissez une variante plus légère.
Le téléchargement échoue
Contrôlez la connexion Internet, l’espace disque disponible et les éventuels blocages du pare-feu. Relancez ensuite `ollama pull nom_du_modele`.
Où sont stockés les modèles ?
Les modèles sont conservés localement dans un dossier géré par Ollama. L’emplacement exact dépend du système d’exploitation et du mode d’installation.
La variable d’environnement `OLLAMA_MODELS` permet de définir un autre dossier de stockage. Cette option est pratique lorsque le disque système est presque plein ou lorsque les modèles doivent être installés sur un SSD secondaire.
Avant de déplacer ce dossier, arrêtez Ollama et vérifiez les droits d’accès du nouvel emplacement.
Comment mettre à jour Ollama et les modèles ?
Pour mettre à jour Ollama, utilisez la nouvelle version de l’installateur officiel. Sous Linux, la réexécution de la procédure d’installation officielle permet généralement d’installer la version récente.
Pour actualiser un modèle, utilisez `ollama pull nom_du_modele`. Les tags peuvent évoluer avec le temps : une même étiquette peut parfois pointer vers une version différente après une mise à jour.
Conservez une copie des fichiers importants de configuration et vérifiez la licence d’un modèle avant de l’intégrer dans un produit commercial.
Points clés à retenir
- Ollama permet d’exécuter une IA localement sur Windows, macOS et Linux.
- L’installation consiste à installer Ollama, télécharger un modèle avec `ollama pull`, puis le lancer avec `ollama run`.
- Les modèles de 1 à 3 milliards de paramètres conviennent aux petites configurations, tandis que les modèles de 7 à 14 milliards offrent un meilleur compromis général.
- Une carte graphique accélère le traitement, mais n’est pas indispensable.
- L’API locale est disponible sur `http://localhost:11434`.
- Les modèles occupent plusieurs gigaoctets : vérifiez la RAM et l’espace disque avant l’installation.
- La confidentialité est meilleure qu’avec un service distant, mais les applications tierces connectées à Ollama doivent être contrôlées.
- N’exposez jamais directement le port Ollama sur Internet sans protection adaptée.
- Pour une interface graphique ou l’analyse de documents, ajoutez un outil comme Open WebUI ou une solution RAG.