Mistral, Llama ou Qwen en local : quel LLM choisir en 2026 ?
Plan de l'article
💡 En résumé (TL;DR)
- Il n'existe pas de vainqueur universel entre Mistral, Llama et Qwen. Le bon choix dépend de la tâche, de la langue, de la mémoire disponible, de la licence et des intégrations.
- Pour un premier test local, comparez des modèles de taille voisine et utilisez exactement les mêmes prompts, documents et paramètres.
- Un modèle plus gros n'est utile que s'il tient dans la mémoire et améliore réellement vos cas métier. Un modèle compact bien cadré peut être plus rapide, moins coûteux et plus fiable.
- L'exécution locale réduit les transferts vers un fournisseur externe, mais ne garantit pas la confidentialité : journaux, interfaces web, sauvegardes et postes clients restent à sécuriser.
- Le verdict AngleFormation : présélectionnez un Mistral, un Llama et un Qwen compatibles avec votre machine, puis décidez sur un benchmark interne plutôt que sur un classement public.
Choisir un LLM local uniquement à partir d'un nombre de paramètres ou d'un classement conduit souvent à une mauvaise expérience. Deux modèles de taille similaire peuvent différer fortement sur le français, le code, l'appel d'outils, la longueur de contexte et la consommation de mémoire. La quantification et le logiciel d'inférence modifient encore le résultat.
Ce guide complète notre tutoriel pour installer Ollama et Open WebUI avec Docker. Ici, nous ne réinstallons pas la plateforme : nous construisons une méthode de décision entre les familles Mistral, Llama et Qwen.
Les trois familles en un coup d'œil
| Famille | Points à tester en priorité | Cas fréquents |
|---|---|---|
| Mistral | français, synthèse, efficacité, instruction | assistant interne, extraction, rédaction |
| Llama | écosystème, compatibilité, généralisation | prototypage, RAG, assistants généralistes |
| Qwen | code, multilingue, raisonnement, outils selon modèle | développement, agents, données structurées |
Ces lignes sont des pistes de test, pas des garanties. Chaque famille contient plusieurs générations, tailles et variantes. Comparez les modèles exacts, pas seulement les marques.
Vérifier quatre informations avant le téléchargement
- la carte officielle du modèle et sa date ;
- la licence et l'usage commercial autorisé ;
- la taille et le format distribués par votre moteur d'inférence ;
- les capacités annoncées : texte, image, appel d'outils, contexte, langues.
Meta publie des cartes distinctes pour Llama 3.2 et 3.3. Mistral maintient un catalogue qui sépare modèles ouverts et offres commerciales. Qwen publie ses familles et variantes sur son site officiel. Ollama fournit ensuite des paquets prêts à exécuter, mais la présence d'un nom dans une bibliothèque ne remplace pas la lecture de la licence amont.
Étape 1 — Définir le travail à accomplir
Un benchmark public mesure rarement votre vrai problème. Construisez une fiche de besoin :
Utilisateurs : support interne, 8 personnes
Langues : français 80 %, anglais 20 %
Entrées : procédures PDF et tickets anonymisés
Sorties : réponse courte avec sources
Latence cible : moins de 8 secondes
Données interdites : mots de passe, santé, paie
Matériel : 32 Go RAM, GPU 12 Go VRAM
Intégration : API locale + n8n
Séparez les tâches :
- classification ;
- extraction JSON ;
- résumé ;
- réponse à partir de documents ;
- génération de code ;
- appel d'outils ;
- raisonnement multi-étapes.
Un modèle peut exceller en rédaction et échouer à respecter un schéma JSON. N'additionnez pas tous les usages dans une note vague.
Étape 2 — Relier la taille du modèle au matériel
La mémoire nécessaire dépend des paramètres, de la quantification, du contexte et du moteur. Une règle approximative pour les poids seuls :
| Taille | Poids 4 bits approximatifs | Machine de test raisonnable |
|---|---|---|
| 1 à 4 milliards | 1 à 3 Go | CPU récent ou petit GPU |
| 7 à 9 milliards | 5 à 8 Go | 16 Go RAM, GPU 8 à 12 Go conseillé |
| 12 à 14 milliards | 9 à 12 Go | 32 Go RAM ou GPU plus large |
| 27 à 32 milliards | 18 à 24 Go | 32 à 64 Go RAM, GPU 24 Go ou plus |
| 70 milliards et plus | plusieurs dizaines de Go | station ou serveur multi-GPU |
Ces valeurs ne comprennent pas toujours le cache de contexte et les surcoûts. Vérifiez l'utilisation réelle avec votre longueur de prompt. Si le modèle déborde de la VRAM vers la RAM, la latence peut augmenter fortement.
Quantification : compromis utile, pas gratuit
La quantification réduit la mémoire et accélère souvent l'inférence, mais peut dégrader la précision. Pour comparer deux familles :
- choisissez une quantification comparable ;
- gardez la même longueur de contexte ;
- fixez la température et la graine si le moteur le permet ;
- mesurez le premier jeton et le débit ;
- répétez chaque scénario.
Étape 3 — Installer trois candidats avec Ollama
Consultez d'abord la bibliothèque Ollama pour choisir des tags qui existent le jour du test.
ollama --version
ollama list
# Remplacer les tags par les variantes réellement choisies.
ollama pull mistral:7b
ollama pull llama3.2:3b
ollama pull qwen3:4b
ollama run mistral:7b
Les tailles de cet exemple ne sont pas équivalentes. Pour un résultat sérieux, ajoutez un second tour avec des modèles plus proches en nombre de paramètres et en quantification.
Ne lancez jamais un modèle téléchargé depuis une source inconnue avec des extensions ou du code arbitraire. Privilégiez les dépôts officiels et vérifiez les sommes de contrôle lorsqu'elles sont fournies.
Étape 4 — Construire un benchmark métier
Préparez 30 à 100 cas représentatifs, dont certains difficiles. Retirez ou synthétisez les données personnelles.
| Critère | Note | Contrôle |
|---|---|---|
| Exactitude | 0 à 5 | comparaison à une réponse de référence |
| Respect des consignes | 0 à 5 | format, ton, longueur |
| Français | 0 à 5 | grammaire et vocabulaire métier |
| Citations | 0 à 5 | sources présentes et compatibles |
| JSON | 0 à 5 | validation automatique du schéma |
| Hallucination | 0 à 5 | pénalité pour fait inventé |
| Latence | mesure | médiane et 95e percentile |
| Mémoire | mesure | RAM/VRAM maximale |
Conservez les prompts et sorties dans un dossier versionné sans données sensibles. Faites relire un échantillon à deux personnes lorsque la qualité comporte un jugement subjectif.
Exemple d'extraction contrôlée
{
"ticket_id": "T-1042",
"urgence": "faible|moyenne|haute",
"produit": "string|null",
"resume": "string",
"action_humaine": true
}
Validez la sortie avec un schéma. Une réponse presque JSON ne suffit pas pour un workflow automatisé.
Étape 5 — Évaluer RAG et appel d'outils séparément
Pour un assistant documentaire, la qualité dépend autant de la recherche que du LLM. Mesurez :
- si le bon document est retrouvé ;
- si les passages transmis contiennent la réponse ;
- si le modèle refuse de répondre lorsque la source manque ;
- si les citations renvoient au passage exact ;
- si une instruction présente dans le document peut détourner l'agent.
Pour l'appel d'outils, limitez les fonctions et validez les arguments en dehors du modèle. Un LLM ne doit pas décider seul d'envoyer un email, supprimer un fichier ou modifier une facture.
Notre guide sur l'architecture multi-agents avec n8n et Ollama détaille les composants d'orchestration.
Sécurité et confidentialité
« Local » décrit le lieu d'inférence, pas l'ensemble du système. Vérifiez :
- l'interface Ollama n'est pas exposée publiquement ;
- Open WebUI possède une authentification et des comptes séparés ;
- les journaux ne stockent pas les prompts indéfiniment ;
- les sauvegardes sont chiffrées ;
- les documents RAG ont des droits d'accès ;
- les connecteurs n'envoient pas les données vers une API externe ;
- les modèles et images Docker sont mis à jour ;
- un inventaire indique la version et la licence de chaque modèle.
Si plusieurs services appellent Ollama, placez-le sur un réseau privé et ajoutez une passerelle authentifiée.
Matrice de décision AngleFormation
| Situation | Point de départ | Pourquoi |
|---|---|---|
| PC sans GPU | petit modèle 1B à 4B | latence et mémoire maîtrisées |
| GPU 8 à 12 Go | modèle 7B à 9B quantifié | bon compromis pour prototypage |
| Français et synthèse | comparer Mistral et Qwen | mesurer le vocabulaire métier |
| Code et JSON | comparer Qwen et Llama | tester schéma et outils |
| RAG généraliste | tester les trois | la chaîne de recherche domine souvent |
| Données très sensibles | local + réseau isolé | contrôler tous les composants |
Le résultat final peut être un routage : petit modèle pour classer, modèle plus puissant pour les cas complexes, humain pour les actions à risque.
FAQ
Quel est le meilleur LLM local pour le français ?
Il n'existe pas de réponse stable pour toutes les tailles et tâches. Mistral et Qwen méritent souvent d'être testés, mais seule une évaluation sur votre vocabulaire et vos documents permet de choisir.
Combien de RAM faut-il pour un modèle 7B ?
Un modèle 7B quantifié sur 4 bits occupe souvent plusieurs gigaoctets et peut fonctionner sur une machine de 16 Go de RAM. Le contexte, le moteur et les autres services augmentent toutefois la consommation. Mesurez avant la production.
Peut-on utiliser un LLM local commercialement ?
Cela dépend de la licence du modèle exact et parfois du volume d'utilisateurs ou de l'usage. Consultez la carte et le texte de licence de la version téléchargée ; le caractère « open weight » n'équivaut pas toujours à une licence sans condition.
Un LLM local fonctionne-t-il sans Internet ?
Après téléchargement des poids et dépendances, l'inférence peut fonctionner hors ligne. Les interfaces, mises à jour, connecteurs, recherches web et outils externes peuvent néanmoins nécessiter Internet.
Conclusion
Mistral, Llama et Qwen sont trois excellents points de départ, mais la décision doit être expérimentale. Comparez des modèles précis, sur le même matériel et avec des cas métier notés. Le meilleur modèle est celui qui atteint la qualité requise avec une latence, une mémoire, une licence et un niveau de risque acceptables.