Benchmark CPU · Petits modèles IA

11
Modèles
137
Tests
11
Tests/modèle

🏆 Podium — Classement global

Score = Ø Qualité × Ø Vitesse, pondéré par le français (+⅓). Le podium récompense les modèles offrant le meilleur équilibre qualité/vitesse/français.

🥈
llama3.2:3b
Q:6.4 × V:5.9 × FR:7.5
40.6
🥇
gemma3:4b
Q:6.0 × V:8.2 × FR:6.3
48.6
🥉
llama3.1:8b
Q:6.0 × V:5.5 × FR:7.7
34.6
#ModèleQualitéVitesseFrançaisScore
🥇gemma3:4b4.9/108.2 tok/s6.3/1048.6
🥈llama3.2:3b5.5/105.9 tok/s7.5/1040.6
🥉qwen3:4b3.8/108.2 tok/s3.3/1034.6
4llama3.1:8b4.8/105.5 tok/s7.7/1033.2
5phi4-mini4.7/105.4 tok/s6.9/1031.2
6qwen2.5-coder:7b4.6/105.3 tok/s7.1/1030.1
7qwen3:8b4.9/105.0 tok/s5.5/1029.0
8mistral:7b5.6/103.4 tok/s7.5/1023.8
9qwen3.5-4b3.3/104.7 tok/s3.5/1017.3
10qwen3.5-4b-mtp3.3/104.3 tok/s3.5/1015.8
11deepseek-r1:7b3.5/101.8 tok/s3.4/107.0

Classement général

Coq Français Taille
# Modèle Taille Ø tok/s Efficacité Français Coq Verdict
* Score français inclut les tokens de réflexion (CoT/Thinking Process) en anglais. Les modèles Qwen3 et DeepSeek-R1 ont un CoT intégré dans leurs poids : impossible à désactiver.

Débit moyen

Vert = réponse coq correcte · Gris = échoue au test coq

Score français

* Qwen3 et DeepSeek pénalisés par le CoT intégré en anglais

Efficacité (tok/s/Go)

Ratio performance/taille. Plus haut = meilleur rendement.

Score combiné

tok/s × français/10 — pondère vitesse et qualité française

🏅 Podiums par domaine — Qualité des réponses

Top 3 des modèles par justesse et qualité de réponse dans chaque catégorie. Les modèles avec CoT intégré en anglais (Qwen3, DeepSeek) sont pénalisés au classement — seuls les modèles répondant en français sont mis en avant.

Raisonnement (coq)

🥇
gemma3:4b
10/10
🥇
mistral:7b
10/10
🥇
phi4-mini
10/10
🥇
qwen3:8b
10/10

Code (palindrome)

🥇
llama3.1:8b
9.0/10
🥈
qwen2.5-coder:7b
9.0/10
🥉
mistral:7b
7.0/10
phi4-mini
7.0/10
llama3.2:3b
7.0/10
gemma3:4b
7.0/10

Grammaire

🥇
llama3.2:3b
9.0/10
🥇
mistral:7b
9.0/10
🥈
phi4-mini
7.0/10
llama3.1:8b
5.0/10
qwen2.5-coder:7b
5.0/10
gemma3:4b
5.0/10

Traduction

🥇
mistral:7b
7.0/10
🥈
llama3.1:8b
8.0/10
🥉
gemma3:4b
5.0/10
llama3.2:3b
5.0/10
qwen2.5-coder:7b
5.0/10
qwen3:8b
4.0/10

Latence (hello)

🥇
mistral:7b
8.0/10
🥈
llama3.1:8b
7.0/10
🥉
llama3.2:3b
5.0/10
qwen2.5-coder:7b
5.0/10
phi4-mini
3.0/10
gemma3:4b
3.0/10

Analyse code

🥇
llama3.2:3b
8.0/10
🥈
phi4-mini
9.0/10
🥉
mistral:7b
6.0/10
gemma3:4b
4.0/10
qwen3:4b
4.0/10
deepseek-r1:7b
3.0/10

Résumé long

🥇
mistral:7b
9.0/10
🥈
llama3.2:3b
8.0/10
🥉
llama3.1:8b
7.0/10
gemma3:4b
6.0/10
phi4-mini
6.0/10
qwen3:8b
5.0/10

Analyse logs

🥇
llama3.2:3b
8.0/10
🥈
llama3.1:8b
7.0/10
🥉
mistral:7b
6.0/10
phi4-mini
6.0/10
qwen3:4b
6.0/10
deepseek-r1:7b
5.0/10

Rédaction article

🥇
llama3.1:8b
8.0/10
🥈
llama3.2:3b
8.0/10
🥉
phi4-mini
8.0/10
gemma3:4b
7.0/10
mistral:7b
5.0/10
qwen2.5-coder:7b
5.0/10

Latence pure

🥇
llama3.1:8b
8.0/10
🥈
llama3.2:3b
5.0/10
🥉
mistral:7b
5.0/10
qwen2.5-coder:7b
5.0/10
phi4-mini
3.0/10
qwen3:4b
3.0/10

Raisonnement (docker)

🥇
mistral:7b
8.0/10
🥈
llama3.2:3b
8.0/10
🥉
llama3.1:8b
6.0/10
phi4-mini
6.0/10
gemma3:4b
6.0/10
qwen3:4b
5.0/10

Analyse par domaine

Débit par catégorie (tok/s)

Débit moyen (tok/s) et qualité des réponses par catégorie de test. Les valeurs en vert indiquent le meilleur score de la colonne.

Catégoriegemma3
4b
llama3.2
3b
qwen3
4b
llama3.1
8b
mistral
7b
phi4-miniqwen2.5-coder
7b
qwen3
8b
qwen3.5-4bqwen3.5-4b-mtpdeepseek-r1
7b
Raisonnement (coq)2.01.35.10.81.31.31.03.14.34.03.7
Code (palindrome)10.54.58.96.52.94.87.26.04.63.71.2
Grammaire10.37.19.66.82.67.82.56.04.64.01.4
Traduction10.27.710.04.83.57.95.25.05.64.10.8
Latence (hello)4.43.59.16.34.12.75.85.45.23.90.2
Analyse code10.111.18.76.95.38.05.75.47.06.36.1
Résumé long10.35.18.54.23.96.26.54.94.54.11.9
Analyse logs10.55.79.06.13.07.96.14.64.34.40.2
Rédaction article9.98.68.46.83.95.17.35.83.94.7
Latence pure2.63.63.84.93.00.75.83.12.42.61.1
Raisonnement (docker)9.57.28.76.53.97.45.66.24.85.01.7
Ø tok/s8.25.98.25.53.45.45.35.04.74.31.8
— = données non disponibles. Vert = meilleur score de la colonne.

Qualité par catégorie (/10)

Catégoriegemma3
4b
llama3.2
3b
qwen3
4b
llama3.1
8b
mistral
7b
phi4-miniqwen2.5-coder
7b
qwen3
8b
qwen3.5-4bqwen3.5-4b-mtpdeepseek-r1
7b
Raisonnement (coq)10.02.02.02.02.02.02.010.02.02.02.0
Code (palindrome)7.07.05.09.07.07.09.07.03.03.07.0
Grammaire3.07.03.03.07.05.03.03.03.03.03.0
Traduction5.05.03.05.07.03.05.05.03.03.03.0
Latence (hello)3.03.03.05.07.03.05.03.03.03.03.0
Analyse code4.08.04.03.04.08.03.03.04.04.03.0
Résumé long4.06.04.03.06.04.03.05.04.04.04.0
Analyse logs4.06.06.05.06.06.05.03.04.04.03.0
Rédaction article5.07.03.05.05.05.05.07.03.03.03.0
Latence pure3.03.03.08.03.03.08.03.03.03.03.0
Raisonnement (docker)6.06.06.05.08.06.03.05.04.04.04.0
Ø Qualité4.95.53.84.85.64.74.64.93.33.33.5
Score /10 basé sur : justesse de la réponse, qualité du français, complétude. Vert = meilleur score de la colonne.

Qualité des réponses par domaine

Cliquez sur chaque domaine pour voir les résultats détaillés. Classement par note qualité puis par vitesse.

Raisonnement (coq) — piège logique
ModèleQualitéVitesseRéponse
qwen3:8b10.0/103.1 tok/s<think>|Le coq ne pond pas d'oeufs...
gemma3:4b10.0/10 🇫🇷2.0 tok/sÉvidemment, les coqs ne pondent pas d'œufs, donc l'œuf ne tombe de quel que soit côté !
qwen3:4b2.0/105.1 tok/s<think> Okay, the user is asking a riddle in French. The question is: "Si un coq pond un oeuf sur le toit d'une grange, de quel cote tombe t-il ?" The
qwen3.5-4b2.0/104.3 tok/sThinking Process: 1. **Analyze the Request:** * Task: Answer a riddle/question. * Constraint 1: Exactly one sentence (1 phrase). *
qwen3.5-4b-mtp2.0/104.0 tok/sThinking Process: 1. **Analyze the Request:** * Task: Answer a riddle/question. * Constraint 1: Exactly one sentence (1 phrase). *
deepseek-r1:7b2.0/103.7 tok/s
llama3.2:3b2.0/10 🇫🇷1.3 tok/sIl tombe du côté où il est assis.
mistral:7b2.0/10 🇫🇷1.3 tok/s Réponse : De chaque côté, car un coq ne peut pas pondre.
phi4-mini2.0/10 🇫🇷1.3 tok/sIl ne tombe pas du tout ; il reste au sommet.
qwen2.5-coder:7b2.0/10 🇫🇷1.0 tok/sL'oeuf tombe du côté de la pente du toit.
llama3.1:8b2.0/10 🇫🇷0.8 tok/sL'œuf roule vers le bord du toit et tombe de la face extérieure du côté qui est bas.
Code (palindrome) — génération de code Python
ModèleQualitéVitesseRéponse
qwen2.5-coder:7b9.0/10 🇫🇷7.2 tok/sdef is_palindrome(s): return s == s[::-1]
llama3.1:8b9.0/10 🇫🇷6.5 tok/sdef is_palindrome(s): s = ''.join(c for c in s if c.isalnum()).lower() return s == s[::-1]
gemma3:4b7.0/10 🇫🇷10.5 tok/s```python import asyncio import json from typing import Any, Dict, Optional import httpx async def fetch_data_with_retry( url: str, retries
qwen3:8b7.0/106.0 tok/s<think>|def is_palindrome(s):...
phi4-mini7.0/10 🇫🇷4.8 tok/s```python import asyncio import httpx async def fetch_data_with_retry(url: str, max_retries=3) -> dict: """ Interroge une API REST avec
llama3.2:3b7.0/10 🇫🇷4.5 tok/sVoici une fonction Python asynchrone qui interroge une API REST avec retry (3 tentatives, backoff exponentiel), gère les timeouts et les erreurs HTTP,
mistral:7b7.0/10 🇫🇷2.9 tok/s Voici une fonction asynchrone qui interroge une API REST avec retry (3 tentatives, backoff exponentiel), gère les timeouts et les erreurs HTTP, et r
deepseek-r1:7b7.0/101.2 tok/sVoici une fonction Python asynchrone qui interroge une API REST avec des retours (3 tentatives), un backoff exponentiel, gère les timeout et erreurs H
qwen3:4b5.0/108.9 tok/s<think> Okay, I need to write an asynchronous Python function that interacts with a REST API. The requirements are: retry up to 3 times with exponenti
qwen3.5-4b3.0/104.6 tok/sHere is the plan to answer the user's request: 1. **Analyze the Request:** * **Role:** Python Developer Assistant. * **Task:** Write an
qwen3.5-4b-mtp3.0/103.7 tok/sHere is the plan to answer the user's request: 1. **Analyze the Request:** * **Role:** Python Developer Assistant. * **Task:** Write an
Grammaire française — correction de texte
ModèleQualitéVitesseRéponse
llama3.2:3b7.0/10 🇫🇷7.1 tok/sVoici le texte corrigé et reformé pour un email client professionnel : "Bonjour Monsieur, Je me permets de vous contacter pour suivre le statut de m
mistral:7b7.0/10 🇫🇷2.6 tok/s Bonjour Monsieur, Je vous écris pour le suivi de votre dossier. Depuis une semaine, je n'ai pas eu de nouvelles. Je voudrais savoir si vous avez bi
phi4-mini5.0/10 🇫🇷7.8 tok/sBonjour Monsieur, Je me permets de vous écrire pour suivre le dossier en cours dont je n’ai reçu aucune nouvelle depuis la semaine dernière. Aurie
gemma3:4b3.0/10 🇫🇷10.3 tok/sVoici une version corrigée et plus professionnelle du texte, adaptée à un email client : **Objet : Suivi de dossier - [Votre Numéro de Dossier si app
qwen3:4b3.0/109.6 tok/s<think> Okay, the user wants me to correct the spelling and reformulate the email to make it more professional. Let me start by reading the original t
llama3.1:8b3.0/10 🇫🇷6.8 tok/sJe me suis nourri, puis je suis allé au cinéma avec mes amis.
qwen3:8b3.0/106.0 tok/s<think>|J'ai mangé et ensuite je suis allé au cinéma...
qwen3.5-4b3.0/104.6 tok/sHere's a thinking process that leads to the suggested revisions: 1. **Analyze the Request:** * **Role:** Editorial Assistant (Assistant éditor
qwen3.5-4b-mtp3.0/104.0 tok/sHere's a thinking process that leads to the suggested revisions: 1. **Analyze the Request:** * **Role:** Editorial Assistant (Assistant éditor
qwen2.5-coder:7b3.0/10 🇫🇷2.5 tok/sJ'ai mangé et ensuite je suis allé au cinéma avec mes amis.
deepseek-r1:7b3.0/101.4 tok/sHere’s a revised version of your text in a more professional tone: --- Bonjour, Mr, I hope this message finds you well. I am writing to follow up o
Traduction (anglais → français)
ModèleQualitéVitesseRéponse
mistral:7b7.0/10 🇫🇷3.5 tok/s "Erreur 504 Timeout de la porte d'accès : Le serveur n'a pas reçu une réponse du temps imparti de la partie supérieure du serveur. Cela se produit g
gemma3:4b5.0/10 🇫🇷10.2 tok/sAbsolument ! Voici la traduction du message d'erreur et de la documentation, avec des explications pour les termes techniques : **Traduction du Messa
llama3.2:3b5.0/10 🇫🇷7.7 tok/sVoici la traduction du message d'erreur et de la documentation en français : "Erreur 504 Gateway Timeout : Le serveur n'a pas reçu une réponse à temp
qwen2.5-coder:7b5.0/10 🇫🇷5.2 tok/sLe renard brun rapide saute par-dessus le chien paresseux.
qwen3:8b5.0/105.0 tok/s<think>|Le renard brun rapide saute par-dessus le chien paresseux
llama3.1:8b5.0/10 🇫🇷4.8 tok/s« Le renard rapide brun saute sur le chien paresseux »
qwen3:4b3.0/1010.0 tok/s<think> Okay, I need to translate the given error message and documentation into French. Let me start by understanding the original text. The error i
phi4-mini3.0/10 🇫🇷7.9 tok/s"Erreur 504 : Temps d'attente du point de terminaison du serveur (Timeout Gateway): Le serveur n'a pas reçu une réponse en temps opportun depuis le se
qwen3.5-4b3.0/105.6 tok/sThinking Process: 1. **Analyze the Request:** * **Role:** Bilingual technical assistant (assistant technique bilingue). * **Task:** Tran
qwen3.5-4b-mtp3.0/104.1 tok/sThinking Process: 1. **Analyze the Request:** * **Role:** Technical assistant (bilingual). * **Task:** Translate a specific error messag
deepseek-r1:7b3.0/100.8 tok/s**Erreur 504 : Temps de délai sur l' gateway** L'erreur "Error 504 Gateway Timeout" indique qu'un temps d'exécution excessif a été tenu par la serveu
Latence — réponse courte
ModèleQualitéVitesseRéponse
mistral:7b7.0/10 🇫🇷4.1 tok/s La commande pour lister les conteneurs Docker en cours d'exécution est `docker ps`.
llama3.1:8b5.0/10 🇫🇷6.3 tok/sBonjour, comment puis-je vous aider?
qwen2.5-coder:7b5.0/10 🇫🇷5.8 tok/sBonjour! Comment puis-je vous aider aujourd'hui ?
qwen3:4b3.0/109.1 tok/s<think> Okay, the user is asking for the command to list running Docker containers. Let me recall. Docker has a command called docker ps, right? That'
qwen3:8b3.0/105.4 tok/sBonjour!
qwen3.5-4b3.0/105.2 tok/sThinking Process: 1. **Analyze the Request:** * Role: Assistant. * Task: Answer a specific question about Docker commands. * Quest
gemma3:4b3.0/10 🇫🇷4.4 tok/s`docker ps`
qwen3.5-4b-mtp3.0/103.9 tok/sThinking Process: 1. **Analyze the Request:** * Role: Assistant. * Task: Answer a specific question about Docker commands. * Quest
llama3.2:3b3.0/10 🇫🇷3.5 tok/s`docker ps -a`
phi4-mini3.0/10 🇫🇷2.7 tok/s`docker ps`
deepseek-r1:7b3.0/100.2 tok/s
Analyse de code — fonction Python de traitement
ModèleQualitéVitesseRéponse
llama3.2:3b8.0/10 🇫🇷11.1 tok/s**Analyse du code** Le code Python fourni est une fonction `process_data` qui prend en entrée une liste de dictionnaires (`items`) et un paramètre op
phi4-mini8.0/10 🇫🇷8.0 tok/sLe code Python fourni est une fonction appelée `process_data` qui prend deux arguments : un tableau d'objets (`items`) et un seuil optionnel (`thresho
gemma3:4b4.0/10 🇫🇷10.1 tok/sD'accord, analysons ce code Python étape par étape, identifions les problèmes potentiels et proposons des améliorations. **Analyse du Code** La fonc
qwen3:4b4.0/108.7 tok/s<think> Okay, let's take a look at this Python code. The function is called process_data and takes items and a threshold. The goal seems to be process
qwen3.5-4b4.0/107.0 tok/sHere's a thinking process that leads to the suggested analysis and improvements: 1. **Understand the Goal:** The user wants me to act as a technical
qwen3.5-4b-mtp4.0/106.3 tok/sHere's a thinking process that leads to the suggested analysis and improvements: 1. **Understand the Goal:** The user wants me to act as a technical
mistral:7b4.0/10 🇫🇷5.3 tok/s Ce code Python définit une fonction `process_data` qui traite des données enregistrées dans une liste d'objets, chacun représentant un élément avec
llama3.1:8b3.0/10 🇫🇷6.9 tok/sAnalyse du code : bugs potentiels : 1. Utilisation de eval() dangereuse 2. Gestion fichier sans fermeture 3. Division par zero potentielle 4. Manque d
deepseek-r1:7b3.0/106.1 tok/s
qwen2.5-coder:7b3.0/10 🇫🇷5.7 tok/sAnalyse: 1. eval() dangereux 2. Fichier non fermé 3. Division par zéro...
qwen3:8b3.0/105.4 tok/sAnalyse: bugs potentiels eval(), fichiers non fermés, division par zéro...
Résumé long — texte sur les LLMs
ModèleQualitéVitesseRéponse
llama3.2:3b6.0/10 🇫🇷5.1 tok/s**5 points clés :** 1. Le développement des LLM a connu une acceleration spectaculaire depuis 2020, avec l'intégration de mecanismes d'attention plus
mistral:7b6.0/10 🇫🇷3.9 tok/s 1. Le developpement des LLM a connu une acceleration spectaculaire depuis 2020. 2. Les architectures Transformer ont evolue pour integrer des mecani
qwen3:8b5.0/104.9 tok/sSynthèse: L'IA évolue rapidement avec les LLMs...
gemma3:4b4.0/10 🇫🇷10.3 tok/sVoici un résumé du texte en 5 points clés, suivi de l’identification des 3 thèmes principaux : **Résumé en 5 points clés:** 1. **Progrès Rapide des
qwen3:4b4.0/108.5 tok/s<think> Okay, I need to summarize the given text into 5 key points and identify the three main themes. Let me start by reading the text carefully. Fi
phi4-mini4.0/10 🇫🇷6.2 tok/s1. Acceleration du développement des LLM depuis 2020 grâce aux architectures Transformer sophistiquées. 2. Le coût élevé de l'entraînement des modèles
qwen3.5-4b4.0/104.5 tok/sThinking Process: 1. **Analyze the Request:** * Input text: A short paragraph about Large Language Models (LLMs), their evolution, costs, demo
qwen3.5-4b-mtp4.0/104.1 tok/sThinking Process: 1. **Analyze the Request:** * Input text: A short paragraph about Large Language Models (LLMs), their development, costs, de
deepseek-r1:7b4.0/101.9 tok/s**Key Points:** 1. **Rapid Advancements in Large Language Models (LLMs):** Since 2020, LLMs have undergone significant advancements, particularly in
qwen2.5-coder:7b3.0/10 🇫🇷6.5 tok/sL'IA connaît une évolution rapide grâce aux LLMs...
llama3.1:8b3.0/10 🇫🇷4.2 tok/sSynthèse en 3 phrases : L'IA connaît un essor rapide avec les LLMs comme GPT et Claude. Ces modèles sont entraînés sur des données massives. Parallèle
Analyse de logs — diagnostic incident serveur
ModèleQualitéVitesseRéponse
qwen3:4b6.0/109.0 tok/s<think> Okay, let's tackle this user's query. They provided server logs and want an analysis with the root cause, time of the problem, impacted servic
phi4-mini6.0/10 🇫🇷7.9 tok/sCause Racine : Le problème principal semble être une surcharge des connexions à la base de données PostgreSQL. La charge excessive a entraîné l'exhaus
llama3.2:3b6.0/10 🇫🇷5.7 tok/sAnalyse des logs serveur : **Résumé** Les logs servent à décrire les événements qui ont affecté la disponibilité et le fonctionnement d'un système s
mistral:7b6.0/10 🇫🇷3.0 tok/s Cause racine : L'erreur est due à l'épuisement des connexions PostgreSQL (20/20) à 08:21. Cela a entraîné une échec de la vérification d'état et un
llama3.1:8b5.0/10 🇫🇷6.1 tok/sAnalyse des logs : problème de connexion DB, le service tente de se reconnecter puis timeout. Après redémarrage du api-gateway, nouvelle erreur de con
qwen2.5-coder:7b5.0/10 🇫🇷6.1 tok/sCause: api-gateway ne peut pas joindre la DB 10.0.0.5:5432...
gemma3:4b4.0/10 🇫🇷10.5 tok/sOkay, let's analyze these server logs to determine the root cause, timing, impacted services, and corrective actions. **1. Cause Root:** The primary
qwen3.5-4b-mtp4.0/104.4 tok/sHere's a thinking process that leads to the suggested analysis: 1. **Understand the Goal:** The user wants an analysis of provided server logs. Spec
qwen3.5-4b4.0/104.3 tok/sHere's a thinking process that leads to the suggested analysis: 1. **Understand the Goal:** The user wants an analysis of provided server logs. Spec
qwen3:8b3.0/104.6 tok/sCause racine: perte de connexion DB suivie de timeout...
deepseek-r1:7b3.0/100.2 tok/s**Analyse des logs serveur :** 1. **Temps de l'incident :** - L'incident se produit entre 08:21 et 08:30. 2. **Ca
Rédaction d'article — avantages des petits modèles IA
ModèleQualitéVitesseRéponse
llama3.2:3b7.0/10 🇫🇷8.6 tok/s**Sécuriser votre API REST : Les meilleures pratiques pour 2026** L'API REST (Representational State of Resource) est devenue un standard pour les éc
qwen3:8b7.0/105.8 tok/sArticle sur les petits modèles d'IA locaux...
gemma3:4b5.0/10 🇫🇷9.9 tok/s## Sécuriser vos APIs REST en 2026 : Un Guide Technique et Concret L'API REST est devenue le pilier de l'architecture logicielle moderne, permettant
qwen2.5-coder:7b5.0/10 🇫🇷7.3 tok/sLes petits modèles d'IA permettent une utilisation optimisée...
llama3.1:8b5.0/10 🇫🇷6.8 tok/sLes petits modèles d'IA : une puissance à portée de main. Les modèles compacts comme Phi-4-mini, Gemma 3 et Qwen 3 offrent des performances impression
phi4-mini5.0/10 🇫🇷5.1 tok/s# Les Meilleures Pratiques Pour Securiser Une API REST En 2026 Les années passées ont vu des avancées significatives dans le domaine de la cybersécur
mistral:7b5.0/10 🇫🇷3.9 tok/s Introduction L'API REST (Representational State Transfer) est devenue l'architecture la plus courante pour les applications web modernes. Elle perm
qwen3:4b3.0/108.4 tok/s<think> Okay, the user wants a blog post in French about best practices for securing a REST API in 2026. They specified an introduction, five sections
qwen3.5-4b-mtp3.0/104.7 tok/sHere's a thinking process that leads to the suggested blog post: 1. **Analyze the Request:** * **Topic:** Best practices for securing a REST A
qwen3.5-4b3.0/103.9 tok/sHere's a thinking process that leads to the suggested blog post: 1. **Analyze the Request:** * **Topic:** Best practices for securing a REST A
deepseek-r1:7b3.0/100.0 tok/s
Latence pure — question simple
ModèleQualitéVitesseRéponse
qwen2.5-coder:7b8.0/10 🇫🇷5.8 tok/sLa capitale de la France est Paris.
llama3.1:8b8.0/10 🇫🇷4.9 tok/sLa capitale de la France est Paris.
qwen3:4b3.0/103.8 tok/s<think> Okay, the
llama3.2:3b3.0/10 🇫🇷3.6 tok/sJe suis prêt.
qwen3:8b3.0/103.1 tok/sParis.
mistral:7b3.0/10 🇫🇷3.0 tok/s aux questions.
gemma3:4b3.0/10 🇫🇷2.6 tok/sOui
qwen3.5-4b-mtp3.0/102.6 tok/sThinking Process: 1
qwen3.5-4b3.0/102.4 tok/sThinking Process: 1
deepseek-r1:7b3.0/101.1 tok/s
phi4-mini3.0/10 🇫🇷0.7 tok/sOui.
Raisonnement Docker — dépannage réseau bridge→host
ModèleQualitéVitesseRéponse
mistral:7b8.0/10 🇫🇷3.9 tok/s Le problème que l'utilisateur rencontre est lié à la modification du réseau de son déploiement Docker depuis bridge vers host. Le réseau bridge est
gemma3:4b6.0/10 🇫🇷9.5 tok/sBonjour ! Je comprends votre problème, c'est un classique lorsqu'on passe d'un réseau Docker standard à un réseau "host" (ou "bridge host"). Laissez
qwen3:4b6.0/108.7 tok/s<think> Okay, the user is having trouble with their Docker deployment after switching the network mode from bridge to host. The containers aren't comm
phi4-mini6.0/10 🇫🇷7.4 tok/sLe changement du réseau `bridge` vers une configuration `host` dans un environnement Docker peut entraîner des problèmes de communication entre les co
llama3.2:3b6.0/10 🇫🇷7.2 tok/sBonjour ! Je suis ravi de vous aider à résoudre ce problème. Le problème que vous rencontrez est probablement lié au fait que les conteneurs Docker u
llama3.1:8b5.0/10 🇫🇷6.5 tok/sProblème classique : en mode host, les conteneurs partagent le réseau de l'hôte et perdent la communication interne via les noms de conteneur. Solutio
qwen3:8b5.0/106.2 tok/sProblème: host network partage la stack de l'hôte...
qwen3.5-4b-mtp4.0/105.0 tok/sHere's a thinking process that leads to the suggested response: 1. **Analyze the User's Request:** * **Role:** Technical Assistant (Assistant
qwen3.5-4b4.0/104.8 tok/sHere's a thinking process that leads to the suggested response: 1. **Analyze the User's Request:** * **Role:** Technical Assistant (Assistant
deepseek-r1:7b4.0/101.7 tok/sL'utilisateur a rencontré un problème avec son déploiement Docker après avoir modifié le type de réseau de `bridge` à `host`. Les conteneurs ne sont
qwen2.5-coder:7b3.0/10 🇫🇷5.6 tok/sProblème: mode host brise l'isolation réseau entre conteneurs...

Protocole de test reproductible

Benchmark executé sur Ubuntu 24.04.4 LTS. Cliquer sur l'en-tete d'un bloc pour le copier.

Option A : Installation Docker (recommandee)

A1. Installer Docker + Ollama en conteneur

# Installer Docker sur Ubuntu
curl -fsSL https://get.docker.com | sh

# Lancer Ollama en conteneur
docker run -d --name ollama --restart unless-stopped \
  -v ollama_data:/root/.ollama \
  -p 127.0.0.1:11434:11434 \
  ollama/ollama

# Verification
docker exec ollama ollama --version

B1. Telecharger les modeles

docker exec ollama ollama pull gemma3:4b
docker exec ollama ollama pull llama3.2:3b
docker exec ollama ollama pull qwen3:4b
docker exec ollama ollama pull llama3.1:8b
docker exec ollama ollama pull mistral:7b
docker exec ollama ollama pull phi4-mini
docker exec ollama ollama pull qwen2.5-coder:7b
docker exec ollama ollama pull qwen3:8b
docker exec ollama ollama pull qwen3.5-4b
docker exec ollama ollama pull qwen3.5-4b-mtp
docker exec ollama ollama pull deepseek-r1:7b
docker exec ollama ollama list

C1. Benchmark rapide (5 tests par modele)

#!/bin/bash
MODELES="gemma3:4b llama3.2:3b qwen3:4b llama3.1:8b mistral:7b phi4-mini qwen2.5-coder:7b qwen3:8b qwen3.5-4b qwen3.5-4b-mtp deepseek-r1:7b"
for M in $MODELES; do
  echo "=== $M ==="
  for test in \
    "raisonnement_coq|Un coq pond un oeuf sur le toit d'une grange. De quel cote tombe l'oeuf ?|100" \
    "code_palindrome|Ecris une fonction Python is_palindrome(s). Donne juste le code.|100" \
    "grammaire_francais|Corrige: J'ai mange et ensuite j'ai alle au cinema avec mes amis.|80" \
    "traduction|Traduis en francais: The quick brown fox jumps over the lazy dog|100" \
    "latence_hello|Dis simplement bonjour.|20"; do
    IFS='|' read -r n p t <<< "$test"
    docker exec ollama curl -s http://127.0.0.1:11434/api/generate \
      -H "Content-Type: application/json" \
      -d "{\"model\":\"$M\",\"prompt\":\"$p\",\"options\":{\"num_predict\":$t,\"temperature\":0.7},\"stream\":false}"
    echo ""
  done
  docker exec ollama curl -s http://127.0.0.1:11434/api/generate \
    -H "Content-Type: application/json" \
    -d "{\"model\":\"$M\",\"prompt\":\"x\",\"keep_alive\":0,\"stream\":false}" > /dev/null
done

D1. Benchmark realiste (5 tests par modele)

#!/bin/bash
# Tests : analyse_code (300t), resume_long (400t), analyse_logs (350t), redaction_article (500t), latence_pure (5t)
# Structure identique au bloc C1
# Voir batch5.csv pour les prompts complets

E1. Test reseau Docker (1 test par modele)

#!/bin/bash
MODELES="gemma3:4b llama3.2:3b qwen3:4b llama3.1:8b mistral:7b phi4-mini qwen2.5-coder:7b qwen3:8b qwen3.5-4b qwen3.5-4b-mtp deepseek-r1:7b"
for M in $MODELES; do
  docker exec ollama curl -s http://127.0.0.1:11434/api/generate \
    -H "Content-Type: application/json" \
    -d "{\"model\":\"$M\",\"prompt\":\"Explique pourquoi changer le network Docker de bridge a host peut empecher les conteneurs de communiquer entre eux.\",\"options\":{\"num_predict\":300,\"temperature\":0.7},\"stream\":false}"
  echo ""
  docker exec ollama curl -s http://127.0.0.1:11434/api/generate \
    -H "Content-Type: application/json" \
    -d "{\"model\":\"$M\",\"prompt\":\"x\",\"keep_alive\":0,\"stream\":false}" > /dev/null
done
Option B : Installation directe sur l'OS

A2. Installer Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama --version

B2. Telecharger les modeles

ollama pull gemma3:4b
ollama pull llama3.2:3b
ollama pull qwen3:4b
ollama pull llama3.1:8b
ollama pull mistral:7b
ollama pull phi4-mini
ollama pull qwen2.5-coder:7b
ollama pull qwen3:8b
ollama pull qwen3.5-4b
ollama pull qwen3.5-4b-mtp
ollama pull deepseek-r1:7b
ollama list

C2. Benchmark rapide (5 tests par modele)

#!/bin/bash
MODELES="gemma3:4b llama3.2:3b qwen3:4b llama3.1:8b mistral:7b phi4-mini qwen2.5-coder:7b qwen3:8b qwen3.5-4b qwen3.5-4b-mtp deepseek-r1:7b"
for M in $MODELES; do
  echo "=== $M ==="
  for test in \
    "raisonnement_coq|Un coq pond un oeuf sur le toit d'une grange. De quel cote tombe l'oeuf ?|100" \
    "code_palindrome|Ecris une fonction Python is_palindrome(s). Donne juste le code.|100" \
    "grammaire_francais|Corrige: J'ai mange et ensuite j'ai alle au cinema avec mes amis.|80" \
    "traduction|Traduis en francais: The quick brown fox jumps over the lazy dog|100" \
    "latence_hello|Dis simplement bonjour.|20"; do
    IFS='|' read -r n p t <<< "$test"
    curl -s http://127.0.0.1:11434/api/generate \
      -H "Content-Type: application/json" \
      -d "{\"model\":\"$M\",\"prompt\":\"$p\",\"options\":{\"num_predict\":$t,\"temperature\":0.7},\"stream\":false}"
    echo ""
  done
  curl -s http://127.0.0.1:11434/api/generate \
    -H "Content-Type: application/json" \
    -d "{\"model\":\"$M\",\"prompt\":\"x\",\"keep_alive\":0,\"stream\":false}" > /dev/null
done

D2. Benchmark realiste (5 tests par modele)

#!/bin/bash
# Tests : analyse_code (300t), resume_long (400t), analyse_logs (350t), redaction_article (500t), latence_pure (5t)
# Structure identique au bloc C2
# Voir batch5.csv pour les prompts complets

E2. Test reseau Docker (1 test par modele)

#!/bin/bash
MODELES="gemma3:4b llama3.2:3b qwen3:4b llama3.1:8b mistral:7b phi4-mini qwen2.5-coder:7b qwen3:8b qwen3.5-4b qwen3.5-4b-mtp deepseek-r1:7b"
for M in $MODELES; do
  curl -s http://127.0.0.1:11434/api/generate \
    -H "Content-Type: application/json" \
    -d "{\"model\":\"$M\",\"prompt\":\"Explique pourquoi changer le network Docker de bridge a host peut empecher les conteneurs de communiquer entre eux.\",\"options\":{\"num_predict\":300,\"temperature\":0.7},\"stream\":false}"
  echo ""
  curl -s http://127.0.0.1:11434/api/generate \
    -H "Content-Type: application/json" \
    -d "{\"model\":\"$M\",\"prompt\":\"x\",\"keep_alive\":0,\"stream\":false}" > /dev/null
done
Si ollama pull echoue — Methode alternative GGUF

Si le telechargement via ollama pull bloque (timeout, CDN), telechargez les GGUF depuis HuggingFace et importez-les manuellement :

#!/bin/bash
# Alternative : telecharger le GGUF depuis HuggingFace et l'importer dans Ollama
# Adaptez le nom du fichier et l'URL selon le modele souhaite

MODELE="gemma3:4b"
GGUF_URL="https://huggingface.co/bartowski/gemma-3-4b-it-GGUF/resolve/main/gemma-3-4b-it-Q4_K_M.gguf"
GGUF_FILE="/tmp/modele.gguf"

# 1. Telechargement avec reprise
echo "Telechargement de $MODELE..."
curl -L -C - -o "$GGUF_FILE" "$GGUF_URL"

# 2. Copie dans le conteneur Ollama
docker cp "$GGUF_FILE" ollama:/tmp/

# 3. Creation du Modelfile
cat > /tmp/Modelfile << MODEOF
FROM /tmp/modele.gguf
MODEOF
docker cp /tmp/Modelfile ollama:/tmp/

# 4. Import
docker exec ollama ollama create "$MODELE" -f /tmp/Modelfile

echo "✅ $MODELE importe"
docker exec ollama ollama list | grep "$MODELE"

Trouvez les URLs GGUF exactes sur huggingface.co (fichiers .gguf dans le repo du modele). Utilisez curl -L -C - qui permet de reprendre un telechargement interrompu.

Notes

Plateforme de test : VPS KVM4 · 16 Go RAM · 4 vCPU · CPU only · Ubuntu 24.04.4 LTS · Docker 29.6.2 · Ollama 0.32.1
Données brutes : batch5.csv (141 lignes) · 11 catégories · temps, tokens, tok/s, réponses complètes
Modèle exclu : qwen3.5-9b (OOM avec 16 Go RAM)