Pierre KasparianAI & Data freelancer
← Retour à la catégorie
LLM localopen source LLM RGPDIA souveraine entrepriseLLM hébergement Europe

Qwen3.8 vs Gemma 4 : quel LLM local pour GPU 24 Go ?

19 août 2026 · 5 min de lecture · Articles

Pierre Kasparian

Freelance intégration IA · Spécialiste LLM, RAG · 11+ réalisations clients

Vous voulez exécuter un LLM open weight sur votre propre GPU pour traiter des données sensibles sans rien envoyer vers un cloud américain ? Le choix du modèle décide de la faisabilité, de la qualité et du budget. En 2026, une carte avec 24 Go de VRAM (comme le RTX 4090) reste le point d'entrée réaliste pour de l'inférence locale, et trois modèles y tiennent en quantisation Q4 : Qwen3.8-27B, Qwen3.6-27B et Gemma 4 31B-it.

Réponse directe : le test de Kingy.ai (un RTX 4090, llama.cpp, suites synthétiques) désigne Qwen3.8-27B comme le meilleur choix par défaut sur un GPU 24 Go : même vitesse de décode que Qwen3.6 (~49 tokens/s), mais 12/12 tâches de codage au premier essai, 39/40 cas de raisonnement et 23/24 questions documentaires. Gemma 4 31B-it reste l'alternative crédible pour les appels d'outils stricts et la vision. Qwen3.6-27B ne se justifie plus que pour une intégration existante déjà stabilisée.

Pourquoi un LLM local intéresse une entreprise européenne

Un modèle exécuté sur vos serveurs garde vos données en interne. Aucun prompt, aucun document, aucun log ne quitte votre infrastructure. C'est la réponse structurelle aux deux questions posées par l'IA cloud :

  • L'Article 44 du RGPD interdit les transferts de données personnelles hors UE sans garanties adéquates.
  • Le CLOUD Act (2018) permet aux autorités américaines d'exiger l'accès aux données détenues par des entreprises US, même lorsqu'elles sont stockées en Europe.

Un déploiement local sur du matériel que vous possédez élimine ces deux risques à la source. C'est le cœur de l'IA souveraine : des modèles open weight sous licence Apache 2.0 qui tournent sur votre infrastructure, pour un coût d'inférence marginal indépendant des tarifs d'API. La CNIL documente les bonnes pratiques de l'IA sur cnil.fr, et l'article open weights : le débat qui façonne l'IA souveraine explique pourquoi cette voie gagne du terrain face aux modèles propriétaires.

Comment le comparatif a été mené

Kingy.ai a mesuré les trois modèles sur un seul RTX 4090 (24 564 MiB), avec llama.cpp (commit b10453), Ubuntu 22.04.3, driver NVIDIA 570.195.03 et CUDA 11.8, sur un Ryzen 9 7950X avec 128 Go de RAM et sans swap.

Les réglages étaient communs : offload GPU complet, flash attention, cache K/V en F16, batch 2 048, décode spéculative désactivée pour les tests de qualité. Deux couloirs de comparaison ont été définis :

  • Q4 égalitaire : les trois fichiers Q4_K_M exacts, mêmes réglages.
  • Meilleur profil dans 24 Go : seuls les changements utiles sont autorisés (Gemma passe son cache K/V en Q8_0 pour tenir le 64K).

La suite de tests contient 50 vérifications d'instructions, 40 cas de raisonnement sur trois seeds, 30 appels d'outils simples, 10 appels multi-étapes, 12 tâches de codage, 24 questions documentaires (packs 8K et 32K) et 20 images synthétiques. Le runtime compte 27,32 milliards de paramètres pour Qwen3.8, 26,90 pour Qwen3.6 et 30,70 pour Gemma.

Quels fichiers Q4 choisir et combien ils pèsent

ModèleFichier GGUFTaille
Qwen3.8-27BQwen3.8-27B-Q4_K_M.gguf15,932 GiB
Qwen3.6-27BQwen3.6-27B-Q4_K_M.gguf15,662 GiB
Gemma 4 31B-itgemma-4-31B-it-Q4_K_M.gguf17,065 GiB

Les trois cartes modèles déclarent 262 144 positions maximales. Architecture réelle : 64 couches texte pour les Qwen (48 en attention linéaire, 16 en attention pleine, une couche pleine tous les 4 niveaux) et 60 couches pour Gemma (50 en attention glissante, 10 pleines). Les encodeurs vision comptent 27 couches pour les trois. Cette limite déclarée est une borne d'architecture, pas une promesse : le contexte le plus stable mesuré reste 64K.

Quel modèle choisir selon la tâche ?

PrioritéChoixRésultat mesuré
Agents de codage, édition de dépôtQwen3.8-27B12/12 pass@1, 35/36 runs seedés
Raisonnement sous budget de tokensQwen3.8-27B39/40 pass@3, 117/120
Questions sur documents privésQwen3.8-27B23/24, devant Gemma (22/24)
Appels d'outils strictsGemma 4 31B-it90/90 simples, 30/30 multi-étapes
Tâches visionGemma 4 31B-it19/20, contre 18/20 pour Qwen3.8
Écriture et relectureÉgalité94/96, 93/96, 93/96
Contexte 64K avec margeQwen3.8 ou Qwen3.64,20 GiB libres en F16 K/V
Migration minimaleQwen3.6-27BStack existante déjà validée

Le verdict du test : pour un nouveau déploiement, Qwen3.8-27B est difficile à battre. Gemma gagne sur les appels d'outils déclarés, la vision et l'écriture, mais consomme plus de VRAM et sa boucle de codage itérative est moins fiable. Qwen3.6 ne reste pertinent que si votre pipeline est déjà réglé dessus. Le test complet et sa méthodologie sont publiés sur kingy.ai.

Qu'est-ce qui tient vraiment dans 24 Go ?

Un fichier de poids de 16 à 17 GiB ne laisse pas sept ou huit GiB pour le contexte : le runtime, le cache K/V, les projecteurs vision et la décode spéculative consomment aussi de la VRAM. "Ça charge", "ça répond à un prompt court" et "c'est confortable en session longue" sont trois états différents.

Profil8K32K64K
Qwen3.8-27B, F16 K/V16 626 MiB18 186 MiB20 266 MiB, passe, 4 298 MiB libres
Qwen3.6-27B, F16 K/V16 626 MiB18 186 MiB20 266 MiB, passe
Gemma 4 31B-it, F16 K/V19 962 MiB21 906 MiBOOM CUDA
Gemma 4 31B-it, K/V Q8_0non mesurénon requis21 956 MiB, passe

À 64K, les deux Qwen passent avec un cache F16 et 4,20 GiB libres. Le cache F16 de Gemma échoue à l'allocation ; en passant son cache K/V en Q8_0, Gemma tient le 64K (21 956 MiB) mais avec seulement 2,55 GiB libres. Un environnement de bureau, un projecteur vision, une slot parallèle ou une sortie longue peuvent consommer cette marge rapidement.

Vitesse : débit et latence mesurés

Qwen3.8 et Qwen3.6 sont au coude à coude sur toutes les mesures de vitesse. Gemma est à égalité sur les prompts courts puis décroche à mesure que le contexte grandit, avec un décode environ 8,3% plus lent.

MesureQwen3.8-27BQwen3.6-27BGemma 4 31B-it
Prompt 512 tokens3 001 tok/s2 980 tok/s2 975 tok/s
Prompt 8 192 tokens2 844 tok/s2 840 tok/s2 682 tok/s
Prompt 32 768 tokens2 554 tok/s2 555 tok/s2 235 tok/s
Décode 256 tokens49,09 tok/s49,04 tok/s45,00 tok/s
TTFT à chaud (512)0,107 s0,108 s0,421 s

La latence avant premier token est le vrai écart : 0,107 s pour Qwen3.8 contre 0,421 s pour Gemma sur un prompt de 512 tokens. Pour une interface utilisateur, cette différence se ressent immédiatement. Avant d'acheter une carte, estimez votre besoin VRAM avec le simulateur VRAM.

La décode spéculative (MTP) vaut-elle le coup ?

Le mode MTP (multi-token prediction) accélère la génération, au prix de la VRAM et d'un comportement potentiellement différent. Sur 15 prompts pratiques :

  • Qwen3.8 : 1,64× plus rapide en bout en bout, 1,66× sur le décode, +1 032 MiB de VRAM. Les sorties avec et sans MTP n'étaient identiques dans aucune paire (0/15).
  • Gemma : 1,52× en bout en bout, 1,67× sur le décode, +574 MiB, drafter de 0,479 GiB. Sorties identiques dans 1/15 paires.

MTP est un compromis volontaire entre vitesse et comportement, pas un interrupteur transparent. Gardez-le désactivé si la reproductibilité des sorties est une exigence, activé si le débit prime.

TL;DR

Pour un déploiement local sur GPU 24 Go en 2026 : Qwen3.8-27B est le meilleur choix par défaut (codage, raisonnement, questions documentaires, mêmes performances que Qwen3.6). Gemma 4 31B-it l'emporte sur les appels d'outils stricts et la vision, au prix d'une VRAM plus élevée et d'une latence de premier token environ 4 fois plus lente. Qwen3.6-27B ne se justifie que pour une intégration existante.

Le contexte stable maximum mesuré est 64K (pas les 262K annoncés) et la marge VRAM à 64K reste fine : planifiez vos sessions et votre décode spéculative avec le simulateur VRAM.

Un modèle open weight sur votre GPU, c'est de l'IA souveraine conforme à vos contraintes RGPD, sans dépendance aux tarifs d'API. En tant que freelance IA, j'accompagne les PME et startups sur ces architectures : intégration RAG, choix de modèle et dimensionnement GPU. Pour passer en production, lisez aussi le guide LLM local et RGPD.

Vous hésitez entre un LLM local et une API cloud pour vos données sensibles ? Parlons-en.

À propos de l'auteur

Pierre Kasparian

Étudiant ingénieur en fin de cursus à l'UTT (Université de Technologie de Troyes) et freelance en intégration IA. Il déploie des LLM, pipelines RAG et agents IA pour des PME françaises et européennes, avec une attention sur le RGPD et hébergement européen. 11+ réalisations clients, dont Pretto et LiveSession.