Accueil / Guides / Quelle carte pour un LLM en local ?

Quelle carte pour un LLM en local ?

⚡ Ce qu'il faut retenir
  • La VRAM décide tout : 16 Go = ~13-14B, 24 Go = ~32B, 32 Go = gros modèles.
  • Meilleur rapport VRAM/prix : RTX 3090 24 Go (souvent d'occasion).
  • NVIDIA / CUDA quasi obligatoire (Ollama, LM Studio).
  • La quantification permet de faire entrer de plus gros modèles.

Faire tourner un LLM en local (Ollama, LM Studio) dépend presque entièrement de la VRAM.

VRAM par taille de modèle

  • 7-8B quantifié : 8-12 Go
  • 13-14B : 16 Go
  • 32B quantifié : 24 Go
  • 70B quantifié : 32 Go+

Meilleur rapport VRAM/prix

La RTX 3090 24 Go (souvent d'occasion) fait tourner des modèles jusqu'à ~32B. Pour aller plus loin, la RTX 5090 32 Go.

NVIDIA / CUDA quasi obligatoire

Ollama et la plupart des back-ends sont optimisés CUDA.

La quantification, ton alliée

Les formats quantifiés (Q4, Q5...) réduisent fortement la VRAM nécessaire avec une perte de qualité minime. C'est ce qui permet de faire tourner un 32B sur 24 Go.

ASUS TUF RTX 3090 24G
Notre reco pour ce besoin
ASUS TUF RTX 3090 24G
24 Go · 9,0/10 · 1979,99 €

Questions fréquentes

Quelle carte pour Llama 70B ?
32 Go (RTX 5090) en quantifié, ou multi-GPU.
16 Go pour débuter ?
Oui, modèles jusqu'à ~13-14B quantifiés.
AMD pour les LLM ?
Possible via ROCm/Vulkan, NVIDIA plus simple.

→ Aide-toi du quiz ou compare sur toutes les cartes.