Faire tourner un LLM en local (Ollama, LM Studio) dépend presque entièrement de la VRAM.
La RTX 3090 24 Go (souvent d'occasion) fait tourner des modèles jusqu'à ~32B. Pour aller plus loin, la RTX 5090 32 Go.
Ollama et la plupart des back-ends sont optimisés CUDA.
Les formats quantifiés (Q4, Q5...) réduisent fortement la VRAM nécessaire avec une perte de qualité minime. C'est ce qui permet de faire tourner un 32B sur 24 Go.

→ Aide-toi du quiz ou compare sur toutes les cartes.
🍪 On utilise des cookies pour mesurer l'audience et améliorer le site.