IA / LLMs/Artigo

    Quanta VRAM cada modelo open-source precisa

    A VRAM necessária para um modelo LLM depende do número de parâmetros e da precisão utilizada. Regra geral: multiplique os parâmetros em bilhões por 2 para fp16 (ex.: 7B × 2 = 14 GB). Com quantização Q4, divida esse valor por 4 (ex.: 7B → ~3,5–5 GB na prática, com overhead). Modelos grandes como 70B só são viáveis em GPU com quantização Q4.

    Fórmula de cálculo

    A estimativa de VRAM para inferência (não treino) segue esta regra:

    Dica
    fp16 (half precision): parâmetros × 2 bytes. Ex: 7B → ~14 GB. int8 / Q8: parâmetros × 1 byte. Ex: 7B → ~7 GB. Q4 (4-bit quant): parâmetros × 0,5 bytes + overhead (~20%). Ex: 7B → ~4–5 GB. Some ainda ~1–2 GB para o contexto de ativação (KV cache). Para contextos grandes (32K+), o KV cache pode dobrar o uso de memória.

    Tabela: modelos populares × VRAM mínima

    Valores aproximados para inferência com batch size 1 (uma requisição por vez). Varia com versão do modelo e implementação:

    Dica
    [VERIFICAR: confirme os valores na documentação oficial de cada modelo antes de provisionar GPU.] Llama 3.2 3B — fp16: 6 GB | Q8: 3 GB | Q4: 2 GB Mistral 7B / Llama 3.1 8B — fp16: 14–16 GB | Q8: 7–8 GB | Q4: 4–5 GB Gemma 2 9B — fp16: 18 GB | Q8: 9 GB | Q4: 5–6 GB Llama 3.1 70B — fp16: 140 GB | Q8: 70 GB | Q4: 38–42 GB Qwen 2.5 72B — fp16: 144 GB | Q8: 72 GB | Q4: 40–44 GB Llama 3.1 405B — fp16: 810 GB | Q4: ~230 GB (múltiplas GPU)
    Atenção
    Esses valores são para inferência estática. Para fine-tuning (treino), o uso de VRAM é 3–4× maior (gradientes + estados do otimizador). Fine-tuning do Llama 3 8B requer ao menos 24 GB VRAM.

    Quantização: Q4, Q8 — trade-offs práticos

    Quantização reduz o uso de memória comprimindo os pesos do modelo. A qualidade de saída cai levemente, mas na maioria dos casos o impacto é imperceptível para uso geral:

    Dica
    Q8 (int8): perda de qualidade mínima (~0,5–1% em benchmarks), recomendado quando a VRAM permite. Q4 (4-bit): perda perceptível em tarefas de raciocínio complexo, mas excelente para chatbots, sumarização e extração de informações. Q4_K_M (Ollama padrão): versão otimizada do Q4 com menos perda — use esta em vez do Q4 puro.

    GPU recomendada por faixa de modelo

    Na Runstack, GPU Pods com T4 e A100 estão disponíveis para workloads de inferência:

    Dica
    Modelos até 8B (Q4): CPU com 8 GB RAM (lento) ou GPU T4 16GB (confortável). Modelos 13–20B (Q4): GPU T4 16GB no limite, A100 40GB com folga. Modelos 70B (Q4): GPU A100 80GB — ideal para uso com 38–42 GB. Modelos 405B (Q4): múltiplas GPU A100 ou H100 — não disponível em VPS convencional.

    $ runstack deploy --plan starter

    Não quer configurar manualmente?

    Não quer configurar manualmente? Implante o Ollama em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.

    Perguntas frequentes

    Conteúdos relacionados

    [VERIFICAR antes de publicar]

    • 1. Confirme os valores de VRAM para cada modelo na documentação oficial antes de publicar — mudam com novas versões e quantizações.
    • 2. Confirme disponibilidade e preço dos GPU Pods (T4, A100) em runstack.com.br/gpu.