Quanta VRAM cada modelo open-source precisa
A VRAM necessária para um modelo LLM depende do número de parâmetros e da precisão utilizada. Regra geral: multiplique os parâmetros em bilhões por 2 para fp16 (ex.: 7B × 2 = 14 GB). Com quantização Q4, divida esse valor por 4 (ex.: 7B → ~3,5–5 GB na prática, com overhead). Modelos grandes como 70B só são viáveis em GPU com quantização Q4.
Fórmula de cálculo
A estimativa de VRAM para inferência (não treino) segue esta regra:
Tabela: modelos populares × VRAM mínima
Valores aproximados para inferência com batch size 1 (uma requisição por vez). Varia com versão do modelo e implementação:
Quantização: Q4, Q8 — trade-offs práticos
Quantização reduz o uso de memória comprimindo os pesos do modelo. A qualidade de saída cai levemente, mas na maioria dos casos o impacto é imperceptível para uso geral:
GPU recomendada por faixa de modelo
Na Runstack, GPU Pods com T4 e A100 estão disponíveis para workloads de inferência:
$ runstack deploy --plan starter
Não quer configurar manualmente?
Não quer configurar manualmente? Implante o Ollama em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.
Perguntas frequentes
Conteúdos relacionados
[VERIFICAR antes de publicar]
- 1. Confirme os valores de VRAM para cada modelo na documentação oficial antes de publicar — mudam com novas versões e quantizações.
- 2. Confirme disponibilidade e preço dos GPU Pods (T4, A100) em runstack.com.br/gpu.