IA / LLMs/Artigo

    CPU vs GPU para inferência de IA

    GPU é 10 a 100× mais rápida que CPU para inferência de LLMs — mas a vantagem só é prática para modelos grandes (7B+) ou quando a latência importa. Para modelos pequenos (até 3B), embeddings, ou uso esporádico com tempo de resposta de segundos sendo aceitável, uma VPS com CPU é muito mais barata e suficiente.

    Por que GPU é mais rápida para LLMs

    Modelos de linguagem fazem operações de multiplicação de matrizes massivas em paralelo. GPUs têm milhares de núcleos otimizados para esse tipo de computação (ex.: A100 tem 6.912 núcleos CUDA). CPUs têm 4–128 núcleos de propósito geral — muito melhores em tarefas sequenciais, muito piores em paralelismo denso de álgebra linear.

    Dica
    A velocidade de inferência depende também da largura de banda de memória — GPUs têm 2–10× mais bandwidth de memória que CPUs, o que importa muito para carregar os pesos do modelo durante a geração.

    Benchmarks práticos: tokens/segundo CPU vs GPU

    Velocidades aproximadas para o Llama 3.1 8B em quantização Q4, com uma requisição simultânea:

    Dica
    [VERIFICAR: benchmarks variam com versão do Ollama, driver CUDA e temperatura do hardware] VPS Pro (2 vCPU, 4 GB RAM): ~1–3 tokens/seg VPS Business (3 vCPU, 8 GB RAM): ~2–5 tokens/seg GPU T4 16GB (GPU Pod): ~35–55 tokens/seg GPU A100 80GB (GPU Pod): ~80–120 tokens/seg Para uma resposta de 300 tokens: CPU leva 60–300 segundos; GPU T4 leva 5–8 segundos.

    Quando CPU é suficiente

    CPU resolve bem os seguintes casos:

    Dica
    Modelos até 3B params (ex.: Llama 3.2 3B, Phi-3 Mini): velocidade aceitável para chatbots simples. Embeddings: gerar vetores é muito mais rápido que geração de texto — modelos de embedding rodam em CPU sem problemas. Tarefas batch offline: sumarização de documentos, extração de entidades sem tempo real. Desenvolvimento e testes: baixo custo, sem dependência de GPU.

    Quando GPU é necessário

    Invista em GPU quando:

    Dica
    Modelos 7B+: velocidade em CPU é impraticável para uso interativo em tempo real. Múltiplos usuários simultâneos: GPU processa requests em paralelo; CPU enfileira. Fine-tuning e treino: obrigatório — CPU leva dias no que GPU faz em horas. RAG com latência baixa: cada chamada ao LLM precisa retornar em < 5 segundos.

    Custo comparado: VPS CPU vs GPU Pod na Runstack

    O modelo de cobrança é diferente — GPU Pod é por hora, VPS é mensal:

    Dica
    VPS Pro (CPU): R$ 144/mês — servidor sempre ligado, ideal para produção contínua com modelos pequenos. GPU Pod T4: cobrança por hora — ideal para treino ou inferência pesada em lotes, não para servidor sempre ligado. Para um chatbot com Llama 3.2 3B em produção com tráfego baixo (< 50 usuários/dia), VPS CPU é mais econômico. Para múltiplos usuários com modelos 7B+, GPU Pod vale o custo.

    $ runstack deploy --plan starter

    Não quer configurar manualmente?

    Não quer configurar manualmente? Implante o Ollama em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.

    Perguntas frequentes

    Conteúdos relacionados

    [VERIFICAR antes de publicar]

    • 1. Confirme os benchmarks de tokens/seg para a versão atual do Ollama — melhoram a cada release.
    • 2. Confirme preços e disponibilidade dos GPU Pods (T4, A100) em runstack.com.br/gpu.