IA / LLMs/Artigo

    Como rodar o Llama 3 numa VPS

    Para rodar o Llama 3 numa VPS, instale o Ollama com um curl e baixe o modelo com ollama pull — são dois comandos e o modelo já fica servindo via API. O Llama 3 8B roda em CPU com 8 GB de RAM (lento, ~2–4 tokens/seg) ou em GPU T4 com velocidade confortável (~40 tokens/seg). Para o Llama 3 70B, GPU com pelo menos 40 GB VRAM é necessário.

    Requisitos mínimos por versão e hardware

    O Llama 3 existe em dois tamanhos principais (8B e 70B) e roda em CPU ou GPU. Em CPU, a versão quantizada Q4 é a única prática:

    Dica
    Llama 3 8B em CPU (Q4): 8 GB RAM, ~2–4 tokens/seg em 4 vCPU. Llama 3 8B em GPU T4 16GB: ~35–50 tokens/seg. Llama 3 70B em CPU: não prático (> 40 GB RAM, < 1 token/seg). Llama 3 70B em GPU A100 80GB: ~20–30 tokens/seg. [VERIFICAR: benchmarks específicos variam por hardware e versão do Ollama]

    Instalar o Ollama (1 comando)

    O Ollama é a forma mais simples de servir o Llama 3 — inclui download automático de modelos, servidor HTTP e compatibilidade com a API da OpenAI:

    bash
    # Instalar o Ollama no Linux (Ubuntu/Debian)
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Verificar a instalação
    ollama --version
    
    # O serviço sobe automaticamente em http://localhost:11434
    Dica
    O script detecta automaticamente se há GPU NVIDIA disponível e instala os drivers CUDA necessários. Em VPS sem GPU, instala apenas a versão CPU.

    Baixar e rodar o Llama 3

    Com o Ollama instalado, baixe o modelo e teste a geração de texto:

    bash
    # Baixar o Llama 3.2 3B (mais rápido, cabe em 2 GB RAM)
    ollama pull llama3.2:3b
    
    # Ou o Llama 3.1 8B (melhor qualidade, precisa de 8 GB RAM)
    ollama pull llama3.1:8b
    
    # Testar via CLI
    ollama run llama3.2:3b "O que é computação em nuvem?"
    
    # Testar via API HTTP
    curl http://localhost:11434/api/generate \
      -d '{"model": "llama3.2:3b", "prompt": "O que é computação em nuvem?", "stream": false}'
    Dica
    A primeira execução baixa o modelo (pode demorar conforme a internet). Os downloads subsequentes usam o cache local.

    Expor a API para uso externo (outras máquinas ou aplicações)

    Por padrão, o Ollama só escuta em localhost. Para expor para outras aplicações ou serviços na mesma rede Docker:

    bash
    # Via variável de ambiente (antes de iniciar o serviço)
    OLLAMA_HOST=0.0.0.0 ollama serve
    
    # Ou configure no systemd (para inicialização automática)
    sudo systemctl edit ollama.service
    # Adicione dentro de [Service]:
    # Environment="OLLAMA_HOST=0.0.0.0"
    
    sudo systemctl daemon-reload
    sudo systemctl restart ollama
    Atenção
    Expor 0.0.0.0 sem autenticação torna a API pública. Configure um reverse proxy NGINX com autenticação básica ou restrinja por IP no firewall se a VPS for acessível pela internet.

    Integrar com aplicações via API compatível com OpenAI

    O Ollama expõe endpoints compatíveis com a API da OpenAI, permitindo substituição sem alterar o código:

    bash
    # Usando openai-python apontando para o Ollama local
    from openai import OpenAI
    
    client = OpenAI(
        base_url="http://localhost:11434/v1",
        api_key="ollama",  # obrigatório mas ignorado pelo Ollama
    )
    
    response = client.chat.completions.create(
        model="llama3.2:3b",
        messages=[{"role": "user", "content": "Explique Docker em 2 linhas."}],
    )
    print(response.choices[0].message.content)
    Dica
    Troque localhost pelo IP da VPS ou pelo nome do serviço Docker se a aplicação estiver em outro container na mesma rede.

    $ runstack deploy --plan starter

    Não quer configurar manualmente?

    Não quer configurar manualmente? Implante o Ollama em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.

    Perguntas frequentes

    Conteúdos relacionados

    [VERIFICAR antes de publicar]

    • 1. Confirme os nomes dos modelos Llama 3 no Ollama em ollama.com/library — tags mudam com novos releases.
    • 2. Verifique benchmarks de tokens/seg atualizados para a versão do Ollama instalada.