Como rodar o Llama 3 numa VPS
Para rodar o Llama 3 numa VPS, instale o Ollama com um curl e baixe o modelo com ollama pull — são dois comandos e o modelo já fica servindo via API. O Llama 3 8B roda em CPU com 8 GB de RAM (lento, ~2–4 tokens/seg) ou em GPU T4 com velocidade confortável (~40 tokens/seg). Para o Llama 3 70B, GPU com pelo menos 40 GB VRAM é necessário.
Requisitos mínimos por versão e hardware
O Llama 3 existe em dois tamanhos principais (8B e 70B) e roda em CPU ou GPU. Em CPU, a versão quantizada Q4 é a única prática:
Instalar o Ollama (1 comando)
O Ollama é a forma mais simples de servir o Llama 3 — inclui download automático de modelos, servidor HTTP e compatibilidade com a API da OpenAI:
# Instalar o Ollama no Linux (Ubuntu/Debian)
curl -fsSL https://ollama.com/install.sh | sh
# Verificar a instalação
ollama --version
# O serviço sobe automaticamente em http://localhost:11434Baixar e rodar o Llama 3
Com o Ollama instalado, baixe o modelo e teste a geração de texto:
# Baixar o Llama 3.2 3B (mais rápido, cabe em 2 GB RAM)
ollama pull llama3.2:3b
# Ou o Llama 3.1 8B (melhor qualidade, precisa de 8 GB RAM)
ollama pull llama3.1:8b
# Testar via CLI
ollama run llama3.2:3b "O que é computação em nuvem?"
# Testar via API HTTP
curl http://localhost:11434/api/generate \
-d '{"model": "llama3.2:3b", "prompt": "O que é computação em nuvem?", "stream": false}'Expor a API para uso externo (outras máquinas ou aplicações)
Por padrão, o Ollama só escuta em localhost. Para expor para outras aplicações ou serviços na mesma rede Docker:
# Via variável de ambiente (antes de iniciar o serviço)
OLLAMA_HOST=0.0.0.0 ollama serve
# Ou configure no systemd (para inicialização automática)
sudo systemctl edit ollama.service
# Adicione dentro de [Service]:
# Environment="OLLAMA_HOST=0.0.0.0"
sudo systemctl daemon-reload
sudo systemctl restart ollamaIntegrar com aplicações via API compatível com OpenAI
O Ollama expõe endpoints compatíveis com a API da OpenAI, permitindo substituição sem alterar o código:
# Usando openai-python apontando para o Ollama local
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # obrigatório mas ignorado pelo Ollama
)
response = client.chat.completions.create(
model="llama3.2:3b",
messages=[{"role": "user", "content": "Explique Docker em 2 linhas."}],
)
print(response.choices[0].message.content)$ runstack deploy --plan starter
Não quer configurar manualmente?
Não quer configurar manualmente? Implante o Ollama em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.
Perguntas frequentes
Conteúdos relacionados
[VERIFICAR antes de publicar]
- 1. Confirme os nomes dos modelos Llama 3 no Ollama em ollama.com/library — tags mudam com novos releases.
- 2. Verifique benchmarks de tokens/seg atualizados para a versão do Ollama instalada.