$ runstack deploy --now
Como rodar modelos de IA locais (Ollama) em VPS no Brasil?
O Ollama permite rodar LLMs como Llama 3, Mistral e Gemma localmente em um servidor, sem depender de APIs externas. Em uma VPS Runstack no Brasil (datacenter SP01 da OPEN DATACENTER), você tem latência abaixo de 15ms, sem limite de tokens, sem custo por chamada e dados que não saem do país.
O problema
APIs de LLM (OpenAI, Anthropic) cobram por token, têm limites de rate e enviam seus prompts para servidores nos EUA. Para aplicações internas, dados sensíveis ou uso intenso, o custo fica inviável e a latência prejudica a UX.
Como a Runstack resolve
Com Ollama em VPS Pro Runstack, você instala e roda modelos quantizados (GGUF) localmente. Llama 3.2 8B roda confortavelmente em 4 GB de RAM. A API REST do Ollama é compatível com o formato OpenAI, sem trocar o cliente.
# 1. Instale o Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Habilite o serviço
systemctl enable --now ollama
# 2. Baixe modelos (escolha conforme sua RAM)
ollama pull llama3.2 # 8B · ~4.7 GB
ollama pull mistral # 7B · ~4.1 GB
ollama pull gemma2:2b # 2B · ~1.6 GB (ideal para Micro/Basic)
ollama pull phi3:mini # 3.8B · ~2.3 GB
# 3. Teste via curl (API compatível com OpenAI)
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.2",
"messages": [{"role":"user","content":"Olá, tudo bem?"}]
}'
# 4. Exponha com autenticação (Caddy + basic auth)
# ou use a interface Open WebUI (ver vps-para-open-webui)Planos recomendados
Comparativo rápido
| Aspecto | Runstack + Ollama | OpenAI API | Contabo + Ollama |
|---|---|---|---|
| Custo | R$ 144/mês fixo | USD por token (variável) | ~€5–10/mês (EUR) |
| Dados no Brasil | ✓ SP01, São Paulo | ✗ EUA (OpenAI) | ✗ Alemanha (DE) |
| Sem limite de uso | ✓ | ✗ rate limits | ✓ |
| API OpenAI-compat. | ✓ nativa (Ollama) | ✓ | ✓ |
| Latência (de SP) | < 15 ms | ~80–200 ms | ~200 ms |
| Suporte PT-BR | ✓ | ✗ | ✗ |
Perguntas frequentes
$ runstack deploy --plan starter
Não quer configurar manualmente?
Implante em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.