$ runstack deploy --now

    Como rodar modelos de IA locais (Ollama) em VPS no Brasil?

    O Ollama permite rodar LLMs como Llama 3, Mistral e Gemma localmente em um servidor, sem depender de APIs externas. Em uma VPS Runstack no Brasil (datacenter SP01 da OPEN DATACENTER), você tem latência abaixo de 15ms, sem limite de tokens, sem custo por chamada e dados que não saem do país.

    O problema

    APIs de LLM (OpenAI, Anthropic) cobram por token, têm limites de rate e enviam seus prompts para servidores nos EUA. Para aplicações internas, dados sensíveis ou uso intenso, o custo fica inviável e a latência prejudica a UX.

    Como a Runstack resolve

    Com Ollama em VPS Pro Runstack, você instala e roda modelos quantizados (GGUF) localmente. Llama 3.2 8B roda confortavelmente em 4 GB de RAM. A API REST do Ollama é compatível com o formato OpenAI, sem trocar o cliente.

    terminal
    # 1. Instale o Ollama
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Habilite o serviço
    systemctl enable --now ollama
    
    # 2. Baixe modelos (escolha conforme sua RAM)
    ollama pull llama3.2          # 8B · ~4.7 GB
    ollama pull mistral           # 7B · ~4.1 GB
    ollama pull gemma2:2b         # 2B · ~1.6 GB (ideal para Micro/Basic)
    ollama pull phi3:mini         # 3.8B · ~2.3 GB
    
    # 3. Teste via curl (API compatível com OpenAI)
    curl http://localhost:11434/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "llama3.2",
        "messages": [{"role":"user","content":"Olá, tudo bem?"}]
      }'
    
    # 4. Exponha com autenticação (Caddy + basic auth)
    # ou use a interface Open WebUI (ver vps-para-open-webui)

    Planos recomendados

    Micro
    1 vCPU2 GB10 GB NVMe

    R$ 59/mês

    Selecionar
    Basic
    1 vCPU2 GB20 GB NVMe

    R$ 87/mês

    Selecionar
    Pro
    2 vCPU4 GB40 GB NVMe

    R$ 144/mês

    Selecionar

    Comparativo rápido

    AspectoRunstack + OllamaOpenAI APIContabo + Ollama
    CustoR$ 144/mês fixoUSD por token (variável)~€5–10/mês (EUR)
    Dados no Brasil✓ SP01, São Paulo✗ EUA (OpenAI)✗ Alemanha (DE)
    Sem limite de uso✗ rate limits
    API OpenAI-compat.✓ nativa (Ollama)
    Latência (de SP)< 15 ms~80–200 ms~200 ms
    Suporte PT-BR

    Perguntas frequentes

    $ runstack deploy --plan starter

    Não quer configurar manualmente?

    Implante em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.