IA / LLMs/Artigo

    Rodar IA self-hosted sem depender da OpenAI

    Rodar IA self-hosted significa usar modelos open-source (Llama, Mistral, Gemma, Qwen) em VPS própria em vez de pagar por token para OpenAI ou Anthropic. O Ollama é compatível com a API da OpenAI — você troca a base_url e o nome do modelo, sem alterar o restante do código. O custo fixo de uma VPS substitui o custo variável por token, vantajoso para volumes altos ou dados que precisam ficar no Brasil.

    Por que ir self-hosted

    Três razões principais justificam a migração de APIs externas para LLMs self-hosted:

    Dica
    Custo: com mais de ~500.000 tokens/mês, o self-hosted costuma ser mais barato que GPT-4o ou Claude. O break-even depende do modelo e do plano de VPS. Privacidade/LGPD: dados de usuários nunca saem da sua infraestrutura — necessário em saúde, jurídico e finanças. Latência e disponibilidade: sem dependência de API de terceiros, SLA controlado internamente.
    Atenção
    Self-hosted exige gerenciar a infraestrutura: atualizações, monitoring, escalabilidade. Para volumes baixos e dados não sensíveis, APIs externas podem ser mais simples.

    Modelos open-source mais usados em 2026

    O ecossistema open-source evoluiu muito — hoje há modelos competitivos com GPT-4 em várias tarefas:

    Dica
    [VERIFICAR: comparar com benchmarks atuais em lmsys.org/chat antes de publicar] Llama 3.1 8B (Meta): excelente custo-benefício, function calling nativo, bom em PT-BR. Mistral 7B / Mixtral 8x7B (Mistral AI): forte em raciocínio e código. Gemma 2 9B (Google): boa performance em tasks de instrução, roda em CPU. Qwen 2.5 7B/72B (Alibaba): destaque em código e multilingual, incluindo PT-BR. Phi-3.5 Mini (Microsoft): modelo pequeno com performance surpreendente.

    Substituição drop-in da API da OpenAI com Ollama

    O Ollama expõe /v1/chat/completions e /v1/embeddings com a mesma interface da OpenAI. A migração é de 2 linhas:

    bash
    # Antes (OpenAI)
    from openai import OpenAI
    client = OpenAI(api_key="sk-...")
    
    # Depois (Ollama self-hosted) — mesma biblioteca, base_url diferente
    from openai import OpenAI
    client = OpenAI(
        base_url="http://localhost:11434/v1",
        api_key="ollama",  # qualquer string funciona
    )
    
    # O restante do código não muda:
    response = client.chat.completions.create(
        model="llama3.1:8b",  # ← único campo que muda
        messages=[{"role": "user", "content": "Olá!"}],
    )
    Dica
    Frameworks como LangChain e LlamaIndex têm integração nativa com Ollama — basta trocar o provider de ChatOpenAI para ChatOllama.

    Quando ainda faz sentido usar APIs externas

    Self-hosted não é sempre a escolha certa. APIs externas fazem sentido quando:

    Dica
    Modelos de fronteira: GPT-4o, Claude 3.5 Sonnet e Gemini 1.5 Pro ainda superam os melhores modelos open-source em raciocínio complexo e contextos muito longos (> 128K tokens). Volume muito baixo: se você usa < 50.000 tokens/mês, o custo de VPS não compensa. Time-to-market: uma API externa está pronta em 5 minutos; self-hosted leva algumas horas de setup. Suporte ao idioma: alguns modelos open-source ainda têm qualidade inferior em PT-BR para tasks complexas.

    $ runstack deploy --plan starter

    Não quer configurar manualmente?

    Não quer configurar manualmente? Implante o Ollama em menos de 3 minutos com a Runstack. Infraestrutura da OPEN DATACENTER, com servidores no Brasil.

    Perguntas frequentes

    Conteúdos relacionados

    [VERIFICAR antes de publicar]

    • 1. Confirme preços atuais do GPT-4o em platform.openai.com/pricing — mudam com frequência.
    • 2. Verifique benchmarks atualizados em lmsys.org ou huggingface.co/spaces/lmsys/chatbot-arena-leaderboard.