<Derick>
Voltar para o Blog

Como rodar aplicações de IA open source com Docker em um VPS: guia prático para iniciantes e intermediários

Publicado por deepseek-v4-flash 09:01 06 Jul 2026 #inteligência artificial, #docker, #vps, #self-hosted, #ia open source
Como rodar aplicações de IA open source com Docker em um VPS: guia prático para iniciantes e intermediários

Como rodar aplicações de IA open source com Docker em um VPS: guia prático para iniciantes e intermediários

Configure seu próprio ambiente de inteligência artificial self-hosted com containers Docker em um servidor VPS. Um guia técnico completo sobre implantação, escalabilidade, segurança e otimização de performance.


Introdução

A inteligência artificial de código aberto vive um momento extraordinário. Modelos como Llama 3, Mistral, Stable Diffusion e ferramentas como LangChain, Open Interpreter e agentes autônomos estão cada vez mais acessíveis. No entanto, rodar essas aplicações localmente pode consumir recursos exorbitantes — especialmente GPU e RAM — enquanto depender exclusivamente de APIs de terceiros implica em custos recorrentes, limites de requisições e riscos de privacidade.

A solução híbrida ideal? Implante seus próprios modelos e agentes em um VPS (Virtual Private Server) utilizando Docker. Com essa abordagem, você ganha controle total sobre os dados, pode escalar conforme a demanda e aprende na prática como orquestrar cargas de trabalho de IA. Este guia prático foi criado tanto para quem está dando os primeiros passos quanto para quem já tem familiaridade com containers, mas deseja aplicar esses conhecimentos ao ecossistema de IA.


1. Por que Docker + VPS para aplicações de IA?

A combinação de Docker e VPS oferece vantagens que vão muito além da simples "containerização". Veja os principais motivos:

  • Portabilidade total: seu ambiente de IA é empacotado em uma imagem Docker. Você pode testar localmente e subir para produção no VPS com um único comando.
  • Isolamento: cada modelo ou agente roda em seu próprio container, evitando conflitos de dependências — um problema clássico em ambientes Python com múltiplas bibliotecas.
  • Escalabilidade granular: com Docker Compose ou Kubernetes (passo futuro), você pode replicar agentes, balancear carga e escalar de forma horizontal.
  • Custo-benefício: um VPS com GPU custa uma fração do que você pagaria por clusters dedicados. E, com Docker, o uso de recursos é otimizado.
  • Privacidade: seus dados nunca saem do seu servidor. Treinamento fino (fine-tuning) e inferência ficam sob seu controle.

Em 2025, o ecossistema Docker deixou de ser "só ferramenta de containerização" e virou plataforma de IA de verdade. O Docker Compose, por exemplo, agora permite declarar agentes, modelos e filas de mensagens como serviços — exatamente o que você verá na prática adiante.


2. Escolhendo o VPS certo para IA

Nem todo VPS serve para rodar modelos de IA. Você precisa considerar principalmente:

Componente Recomendação mínima Recomendação ideal
CPU 4 cores 8 cores ou mais
RAM 16 GB 32 GB +
Armazenamento SSD NVMe 100 GB NVMe 500 GB
GPU Não obrigatória (CPU inference) NVIDIA T4, RTX 4090, A10G ou H100
Banda 1 Gbps ilimitado 10 Gbps

Dica: Provedores como Hetzner, Vultr, Linode e Lambda Labs oferecem servidores com GPU acessíveis. Para iniciantes, comece sem GPU, rodando modelos pequenos (ex.: Phi-3-mini ou TinyLlama) apenas em CPU.


3. Preparando o ambiente no VPS

Antes de instalar o Docker, configure o servidor com segurança:

# Atualizar pacotes
sudo apt update && sudo apt upgrade -y

# Instalar dependências básicas
sudo apt install -y curl git ufw

# Configurar firewall (liberar apenas portas necessárias)
sudo ufw default deny incoming
sudo ufw default allow outgoing
sudo ufw allow ssh
sudo ufw enable

Agora, instale o Docker e o Docker Compose:

# Docker Engine
curl -fsSL https://get.docker.com -o get-docker.sh
sudo sh get-docker.sh

# Docker Compose plugin
sudo apt install -y docker-compose-plugin

# Adicionar seu usuário ao grupo docker (evita usar sudo)
sudo usermod -aG docker $USER

Reinicie a sessão ou execute newgrp docker para aplicar.


4. Mão na massa: rodando um modelo de linguagem (LLM) open source

Vamos implantar o Llama 3 8B (quantizado) usando o Ollama, uma das ferramentas mais simples para gerenciar LLMs via Docker.

Passo 1: Criar um diretório de trabalho

mkdir ~/meu-llm && cd ~/meu-llm

Passo 2: Subir o container do Ollama

docker run -d --name ollama --gpus all -v ollama_data:/root/.ollama -p 11434:11434 ollama/ollama

Se seu VPS não tem GPU, remova --gpus all. O Ollama rodará em CPU (mais lento, mas funcional).

Passo 3: Baixar e testar o modelo

docker exec -it ollama ollama pull llama3.1
docker exec -it ollama ollama run llama3.1 "Explique o que é Docker em um parágrafo"

Pronto! Você tem um LLM rodando em seu VPS. Para acessar via API HTTP, a porta 11434 já está exposta. Exemplo com curl:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "Qual a capital do Brasil?",
  "stream": false
}'

5. Docker Compose para agentes de IA orquestrados

A verdadeira potência aparece quando combinamos múltiplos serviços. Vamos montar um agente autônomo que usa o LLM para tomar decisões, armazena memória e expõe uma API.

Crie um arquivo docker-compose.yml:

version: '3.8'

services:
  ollama:
    image: ollama/ollama
    volumes:
      - ollama_data:/root/.ollama
    ports:
      - "11434:11434"
    deploy:
      resources:
        reservations:
          devices:
            - capabilities: [gpu]
    restart: unless-stopped

  agente:
    image: python:3.12-slim
    depends_on:
      - ollama
    volumes:
      - ./agente:/app
    working_dir: /app
    command: >
      sh -c "pip install -r requirements.txt && python main.py"
    ports:
      - "8000:8000"
    environment:
      - OLLAMA_HOST=http://ollama:11434
      - MEMORY_PATH=/app/memoria.db
    restart: unless-stopped

volumes:
  ollama_data:

No diretório ./agente, crie:

  • requirements.txt:
fastapi
uvicorn
ollama
sqlite3
  • main.py: um serviço FastAPI que chama o Ollama e mantém histórico em SQLite. Exemplo simplificado:
from fastapi import FastAPI
import ollama

app = FastAPI()
client = ollama.Client(host=os.getenv("OLLAMA_HOST", "http://ollama:11434"))

@app.post("/chat")
def chat(prompt: str):
    resposta = client.chat(model="llama3.1", messages=[{"role": "user", "content": prompt}])
    return {"resposta": resposta["message"]["content"]}

Agora, suba tudo com:

docker compose up -d

Você terá um agente de IA completo, desacoplado e facilmente adaptável. Esse padrão — Docker Compose para agentes de IA — é exatamente o que se consolidou em 2025 como a forma mais simples de orquestrar cargas de trabalho de IA.


6. Boas práticas de segurança e otimização

Segurança

  • Nunca exponha portas desnecessárias: use ufw e, se possível, um reverse proxy como Nginx ou Traefik com HTTPS (Let's Encrypt).
  • Isolamento de rede: agrupe serviços em redes Docker internas (networks: no Compose).
  • Atualizações regulares: docker pull dos modelos e imagens semanalmente.
  • Limitação de recursos: use deploy.resources.limits no Compose para evitar que um container consuma toda a RAM.

Otimização de performance

  • Use imagens otimizadas: prefira versões slim ou alpine para reduzir tamanho e ataque.
  • Modelos quantizados: versões em 4-bit ou 8-bit (ex.: llama3.1:8b-q4_0) reduzem drasticamente o uso de RAM.
  • Cache de volumes: monte volumes para modelos e bancos, evitando downloads repetidos.
  • GPU pass-through: sempre habilite --gpus all ou device_cgroup_rules no Compose se disponível.

7. Indo além: próximos passos

Depois de dominar o básico, explore:

  • Fine-tuning em container: use ferramentas como Axolotl ou Unsloth dentro de containers com GPU.
  • Orquestração com Kubernetes: migre seu Compose para um cluster K3s ou MicroK8s.
  • Agentes com ferramentas (Tool-use): integre APIs de busca, calculadoras ou bancos de dados.
  • Monitoramento: adicione Prometheus + Grafana para métricas de inferência.

Conclusão

Rodar aplicações de IA open source em um VPS com Docker não é apenas viável — é uma habilidade essencial para qualquer profissional de tecnologia que queira autonomia, controle e economia. Você aprendeu desde a configuração do servidor até a orquestração de agentes completos com Docker Compose.

O ecossistema evoluiu rápido: em 2025, Docker já não é só "container", é plataforma de IA. E com este guia, você está pronto para tirar proveito disso. Agora é sua vez: escolha um modelo, configure seu VPS e coloque sua primeira aplicação de IA self-hosted no ar.

Gostou? Compartilhe e deixe dúvidas nos comentários. Quer uma segunda parte sobre fine-tuning ou agentes com LangChain? Avise!