Instalando o Ollama e baixando o modelo
Um agente precisa de um modelo de linguagem para raciocinar. O curso original usa a API da Hugging Face, na nuvem. Aqui vamos usar o Ollama, que roda o modelo dentro da sua própria máquina.
O que é o Ollama
O Ollama é um programa que faz duas coisas:
- Baixa e guarda modelos de linguagem no seu disco.
- Sobe um servidor local em
http://127.0.0.1:11434que responde a pedidos no mesmo formato da API da OpenAI.
O ponto 2 é o que torna tudo isso simples: como o Ollama fala o "dialeto" da OpenAI, qualquer biblioteca que saiba conversar com a OpenAI — incluindo o smolagents via LiteLLM — conversa com o Ollama sem alteração de código. Você troca o endereço e o nome do modelo, e pronto.
127.0.0.1 é o endereço da sua própria máquina, também chamado de localhost. Um servidor nesse endereço não é acessível pela rede — nem por outro computador do Tribunal. O tráfego não sai da placa de rede.
Passo 1: instalar
- Acesse ollama.com/download e baixe a versão para Windows (
OllamaSetup.exe). - Execute o instalador.
- Clique em Install.
O Ollama instala em %LOCALAPPDATA%\Programs\Ollama, na sua conta de usuário. Não pede senha de administrador.
O que acontece depois da instalação
Aqui está a diferença mais importante em relação ao curso original, e a causa do erro que quase todo mundo encontra:
No Windows, o instalador já deixa o Ollama rodando em segundo plano, e configurado para iniciar junto com o Windows. Você vai ver o ícone de lhama na bandeja do sistema, ao lado do relógio.
No Linux e no macOS não é assim — por isso o curso original manda rodar ollama serve manualmente. No Windows, você não precisa desse comando. O servidor já está no ar.
Se você rodar ollama serve mesmo assim, verá:
Error: listen tcp 127.0.0.1:11434: bind: Only one usage of each socket address (protocol/network address/port) is normally permitted.
Isso não é um defeito. É o Ollama avisando que a porta 11434 já está ocupada — por ele mesmo. Pode ignorar o comando e seguir em frente.
Passo 2: confirmar que o servidor está no ar
curl http://127.0.0.1:11434/api/version
Resposta esperada (o número da versão pode ser outro):
{"version":"0.33.2"}
Se respondeu, o servidor está funcionando e você não precisa fazer mais nada quanto a isso.
Se você quiser ver qual programa está ocupando a porta:
Get-NetTCPConnection -LocalPort 11434 | Select-Object OwningProcess
E descobrir o nome do processo a partir do número que apareceu:
Get-Process -Id 3252
Deve mostrar ollama.
O curso original sugere sudo lsof -i :11434 para essa investigação. sudo e lsof são comandos do Linux — não existem no Windows. Se você tentar, recebe Comando não encontrado. Use os dois comandos PowerShell acima no lugar.
Passo 3: baixar o modelo
ollama pull qwen2:7b
O download tem cerca de 4,4 GB e leva de alguns minutos a bem mais, dependendo da rede. A barra de progresso mostra o andamento.
qwen2:7b é um modelo de 7 bilhões de parâmetros, quantizado, com suporte a tool calling (chamada de Tools) — que é exatamente o recurso de que precisamos na Unidade 1. É a mesma escolha do curso original.
Se a máquina for fraca
Com 8 GB de RAM ou menos, o qwen2:7b vai ficar desconfortavelmente lento. Alternativa:
ollama pull qwen2.5:3b
Ocupa cerca de 2 GB e responde bem mais rápido. Em troca, erra mais ao decidir qual Tool usar — alguns exercícios da Unidade 1 exigirão mais tentativas. Se optar por ele, troque qwen2:7b por qwen2.5:3b em todos os códigos do curso.
Conferir o que foi baixado
ollama list
Saída esperada:
NAME ID SIZE MODIFIED
qwen2:7b dd314f039b9d 4.4 GB 2 minutes ago
Passo 4: conversar com o modelo pelo terminal
Antes de programar qualquer coisa, converse com o modelo diretamente:
ollama run qwen2:7b
O cursor vira >>>. Escreva uma pergunta e pressione Enter:
>>> Explique em duas frases o que é um agente de IA.
A primeira resposta demora mais — o modelo está sendo carregado para a memória. As seguintes vêm mais rápido.
Para sair, digite /bye e pressione Enter.
Se a resposta sair devagar, palavra por palavra, está tudo certo. O modelo está rodando na CPU da sua máquina, não em uma placa de vídeo de servidor. É o custo de manter os dados dentro de casa.
Onde ficam os arquivos
| O quê | Onde |
|---|---|
| Programa | %LOCALAPPDATA%\Programs\Ollama |
| Modelos baixados | %USERPROFILE%\.ollama\models |
Os modelos são o que ocupa espaço. Para apagar um que você não usa mais:
ollama rm qwen2:7b
Controlando o servidor
Você raramente vai precisar disso, mas para referência:
Parar o Ollama: clique com o botão direito no ícone da lhama na bandeja do sistema e escolha Quit Ollama. Pela linha de comando:
Get-Process ollama -ErrorAction SilentlyContinue | Stop-Process
Iniciar de novo: abra o Ollama pelo menu Iniciar. Ou, aí sim, rode ollama serve — agora que a porta está livre, ele vai subir normalmente.
Ambiente e modelo prontos. Vamos confirmar que os dois conversam entre si: siga para Verificando a instalação.