Pular para o conteúdo

Instalando o Ollama e baixando o modelo

Um agente precisa de um modelo de linguagem para raciocinar. O curso original usa a API da Hugging Face, na nuvem. Aqui vamos usar o Ollama, que roda o modelo dentro da sua própria máquina.

O que é o Ollama

O Ollama é um programa que faz duas coisas:

  1. Baixa e guarda modelos de linguagem no seu disco.
  2. Sobe um servidor local em http://127.0.0.1:11434 que responde a pedidos no mesmo formato da API da OpenAI.

O ponto 2 é o que torna tudo isso simples: como o Ollama fala o "dialeto" da OpenAI, qualquer biblioteca que saiba conversar com a OpenAI — incluindo o smolagents via LiteLLM — conversa com o Ollama sem alteração de código. Você troca o endereço e o nome do modelo, e pronto.

Nota

127.0.0.1 é o endereço da sua própria máquina, também chamado de localhost. Um servidor nesse endereço não é acessível pela rede — nem por outro computador do Tribunal. O tráfego não sai da placa de rede.

Passo 1: instalar

  1. Acesse ollama.com/download e baixe a versão para Windows (OllamaSetup.exe).
  2. Execute o instalador.
  3. Clique em Install.

O Ollama instala em %LOCALAPPDATA%\Programs\Ollama, na sua conta de usuário. Não pede senha de administrador.

O que acontece depois da instalação

Aqui está a diferença mais importante em relação ao curso original, e a causa do erro que quase todo mundo encontra:

No Windows, o instalador já deixa o Ollama rodando em segundo plano, e configurado para iniciar junto com o Windows. Você vai ver o ícone de lhama na bandeja do sistema, ao lado do relógio.

No Linux e no macOS não é assim — por isso o curso original manda rodar ollama serve manualmente. No Windows, você não precisa desse comando. O servidor já está no ar.

Se você rodar ollama serve mesmo assim, verá:

Error: listen tcp 127.0.0.1:11434: bind: Only one usage of each socket address (protocol/network address/port) is normally permitted.

Isso não é um defeito. É o Ollama avisando que a porta 11434 já está ocupada — por ele mesmo. Pode ignorar o comando e seguir em frente.

Passo 2: confirmar que o servidor está no ar

curl http://127.0.0.1:11434/api/version

Resposta esperada (o número da versão pode ser outro):

{"version":"0.33.2"}

Se respondeu, o servidor está funcionando e você não precisa fazer mais nada quanto a isso.

Se você quiser ver qual programa está ocupando a porta:

Get-NetTCPConnection -LocalPort 11434 | Select-Object OwningProcess

E descobrir o nome do processo a partir do número que apareceu:

Get-Process -Id 3252

Deve mostrar ollama.

Atenção

O curso original sugere sudo lsof -i :11434 para essa investigação. sudo e lsof são comandos do Linux — não existem no Windows. Se você tentar, recebe Comando não encontrado. Use os dois comandos PowerShell acima no lugar.

Passo 3: baixar o modelo

ollama pull qwen2:7b

O download tem cerca de 4,4 GB e leva de alguns minutos a bem mais, dependendo da rede. A barra de progresso mostra o andamento.

qwen2:7b é um modelo de 7 bilhões de parâmetros, quantizado, com suporte a tool calling (chamada de Tools) — que é exatamente o recurso de que precisamos na Unidade 1. É a mesma escolha do curso original.

Se a máquina for fraca

Com 8 GB de RAM ou menos, o qwen2:7b vai ficar desconfortavelmente lento. Alternativa:

ollama pull qwen2.5:3b

Ocupa cerca de 2 GB e responde bem mais rápido. Em troca, erra mais ao decidir qual Tool usar — alguns exercícios da Unidade 1 exigirão mais tentativas. Se optar por ele, troque qwen2:7b por qwen2.5:3b em todos os códigos do curso.

Conferir o que foi baixado

ollama list

Saída esperada:

NAME         ID              SIZE      MODIFIED
qwen2:7b     dd314f039b9d    4.4 GB    2 minutes ago

Passo 4: conversar com o modelo pelo terminal

Antes de programar qualquer coisa, converse com o modelo diretamente:

ollama run qwen2:7b

O cursor vira >>>. Escreva uma pergunta e pressione Enter:

>>> Explique em duas frases o que é um agente de IA.

A primeira resposta demora mais — o modelo está sendo carregado para a memória. As seguintes vêm mais rápido.

Para sair, digite /bye e pressione Enter.

Nota

Se a resposta sair devagar, palavra por palavra, está tudo certo. O modelo está rodando na CPU da sua máquina, não em uma placa de vídeo de servidor. É o custo de manter os dados dentro de casa.

Onde ficam os arquivos

O quê Onde
Programa %LOCALAPPDATA%\Programs\Ollama
Modelos baixados %USERPROFILE%\.ollama\models

Os modelos são o que ocupa espaço. Para apagar um que você não usa mais:

ollama rm qwen2:7b

Controlando o servidor

Você raramente vai precisar disso, mas para referência:

Parar o Ollama: clique com o botão direito no ícone da lhama na bandeja do sistema e escolha Quit Ollama. Pela linha de comando:

Get-Process ollama -ErrorAction SilentlyContinue | Stop-Process

Iniciar de novo: abra o Ollama pelo menu Iniciar. Ou, aí sim, rode ollama serve — agora que a porta está livre, ele vai subir normalmente.


Ambiente e modelo prontos. Vamos confirmar que os dois conversam entre si: siga para Verificando a instalação.