Voltar ao blog

Série de aprendizado de IA, lição 1: uso de modelos

23 de setembro de 20266 min
Ferramentas de desenvolvimento

Série de aprendizado de IA · Lição 1 de 4

A maioria dos resultados de IA é decidida antes do primeiro prompt. O modelo que você escolhe define o teto de qualidade, o piso de custo e quanto contexto a tarefa consegue carregar — então escolha de propósito, não por hábito.

Status: roteiro. A demonstração na tela ainda não foi gravada — este post é o plano que ela vai seguir, e recebe a demonstração real quando a lição for ao ar.

LiçãoFocoPergunta que responde
1 — Uso de modelosNível de modelo, contexto, tokensDe qual modelo esta tarefa precisa?
2 — Prompt, projeto e contextoEstrutura do prompt, contexto permanenteO que vai na frente do modelo?
3 — Documentação, regras e skillsEstrutura do repositórioComo um repositório se mantém consistente entre sessões?
4 — Cortando custoMedição, alavancas, limitesComo gastar menos sem perder qualidade?

O que você vai conseguir fazer

  • Olhar para uma tarefa e dizer de qual nível de modelo ela precisa — com um motivo
  • Estimar quanto contexto enviar antes de enviar
  • Estimar mais ou menos quanto a execução vai custar antes de rodar

Não "qual modelo é o melhor" — não existe um. Qual modelo serve para esta tarefa.

Fora do escopo: redação do prompt e configuração do projeto (lição 2), arquivos de regras e skills (lição 3) e redução de gastos (lição 4). Esta lição ensina o vocabulário do custo — tokens, contexto, entrada versus saída — para que a lição 4 tenha algo concreto para cortar.


A decisão do modelo

Nível de modelo — capacidade, velocidade e preço

  • Capacidade, velocidade e preço andam juntos: raciocínio mais forte costuma ser mais lento e mais caro por token
  • A mesma tarefa roda em um modelo pequeno e em um grande, lado a lado, para que a troca fique visível em vez de apenas afirmada

Encaixe com a tarefa — combine com o trabalho, não com a manchete

  • Consulta, classificação, redação, raciocínio em várias etapas e trabalho de agente de longa duração não precisam do mesmo modelo
  • Três tarefas reais do próprio repositório deste blog recebem, cada uma, um modelo e um motivo explícito — nunca "porque é o mais novo"
Tipo de tarefaEscolha típicaPor quê
Consulta / classificaçãoNível pequeno e rápidoEntrada curta, uma resposta certa, fácil de verificar
Redação / reescritaNível intermediárioPrecisa mais de fluência do que de raciocínio profundo
Raciocínio em várias etapas / depuraçãoNível grandeErros se acumulam — a capacidade se paga
Trabalho de agente de longa duraçãoNível grande, com limitesMuitas etapas, muitos tokens — precisa de orçamento e condição de parada

Janela de contexto — o que cabe, o que cai

  • Mais contexto não é automaticamente melhor — a partir de certo ponto você paga por tokens que o modelo mal usa
  • Além do limite da janela, o conteúdo mais antigo cai sem aviso
  • Na tela: um arquivo longo colado inteiro, depois só a seção relevante, comparando resultado e custo

Tokens — entrada versus saída

  • Tokens de entrada e de saída são contados separadamente, e muitas vezes cobrados separadamente
  • Um prompt real deste projeto e a resposta dele são contados, para que "quanto vai custar" deixe de ser palpite

Configurações de esforço e raciocínio

  • Alguns modelos oferecem uma configuração de quanto raciocinam antes de responder
  • Uma tarefa realmente difícil roda com configuração baixa e alta — comparadas pelos resultados, não só pela latência

A lista de decisão

▶ show code
# Model Decision — before you send
1. What kind of task is this? (lookup / draft / reasoning / agent)
2. What does "correct" look like, and how will you check it?
3. What is the smallest tier that can plausibly pass that check?
4. What context does it actually need? (sections, not whole files)
5. Rough token estimate: input + expected output
6. Is there an effort/reasoning setting — and does this task need it?
7. Check failed? Change one thing (tier, context, or setting) and rerun

Verifique antes de confiar

Nomes de modelos, tamanhos de janela de contexto e preços mudam rápido demais para serem publicados como fato, então esta lição não cita nenhum. Antes da gravação, cada um é conferido de novo na documentação do próprio provedor:

  • Nomes atuais dos modelos e o nível de cada um
  • Tamanho da janela de contexto por modelo
  • Preço de entrada e de saída por modelo — mostrado só se conferido na mesma semana
  • Se existe configuração de esforço ou raciocínio nos modelos demonstrados, e como ela se chama

Precisa dos detalhes agora? Consulte a documentação da Anthropic, a documentação da OpenAI e os model cards do Hugging Face — as mesmas fontes que a lição confere antes de entrar ao vivo.


Perguntas frequentes

"Qual modelo é o melhor?" Nenhum, em abstrato. O modelo certo é o menor que passa na sua verificação para esta tarefa.

"Devo enviar o arquivo inteiro?" Normalmente não. Envie a seção de que a tarefa depende — arquivos inteiros custam mais e podem enterrar a parte que importa.

"Onde encontro preços e limites atuais?" Na documentação do próprio provedor, consultada na semana em que você precisa — não em um post de blog, incluindo este.


Próxima: lição 2

Escolher o modelo é metade da preparação. A lição 2 trata do que vai na frente dele — estrutura do prompt, critérios de aceitação e contexto permanente do projeto. Para a versão avançada de escolher onde o trabalho de IA roda, o guia de configuração de IA híbrida divide o trabalho entre Hugging Face, Claude e um modelo Ollama rodando localmente.

Entre em contato

Interessado em um tema? Deixe uma mensagem e escolha uma categoria. Também estou disponível para uma reunião de consultoria gratuita — entre em contato e combinamos.