Série de aprendizado de IA · Lição 4 de 4
Você não consegue cortar o que não mediu. Toda afirmação de custo de IA que vale alguma coisa começa com uma linha de base real, muda uma coisa por vez e conta a qualidade toda vez que conta o gasto — uma execução mais barata que falha na verificação é uma perda, não uma economia.
Status: roteiro. A demonstração na tela ainda não foi gravada, e toda a premissa desta lição é um resultado medido — então ainda não há números aqui. Nenhum será inventado para o post parecer pronto; a linha de base real e a tabela final substituem esta nota quando a lição for ao ar.
| Lição | Foco | Pergunta que responde |
|---|---|---|
| 1 — Uso de modelos | Nível de modelo, contexto, tokens | De qual modelo esta tarefa precisa? |
| 2 — Prompt, projeto e contexto | Estrutura do prompt, contexto permanente | O que vai na frente do modelo? |
| 3 — Documentação, regras e skills | Estrutura do repositório | Como um repositório se mantém consistente entre sessões? |
| 4 — Cortando custo | Medição, alavancas, limites | Como gastar menos sem perder qualidade? |
O que você vai conseguir fazer
- Medir quanto custa uma tarefa real de IA
- Descobrir para onde esse gasto realmente vai
- Cortá-lo com uma mudança que você consegue nomear e defender — sem piorar o resultado
A afirmação que esta lição pode fazer é estreita de propósito: menos pelo mesmo resultado, medido na tela. Não uma porcentagem emprestada de outro lugar. O número medido, seja qual for, é o que será publicado, mesmo que seja pequeno.
Fora do escopo: negociação com provedores, descontos empresariais, auto-hospedagem para evitar totalmente o gasto com API e qualquer preço ou porcentagem de economia apresentado como fato estabelecido. Todo número na tela vem do uso real daquela semana, mostrado com a fonte.
As quatro alavancas
O custo vem por último porque as alavancas são o que as lições 1–3 ensinam. Sem elas, não há nada para puxar.
| Alavanca | Ensinada em |
|---|---|
| Dimensionar o modelo para o trabalho | Lição 1 |
| Enviar menos contexto, mais bem escolhido | Lições 1 e 2 |
| Acertar de primeira — critérios de aceitação desde o início | Lição 2 |
| Carregar só o que a tarefa precisa — documentação, regras e skills em camadas | Lição 3 |
O método
Linha de base — meça antes de mexer em qualquer coisa
- Uma tarefa que realmente se repete, rodada como está hoje
- Tokens de entrada e saída, número de novas tentativas e aprovado/reprovado registrados antes de qualquer mudança
▶ show code▼ hide code
# Baseline Log — one task, before any change
Task: (one you actually repeat)
Model/setting:
Input tokens:
Output tokens:
Retries:
Result: pass / fail against the stated check
Source/date: where each number came from, and when
Detalhamento — para onde o gasto realmente vai
- A linha de base é dividida por etapa: qual parte da tarefa, qual contexto, quais novas tentativas
- A parte cara nem sempre é a que parece cara
Uma alavanca por vez — meça de novo a cada mudança
- Mude uma coisa, meça de novo e só mantenha a mudança se a qualidade se mantiver
- Uma execução mais barata que falha na verificação fica na tabela como perda — nunca é removida sem aviso
Redesenho do workflow — etapas baratas em modelos baratos
- Divida a tarefa para que as etapas rotineiras rodem em um modelo pequeno e só a etapa realmente difícil use um modelo caro
- Dois exemplos práticos da mesma alavanca: o guia de configuração de IA híbrida divide um workflow de programação entre Hugging Face e Claude, e o roteamento de fornecedores do chatbot do OpenTechnologyApp envia automaticamente as perguntas fáceis de um chatbot para um modelo barato e as difíceis para um caro
Limites — condições de parada e orçamentos de gasto
- Tudo o que roda em loop recebe uma condição de parada e um orçamento de gasto, para que um erro não faça a conta disparar sem supervisão
- Na tela: um loop ultrapassa o limite de propósito e é parado pelo próprio limite
A tabela final
Preenchida com valores medidos quando a lição for gravada — mostrada aqui no formato que vai ter.
| Mudança | Custo versus linha de base | Verificação de qualidade | Mantida? |
|---|---|---|---|
| Linha de base | — | — | — |
| Alavanca 1 | — | — | — |
| Alavanca 2 | — | — | — |
| Alavanca 3 | — | — | — |
As regras dos resultados
- A qualidade é medida toda vez que o custo é. Uma execução mais barata que falha na verificação é uma perda, ponto.
- Uma alavanca por nova execução. Senão, a tabela não consegue dizer qual mudança fez o quê.
- Alavancas sem economia ficam. Tirá-las para os resultados parecerem mais limpos distorceria o método.
Verifique antes de confiar
- Preço atual por modelo — e se entrada, saída e entrada em cache são cobradas de forma diferente — tirado da página de preços do provedor na mesma semana, com a data na tela
- Se existem cache de prompt ou processamento em lote para o modelo e a ferramenta demonstrados, como se chamam e quais as restrições
- Como a ferramenta informa o uso de tokens por requisição, para que a linha de base seja medida e não estimada
- Que a tarefa escolhida realmente se repete e é segura para rodar ao vivo
- Qualquer recurso de limite de gasto ou de uso na ferramenta, para o segmento de limites
Perguntas frequentes
"Quanto isso vai me economizar?" Não dá para saber até você medir a sua própria linha de base. Qualquer porcentagem citada sem uma descreve a carga de trabalho de outra pessoa.
"Devo passar tudo para o modelo mais barato?" Só as etapas que continuam passando na verificação com ele. Uma execução barata que falha custa a nova tentativa, a revisão e a correção.
"Vim pelo custo — posso pular as lições 1–3?" Pode ler esta primeiro, mas as alavancas só funcionam quando a preparação anterior está no lugar.
A série completa
Escolha o modelo. Escreva o prompt e configure o projeto. Estruture o repositório. Depois gaste menos em tudo isso sem perder qualidade. Nada disso substitui a documentação do próprio provedor sobre o que está em vigor — é uma ordem de operações, trabalhada em uma tarefa real em vez de slides. Comece pela lição 1 ou veja a série inteira na página Aprender IA.