Voltar ao blog

Série de aprendizado de IA, lição 4: cortando custo com um workflow de IA

23 de setembro de 20267 min
Ferramentas de desenvolvimento

Série de aprendizado de IA · Lição 4 de 4

Você não consegue cortar o que não mediu. Toda afirmação de custo de IA que vale alguma coisa começa com uma linha de base real, muda uma coisa por vez e conta a qualidade toda vez que conta o gasto — uma execução mais barata que falha na verificação é uma perda, não uma economia.

Status: roteiro. A demonstração na tela ainda não foi gravada, e toda a premissa desta lição é um resultado medido — então ainda não há números aqui. Nenhum será inventado para o post parecer pronto; a linha de base real e a tabela final substituem esta nota quando a lição for ao ar.

LiçãoFocoPergunta que responde
1 — Uso de modelosNível de modelo, contexto, tokensDe qual modelo esta tarefa precisa?
2 — Prompt, projeto e contextoEstrutura do prompt, contexto permanenteO que vai na frente do modelo?
3 — Documentação, regras e skillsEstrutura do repositórioComo um repositório se mantém consistente entre sessões?
4 — Cortando custoMedição, alavancas, limitesComo gastar menos sem perder qualidade?

O que você vai conseguir fazer

  • Medir quanto custa uma tarefa real de IA
  • Descobrir para onde esse gasto realmente vai
  • Cortá-lo com uma mudança que você consegue nomear e defender — sem piorar o resultado

A afirmação que esta lição pode fazer é estreita de propósito: menos pelo mesmo resultado, medido na tela. Não uma porcentagem emprestada de outro lugar. O número medido, seja qual for, é o que será publicado, mesmo que seja pequeno.

Fora do escopo: negociação com provedores, descontos empresariais, auto-hospedagem para evitar totalmente o gasto com API e qualquer preço ou porcentagem de economia apresentado como fato estabelecido. Todo número na tela vem do uso real daquela semana, mostrado com a fonte.


As quatro alavancas

O custo vem por último porque as alavancas são o que as lições 1–3 ensinam. Sem elas, não há nada para puxar.

AlavancaEnsinada em
Dimensionar o modelo para o trabalhoLição 1
Enviar menos contexto, mais bem escolhidoLições 1 e 2
Acertar de primeira — critérios de aceitação desde o inícioLição 2
Carregar só o que a tarefa precisa — documentação, regras e skills em camadasLição 3

O método

Linha de base — meça antes de mexer em qualquer coisa

  • Uma tarefa que realmente se repete, rodada como está hoje
  • Tokens de entrada e saída, número de novas tentativas e aprovado/reprovado registrados antes de qualquer mudança
▶ show code
# Baseline Log — one task, before any change
Task:           (one you actually repeat)
Model/setting:
Input tokens:
Output tokens:
Retries:
Result:         pass / fail against the stated check
Source/date:    where each number came from, and when

Detalhamento — para onde o gasto realmente vai

  • A linha de base é dividida por etapa: qual parte da tarefa, qual contexto, quais novas tentativas
  • A parte cara nem sempre é a que parece cara

Uma alavanca por vez — meça de novo a cada mudança

  • Mude uma coisa, meça de novo e só mantenha a mudança se a qualidade se mantiver
  • Uma execução mais barata que falha na verificação fica na tabela como perda — nunca é removida sem aviso

Redesenho do workflow — etapas baratas em modelos baratos

  • Divida a tarefa para que as etapas rotineiras rodem em um modelo pequeno e só a etapa realmente difícil use um modelo caro
  • Dois exemplos práticos da mesma alavanca: o guia de configuração de IA híbrida divide um workflow de programação entre Hugging Face e Claude, e o roteamento de fornecedores do chatbot do OpenTechnologyApp envia automaticamente as perguntas fáceis de um chatbot para um modelo barato e as difíceis para um caro

Limites — condições de parada e orçamentos de gasto

  • Tudo o que roda em loop recebe uma condição de parada e um orçamento de gasto, para que um erro não faça a conta disparar sem supervisão
  • Na tela: um loop ultrapassa o limite de propósito e é parado pelo próprio limite

A tabela final

Preenchida com valores medidos quando a lição for gravada — mostrada aqui no formato que vai ter.

MudançaCusto versus linha de baseVerificação de qualidadeMantida?
Linha de base———
Alavanca 1———
Alavanca 2———
Alavanca 3———

As regras dos resultados

  • A qualidade é medida toda vez que o custo é. Uma execução mais barata que falha na verificação é uma perda, ponto.
  • Uma alavanca por nova execução. Senão, a tabela não consegue dizer qual mudança fez o quê.
  • Alavancas sem economia ficam. Tirá-las para os resultados parecerem mais limpos distorceria o método.

Verifique antes de confiar

  • Preço atual por modelo — e se entrada, saída e entrada em cache são cobradas de forma diferente — tirado da página de preços do provedor na mesma semana, com a data na tela
  • Se existem cache de prompt ou processamento em lote para o modelo e a ferramenta demonstrados, como se chamam e quais as restrições
  • Como a ferramenta informa o uso de tokens por requisição, para que a linha de base seja medida e não estimada
  • Que a tarefa escolhida realmente se repete e é segura para rodar ao vivo
  • Qualquer recurso de limite de gasto ou de uso na ferramenta, para o segmento de limites

Perguntas frequentes

"Quanto isso vai me economizar?" Não dá para saber até você medir a sua própria linha de base. Qualquer porcentagem citada sem uma descreve a carga de trabalho de outra pessoa.

"Devo passar tudo para o modelo mais barato?" Só as etapas que continuam passando na verificação com ele. Uma execução barata que falha custa a nova tentativa, a revisão e a correção.

"Vim pelo custo — posso pular as lições 1–3?" Pode ler esta primeiro, mas as alavancas só funcionam quando a preparação anterior está no lugar.


A série completa

Escolha o modelo. Escreva o prompt e configure o projeto. Estruture o repositório. Depois gaste menos em tudo isso sem perder qualidade. Nada disso substitui a documentação do próprio provedor sobre o que está em vigor — é uma ordem de operações, trabalhada em uma tarefa real em vez de slides. Comece pela lição 1 ou veja a série inteira na página Aprender IA.

Entre em contato

Interessado em um tema? Deixe uma mensagem e escolha uma categoria. Também estou disponível para uma reunião de consultoria gratuita — entre em contato e combinamos.