Voltar ao blog

Seu chatbot não precisa rodar em uma única IA

22 de setembro de 20265 min
Open Technology App

Novo por aqui? Você está no lugar certo. Este post presume que você já conversou com algo como o ChatGPT antes, mas nunca configurou um chatbot com IA para uma ferramenta de negócio. Se uma palavra precisa de explicação, ela é explicada bem onde aparece.

O problema: uma só IA para tudo

Imagine uma central de ajuda em que toda pergunta — "qual é a senha do wifi" e "por que a conta do nosso maior cliente acabou de ser suspensa" — passa pelo mesmo especialista sênior. Esse especialista consegue responder às duas, mas pagar a hora dele pela pergunta do wifi é desperdício. Uma configuração mais inteligente direciona as perguntas fáceis para alguém júnior e reserva o especialista para os casos difíceis.

Esse é exatamente o problema de apontar um chatbot para um único modelo de IA em tudo. Os melhores modelos de IA (os mais capazes em raciocínio difícil) também costumam ser os mais caros por pergunta. Se toda consulta simples — "qual é o status desta tarefa?" — passa pelo modelo caro, você está pagando preço premium por perguntas que não precisam disso.

O que significa "roteamento"

Roteamento é enviar automaticamente uma pergunta para um modelo de IA diferente dependendo de quão difícil ela parece. O OpenTechnologyApp, a ferramenta de gestão de projetos que este blog também cobre, já vem com isso embutido: um administrador escolhe até três "fornecedores" (as empresas que oferecem um modelo de IA — Anthropic, OpenAI e Hugging Face são os três atualmente compatíveis) e atribui um papel a cada um:

  • Principal — a escolha padrão para a maioria das perguntas.
  • Simples — um modelo mais barato reservado para perguntas fáceis, de baixo esforço.
  • Reserva — usado automaticamente se o serviço do modelo principal tiver um problema.

Um sistema nos bastidores decide em qual papel uma pergunta se encaixa e a envia para lá — você não precisa escolher manualmente toda vez.

Como o sistema decide o que é "fácil" e o que é "difícil"

Ele procura padrões no que você digitou. Palavras que sugerem que você quer mudar algo ("atualizar," "excluir"), algo que abrange vários projetos, código, uma pergunta de raciocínio ("por que," "compare") ou vários passos de uma vez — tudo isso empurra uma pergunta para "mais difícil." Uma consulta simples ("o que é," "me mostre") em um único projeto empurra para "mais fácil." O sistema soma esses sinais em uma pontuação, e dois números ajustáveis (uma linha "baixa" e uma "alta") decidem qual dos três papéis acima realmente atende a pergunta.

Você não precisa saber a fórmula exata para usar isso — um administrador pode deixar as configurações padrão como estão e funciona razoavelmente bem de início. Se você quiser a fórmula real e exemplos resolvidos, o guia mais aprofundado Escolhendo limiares de complexidade cobre isso.

Escolhendo fornecedores: o que é realista hoje

Quatro fornecedores aparecem nas configurações de roteamento do OpenTechnologyApp hoje:

  • Hugging Face — geralmente a opção hospedada mais barata, e uma escolha razoável para o papel "simples."
  • OpenAI e Anthropic — as opções de maior qualidade e maior custo, mais adequadas para os papéis "principal" e "reserva."
  • Ollama — uma forma de rodar um modelo de IA inteiramente no seu próprio computador, de graça, sem enviar nada para uma empresa externa. É uma opção real e funcional nas configurações de roteamento, com uma ressalva importante: ela só funciona quando o próprio app consegue alcançar o seu computador. Isso vale para o desenvolvimento local e para uma implantação auto-hospedada no seu próprio servidor, mas não para a versão do app hospedada na Vercel — um servidor na nuvem não tem como alcançar o localhost do seu notebook. A tela de administração mostra um aviso em âmbar sobre isso sempre que o Ollama é escolhido para qualquer papel, então você não vai descobrir isso da pior forma. (O próprio post deste blog sobre IA híbrida cobre o Ollama para um caso de uso relacionado, mas diferente: rotear o trabalho de um assistente de programação, não o chatbot dentro do app.) No momento em que este texto foi escrito, esse suporte está em um pull request do OpenTechnologyApp aberto para revisão, mas ainda não mesclado — código real e funcional, só que ainda não implantado na instância de cada organização.

Um exemplo realista

Digamos que o chatbot do OpenTechnologyApp de uma equipe pequena atenda cerca de 100 perguntas por dia. A maioria são verificações rápidas de status — "o que está atrasado," "quem está atribuído a isso." Um punhado por dia é genuinamente complexo — "reorganize estes 40 itens em três projetos e explique seu raciocínio." Rotear tudo para um modelo premium cobra tarifas premium pelas 90 e tantas perguntas simples que não precisavam disso. Dividir o tráfego — modelo barato para as verificações rápidas, modelo premium para o punhado genuinamente difícil — reduz substancialmente a conta de IA e ainda mantém as perguntas difíceis respondidas pelo modelo mais bem equipado para elas.

Experimente

Se você é administrador em uma organização do OpenTechnologyApp, procure por "Org AI — Routing Config" nas suas configurações de administrador. O guia de configuração percorre a tela real campo por campo, com uma configuração mínima funcional para começar, caso você prefira não ajustar nada no primeiro dia.

Entre em contato

Interessado em um tema? Deixe uma mensagem e escolha uma categoria. Também estou disponível para uma reunião de consultoria gratuita — entre em contato e combinamos.