Retour au blog

Votre chatbot n'a pas besoin de tourner sur une seule IA

22 septembre 20265 min
Open Technology App

Nouveau ici ? Vous êtes au bon endroit. Cet article suppose que vous avez déjà discuté avec quelque chose comme ChatGPT, mais jamais configuré de chatbot IA pour un outil professionnel. Si un mot a besoin d'être expliqué, il l'est juste là où il apparaît.

Le problème : une seule IA pour tout

Imaginez un support client où chaque question — « quel est le mot de passe Wi-Fi » et « pourquoi le compte de notre plus gros client vient-il d'être suspendu » — passe par le même spécialiste senior. Ce spécialiste peut répondre aux deux, mais payer son tarif horaire pour la question du Wi-Fi est un gaspillage. Une organisation plus intelligente envoie les questions faciles à quelqu'un de junior et réserve le spécialiste pour les cas difficiles.

C'est exactement le problème quand on pointe un chatbot vers un seul modèle d'IA pour tout. Les meilleurs modèles d'IA (les plus doués pour le raisonnement difficile) sont aussi souvent les plus chers par question. Si chaque question simple — « où en est cette tâche ? » — passe par le modèle coûteux, vous payez un tarif premium pour des questions qui n'en ont pas besoin.

Ce que signifie le « routage »

Le routage, c'est envoyer automatiquement une question vers un modèle d'IA différent selon sa difficulté apparente. OpenTechnologyApp, l'outil de gestion de projet que ce blog couvre aussi, intègre cela nativement : un administrateur choisit jusqu'à trois « fournisseurs » (les entreprises proposant un modèle d'IA — Anthropic, OpenAI et Hugging Face sont les trois pris en charge actuellement) et attribue un rôle à chacun :

  • Principal — le choix par défaut pour la plupart des questions.
  • Simple — un modèle moins cher réservé aux questions faciles, peu exigeantes.
  • Secours — utilisé automatiquement si le service du modèle principal a un problème.

Un système en coulisses décide à quel rôle appartient une question et l'y envoie ; vous n'avez pas à choisir manuellement à chaque fois.

Comment le système juge « facile » contre « difficile »

Il cherche des motifs dans ce que vous avez tapé. Des mots suggérant que vous voulez changer quelque chose (« mettre à jour », « supprimer »), quelque chose qui s'étend sur plusieurs projets, du code, une question de raisonnement (« pourquoi », « comparer ») ou plusieurs étapes à la fois — tout cela pousse une question vers le « plus difficile ». Une simple consultation (« qu'est-ce que », « montre-moi ») sur un seul projet la pousse vers le « plus facile ». Le système additionne ces signaux en un score, et deux nombres réglables (une ligne « basse » et une « haute ») décident lequel des trois rôles ci-dessus la traite réellement.

Vous n'avez pas besoin de connaître la formule exacte pour vous en servir — un administrateur peut laisser les réglages par défaut et cela fonctionne raisonnablement bien tel quel. Si vous voulez la formule réelle et des exemples chiffrés, le guide plus approfondi Choisir les seuils de complexité la couvre.

Choisir des fournisseurs : ce qui est réaliste aujourd'hui

Quatre fournisseurs apparaissent dans les réglages de routage d'OpenTechnologyApp aujourd'hui :

  • Hugging Face — généralement l'option hébergée la moins chère, et un choix raisonnable pour le rôle « simple ».
  • OpenAI et Anthropic — les options de meilleure qualité et de coût plus élevé, mieux adaptées aux rôles « principal » et « secours ».
  • Ollama — une façon de faire tourner un modèle d'IA entièrement sur votre propre ordinateur, gratuitement, sans rien envoyer à une entreprise extérieure. C'est une option réelle et fonctionnelle dans les réglages de routage, avec une réserve importante : elle ne fonctionne que lorsque l'application elle-même peut atteindre votre ordinateur. C'est vrai en développement local et pour un déploiement auto-hébergé sur votre propre serveur, mais pas pour la version hébergée sur Vercel de l'application — un serveur cloud n'a aucun moyen d'atteindre localhost sur votre ordinateur portable. L'écran d'administration affiche un avertissement en ambre à ce sujet dès qu'Ollama est choisi pour un rôle, donc vous ne le découvrirez pas à vos dépens. (L'article de ce blog sur l'IA hybride couvre Ollama pour un usage connexe mais différent : router le travail d'un assistant de codage, pas le chatbot intégré à l'app.) À l'heure où ces lignes sont écrites, cette prise en charge se trouve dans une demande d'intégration OpenTechnologyApp ouverte à la relecture mais pas encore fusionnée — du code réel et fonctionnel, simplement pas encore déployé sur l'instance de chaque organisation.

Un exemple réaliste

Supposons que le chatbot OpenTechnologyApp d'une petite équipe traite environ 100 questions par jour. La plupart sont des vérifications de statut rapides — « qu'est-ce qui est en retard », « qui est assigné à ceci ». Une poignée chaque jour est vraiment complexe — « réorganise ces 40 éléments sur trois projets et explique ton raisonnement ». Router tout vers un modèle premium facture des tarifs premium pour la grosse majorité des questions simples qui n'en avaient pas besoin. Répartir le trafic — modèle bon marché pour les vérifications rapides, modèle premium pour la poignée vraiment difficile — réduit nettement la facture d'IA tout en laissant les questions difficiles traitées par le modèle le mieux équipé pour elles.

Essayez-le

Si vous êtes administrateur d'une organisation OpenTechnologyApp, cherchez « Org AI — Routing Config » dans vos réglages d'administration. Le guide de configuration parcourt l'écran réel champ par champ, avec une configuration minimale fonctionnelle pour démarrer si vous préférez ne rien régler le premier jour.

Contactez-moi

Un sujet vous intéresse ? Laissez un mot et choisissez une catégorie. Je suis aussi disponible pour une réunion de conseil gratuite — écrivez-moi et nous organiserons cela.