Zurück zum Blog

Ihr Chatbot muss nicht auf einer einzigen KI laufen

22. September 20265 min
Open Technology App

Neu hier? Sie sind richtig. Dieser Beitrag setzt voraus, dass Sie schon einmal mit etwas wie ChatGPT gechattet haben, aber noch nie einen KI-Chatbot für ein Geschäftstool eingerichtet haben. Wenn ein Begriff erklärt werden muss, wird er genau dort erklärt, wo er auftaucht.

Das Problem: eine KI für alles

Stellen Sie sich einen Helpdesk vor, bei dem jede Frage — „Wie lautet das WLAN-Passwort" und „Warum wurde gerade das Konto unseres größten Kunden gesperrt" — an denselben Senior-Spezialisten geht. Dieser Spezialist kann beides beantworten, aber seinen Stundensatz für die WLAN-Frage zu zahlen ist Verschwendung. Ein klügeres Setup leitet einfache Fragen an jemand Junior weiter und spart den Spezialisten für die schwierigen Fälle auf.

Genau das ist das Problem, wenn ein Chatbot für alles auf ein einziges KI-Modell gerichtet wird. Die besten KI-Modelle (die, die am besten in schwierigem Denken sind) sind pro Frage tendenziell auch die teuersten. Wenn jede einfache Nachfrage — „Wie ist der Status dieser Aufgabe?" — durch das teure Modell läuft, zahlen Sie Premiumpreise für Fragen, die das nicht brauchen.

Was „Routing" bedeutet

Routing bedeutet, eine Frage automatisch an ein anderes KI-Modell zu schicken, je nachdem, wie schwierig sie wirkt. OpenTechnologyApp, das Projektmanagement-Tool, das dieser Blog ebenfalls behandelt, bringt das eingebaut mit: Ein Administrator wählt bis zu drei „Anbieter" (die Unternehmen, die ein KI-Modell bereitstellen — Anthropic, OpenAI und Hugging Face werden derzeit unterstützt) und weist jedem eine Rolle zu:

  • Primär — die Standardwahl für die meisten Fragen.
  • Einfach — ein günstigeres Modell, reserviert für leichte, wenig aufwendige Fragen.
  • Ausweich — wird automatisch verwendet, wenn der Dienst des primären Modells Probleme hat.

Ein System im Hintergrund entscheidet, in welche Rolle eine Frage fällt, und schickt sie dorthin — Sie müssen nicht jedes Mal manuell auswählen.

Wie das System „einfach" von „schwierig" unterscheidet

Es sucht nach Mustern in dem, was Sie geschrieben haben. Wörter, die darauf hindeuten, dass Sie etwas ändern wollen („aktualisieren", „löschen"), etwas, das mehrere Projekte umfasst, Code, eine Denkfrage („warum", „vergleiche") oder mehrere Schritte auf einmal — all das schiebt eine Frage Richtung „schwieriger". Eine einfache Abfrage („was ist", „zeig mir") zu einem einzelnen Projekt schiebt sie Richtung „leichter". Das System summiert diese Signale zu einer Punktzahl, und zwei einstellbare Zahlen (eine „niedrige" und eine „hohe" Linie) entscheiden, welche der drei obigen Rollen die Frage tatsächlich übernimmt.

Sie müssen die genaue Formel nicht kennen, um das zu nutzen — ein Administrator kann die Standardeinstellungen einfach lassen, und es funktioniert von Haus aus recht gut. Wenn Sie die tatsächliche Formel und durchgerechnete Beispiele wollen, deckt das tiefere Handbuch Komplexitätsschwellen wählen das ab.

Anbieter wählen: was heute realistisch ist

Vier Anbieter tauchen in OpenTechnologyApps Routing-Einstellungen heute auf:

  • Hugging Face — in der Regel die günstigste gehostete Option und eine vernünftige Wahl für die Rolle „Einfach".
  • OpenAI und Anthropic — die Optionen mit höherer Qualität und höheren Kosten, besser geeignet für die Rollen „Primär" und „Ausweich".
  • Ollama — eine Möglichkeit, ein KI-Modell komplett auf dem eigenen Rechner laufen zu lassen, kostenlos, ohne dass etwas an ein externes Unternehmen geschickt wird. Das ist eine echte, funktionierende Option in den Routing-Einstellungen — mit einem wichtigen Haken: sie funktioniert nur, wenn die App selbst Ihren Rechner erreichen kann. Das trifft auf lokale Entwicklung und auf ein selbst gehostetes Deployment auf Ihrem eigenen Server zu, aber nicht auf die bei Vercel gehostete Version der App — ein Cloud-Server hat keine Möglichkeit, localhost auf Ihrem Laptop zu erreichen. Der Admin-Bildschirm zeigt dazu eine Warnung in Bernstein an, sobald Ollama für eine Rolle gewählt wird, damit Sie das nicht erst auf die harte Tour erfahren. (Der eigene Hybrid-KI-Beitrag dieses Blogs behandelt Ollama für einen verwandten, aber anderen Anwendungsfall — siehe Hybrid-KI-Beitrag — das Routing der Arbeit eines Coding-Assistenten, nicht des In-App-Chatbots.) Stand heute liegt diese Unterstützung in einem OpenTechnologyApp-Pull-Request, der zur Überprüfung offen, aber noch nicht zusammengeführt ist — echter, funktionierender Code, nur noch nicht auf der Instanz jeder Organisation ausgerollt.

Ein realistisches Beispiel

Angenommen, der OpenTechnologyApp-Chatbot eines kleinen Teams beantwortet rund 100 Fragen pro Tag. Die meisten sind schnelle Statuschecks — „was ist überfällig", „wer ist dafür zuständig". Eine Handvoll pro Tag ist wirklich komplex — „ordne diese 40 Einträge über drei Projekte neu und erkläre deine Überlegung". Alles an ein Premium-Modell zu leiten, verlangt Premiumpreise für die gut 90 einfachen Fragen, die das nicht brauchten. Den Datenverkehr aufzuteilen — günstiges Modell für die schnellen Checks, Premium-Modell für die wirklich schwierige Handvoll — senkt die KI-Rechnung spürbar, während die schwierigen Fragen weiterhin vom dafür am besten geeigneten Modell beantwortet werden.

Ausprobieren

Wenn Sie Administrator in einer OpenTechnologyApp-Organisation sind, suchen Sie in Ihren Admin-Einstellungen nach „Org AI — Routing Config". Das Einrichtungs-Handbuch geht den tatsächlichen Bildschirm Feld für Feld durch, mit einer minimalen funktionierenden Konfiguration zum Einstieg, falls Sie am ersten Tag nichts feinjustieren möchten.

Kontakt aufnehmen

Interesse an einem Thema? Hinterlassen Sie eine Nachricht und wählen Sie eine Kategorie. Ich stehe auch für ein kostenloses Beratungsgespräch zur Verfügung — melden Sie sich und wir vereinbaren etwas.