Volver al blog

Tu chatbot no tiene que funcionar con una sola IA

22 de septiembre de 20265 min
Open Technology App

¿Eres nuevo en esto? Estás en el lugar correcto. Esta publicación asume que has chateado con algo como ChatGPT antes, pero nunca has configurado un chatbot con IA para una herramienta de negocio. Si una palabra necesita explicación, se explica justo donde aparece.

El problema: una sola IA para todo

Imagina una mesa de ayuda donde cada pregunta —"¿cuál es la contraseña del wifi?" y "¿por qué se acaba de suspender la cuenta de nuestro cliente más grande?"— pasa por el mismo especialista senior. Ese especialista puede responder ambas, pero pagar su tarifa por hora para la pregunta del wifi es un desperdicio. Una configuración más inteligente envía las preguntas fáciles a alguien junior y reserva al especialista para las llamadas difíciles.

Ese es exactamente el problema de apuntar un chatbot a un solo modelo de IA para todo. Los mejores modelos de IA (los más capaces en razonamiento difícil) también suelen ser los más caros por pregunta. Si cada consulta simple —"¿cuál es el estado de esta tarea?"— pasa por el modelo caro, estás pagando precios premium por preguntas que no lo necesitan.

Qué significa "enrutamiento"

Enrutamiento es enviar automáticamente una pregunta a un modelo de IA distinto según lo difícil que parezca. OpenTechnologyApp, la herramienta de gestión de proyectos que este blog también cubre, incluye esto de fábrica: un administrador elige hasta tres "proveedores" (las empresas que ofrecen un modelo de IA; Anthropic, OpenAI y Hugging Face son los tres compatibles actualmente) y le asigna a cada uno un rol:

  • Principal — la opción habitual para la mayoría de las preguntas.
  • Simple — un modelo más barato reservado para preguntas fáciles y de poco esfuerzo.
  • Reserva — se usa automáticamente si el servicio del modelo principal falla.

Un sistema que trabaja tras bambalinas decide a qué rol pertenece una pregunta y la envía allí; no tienes que elegir manualmente cada vez.

Cómo decide el sistema qué es "fácil" y qué es "difícil"

Busca patrones en lo que escribiste. Palabras que sugieren que quieres cambiar algo ("actualizar," "eliminar"), algo que abarca varios proyectos, código, una pregunta de razonamiento ("por qué," "compara") o varios pasos a la vez, empujan una pregunta hacia lo "más difícil." Una consulta simple ("qué es," "muéstrame") sobre un solo proyecto la empuja hacia lo "más fácil." El sistema suma estas señales en una puntuación, y dos números ajustables (una línea "baja" y una "alta") deciden cuál de los tres roles anteriores la atiende realmente.

No necesitas conocer la fórmula exacta para usar esto: un administrador puede dejar la configuración predeterminada tal cual y funciona razonablemente bien de inicio. Si quieres la fórmula real y ejemplos resueltos, la guía más profunda Elegir umbrales de complejidad lo cubre.

Elegir proveedores: qué es realista hoy

Hoy aparecen cuatro proveedores en la configuración de enrutamiento de OpenTechnologyApp:

  • Hugging Face — generalmente la opción alojada más barata, y una elección razonable para el rol "simple."
  • OpenAI y Anthropic — las opciones de mayor calidad y mayor costo, más adecuadas para los roles "principal" y "reserva."
  • Ollama — una forma de ejecutar un modelo de IA enteramente en tu propia computadora, gratis, sin enviar nada a una empresa externa. Es una opción real y funcional en la configuración de enrutamiento, con una salvedad importante: solo funciona cuando la propia app puede llegar hasta tu computadora. Eso es cierto para el desarrollo local y para una implementación autoalojada en tu propio servidor, pero no para la versión alojada en Vercel de la app: un servidor en la nube no tiene forma de llegar a localhost en tu laptop. La pantalla de administración muestra una advertencia en ámbar al respecto siempre que eliges Ollama para cualquier rol, así que no lo descubrirás por las malas. (La propia entrada de este blog sobre IA híbrida cubre Ollama para un caso de uso relacionado pero distinto: enrutar el trabajo de un asistente de programación, no el chatbot dentro de la app). A fecha de esta publicación, esta compatibilidad vive en una solicitud de incorporación de OpenTechnologyApp que está abierta para revisión pero aún no se ha fusionado: código real y funcional, solo que todavía no desplegado en la instancia de la app de cada organización.

Un ejemplo realista

Supongamos que el chatbot de OpenTechnologyApp de un equipo pequeño atiende unas 100 preguntas al día. La mayoría son verificaciones de estado rápidas: "qué está atrasado," "quién está asignado a esto." Un puñado cada día es genuinamente complejo: "reorganiza estos 40 elementos en tres proyectos y explica tu razonamiento." Enrutar todo a un modelo premium cobra tarifas premium por las 90 y tantas preguntas simples que no lo necesitaban. Dividir el tráfico —modelo barato para las verificaciones rápidas, modelo premium para el puñado genuinamente difícil— reduce sustancialmente la factura de IA mientras mantiene las preguntas difíciles respondidas por el modelo mejor equipado para ellas.

Pruébalo

Si eres administrador en una organización de OpenTechnologyApp, busca "Org AI — Routing Config" en tu configuración de administrador. La guía de configuración recorre la pantalla real campo por campo, con una configuración mínima funcional para empezar si prefieres no ajustar nada el primer día.

Ponte en contacto

¿Te interesa un tema? Déjame una nota y elige una categoría. También estoy disponible para una reunión de consultoría gratuita: escríbeme y lo organizamos.