• Tecnología

Por qué los pilotos que utilizan la IA se topan con el obstáculo de la confianza, y no con el de la capacidad

  • Felix Rose-Collins
  • 4 min read

Introducción

La mayoría de las empresas que prueban la IA para la atención al cliente se topan con el mismo obstáculo. El sistema funciona bien durante semanas. Luego, le da a un cliente una respuesta segura, pero totalmente errónea. Quizá sobre el plazo de devolución. Quizá sobre una política que cambió el trimestre pasado. Alguien de alto rango se da cuenta y la implantación, que estaba destinada a cubrir la mayor parte de la cola, se paraliza silenciosamente al llegar a una pequeña parte de ella.

Los datos del sector confirman lo habitual que es este patrón. El Informe Mundial de Calidad 2025 de OpenText, Capgemini y Sogeti reveló que las preocupaciones sobre la fiabilidad y las «alucinaciones» eran uno de los principales obstáculos para la adopción de la IA en el 60 % de las organizaciones encuestadas. Otro estudio de Gong reveló que el 58 % de las empresas había paralizado proyectos de IA y que casi la mitad de la inversión prevista en IA se veía frenada por problemas de confianza, más que por cuestiones presupuestarias. Las herramientas son capaces. Lo que se queda atrás es la confianza en ellas.

Las matemáticas que hay detrás de una respuesta errónea

El trabajo de atención al cliente es asimétrico, en el sentido de que penaliza la precisión media como métrica. Una respuesta correcta ahorra unos minutos. Una respuesta errónea puede aprobar un reembolso que nunca debería haberse realizado, inventar una política que nunca existió o asumir un compromiso que nadie autorizó. Cuando el inconveniente de un solo error supera las ventajas de cien respuestas correctas, optimizar para el caso medio es un objetivo totalmente erróneo.

También hay un coste más sutil. Un responsable de atención al cliente que descubre que la IA se ha equivocado una vez empieza a comprobarlo todo dos veces a partir de ese momento, lo que anula la mayor parte del tiempo que se suponía que iba a ahorrar. La confianza no se mide por cada conversación. Se acumula o se derrumba, y una vez que se derrumba, los equipos dejan de confiar en el sistema incluso cuando este acierta la mayoría de las veces.

Las alucinaciones no desaparecen, se gestionan

Incluso los modelos de lenguaje más sólidos inventan información en las condiciones adecuadas, y las cifras reales son más altas de lo que la mayoría de la gente supone. En el resumen basado en fuentes, que es esencialmente la misma tarea que responder a partir de tus propios documentos de ayuda, la clasificación de alucinaciones de Vectara sitúa a los mejores modelos en torno al 3 % y muestra que los modelos insignia más conocidos se agrupan entre el 6 % y el 15 %. Algunos modelos que requieren un razonamiento complejo superan el 20 % en esa misma tarea, ya que un razonamiento más profundo les da más margen para introducir afirmaciones que el texto original nunca hizo. Si se somete a un modelo a preguntas abiertas sin ningún punto de referencia, las cifras empeoran considerablemente. Investigadores de Stanford descubrieron que los modelos líderes producían alucinaciones en la gran mayoría de las preguntas jurídicas específicas cuando no se proporcionaba ningún documento de referencia.

Nada de esto significa que ningún modelo en concreto sea malo. Significa que ningún modelo, por sí solo, es lo suficientemente fiable como para presentarlo a clientes de pago sin que haya algo que lo supervise.

La inteligencia y el control tiran en direcciones opuestas

Existe una razón estructural por la que un único modelo no puede resolver esto por sí solo. A medida que un sistema mejora en el manejo de casos ambiguos o desconocidos, también se vuelve más difícil de predecir por completo, ya que el mismo razonamiento que le permite manejar un caso para el que nadie ha escrito un guion es el que, en ocasiones, le lleva a lugares a los que no debería ir. Un modelo más capaz no es automáticamente más seguro. Esa disyuntiva es la razón por la que la fiabilidad debe diseñarse como una capa que rodea al modelo, en lugar de esperarse del modelo por sí mismo.

Aissist aborda esto con cuatro técnicas en capas en lugar de una sola. La ingeniería de prompts establece las reglas básicas que sigue cada tarea, lo cual cobra mayor importancia en un sistema agentivo en el que una sola solicitud de un cliente puede expandirse en más de una docena de subtareas que deben respetar las mismas barreras de seguridad. Un paso de refuerzo ejecuta las decisiones inciertas más de una vez y se queda con la respuesta en la que coinciden la mayoría de los agentes, a costa de un esfuerzo computacional adicional. Una ronda de autoinspección hace que el sistema revise su propio resultado, o lo remita a un segundo modelo con una función diferente, antes de que nada llegue al cliente. Y una capa de gobernanza apilada se sitúa por encima de todo ello, comprobando si un resultado o una acción se ajusta a la política antes de que se publique, funcionando menos como un filtro y más como un supervisor de todo el sistema.

Esa combinación es la que permite a la plataforma mantener su tasa de error de IA por debajo del 1 %, una cifra que merece la pena destacar, sobre todo porque muy pocos proveedores de este sector la publican.

Saber cuándo no responder

El comportamiento más valioso de un agente de atención al cliente no es responder correctamente a más preguntas, sino reconocer cuáles no debe intentar responder por sí solo. Un sistema que deriva rápidamente una disputa de facturación complicada, con todo el contexto adjunto, causa mucho menos daño que uno que sigue adelante y se limita a adivinar. Esto es también lo que distingue a un agente que describe una solución de uno que realmente la aplica: recuperando el pedido, realizando el cambio y confirmándoselo al cliente.

La fiabilidad hay que mantenerla, no solo crearla

Un sistema que sea preciso el día de su lanzamiento no seguirá siéndolo si no hay alguien que lo supervise. Los productos cambian, las políticas se actualizan y las preguntas que plantean los clientes evolucionan con ellos. La medición continua capta esa evolución en forma de datos, en lugar de como una oleada de quejas, y un ciclo disciplinado de evaluación, prueba y lanzamiento sigue subsanando las deficiencias que detecta, con una persona que sigue dando el visto bueno antes de que se produzca cualquier cambio real.

Qué hay que comprobar realmente antes de confiar en un proveedor

Cualquier proveedor que afirme que su IA nunca se equivoca debe ser visto con recelo, ya que suele significar que nadie está midiendo con la suficiente precisión como para saber lo contrario. Los que merecen ser tomados en serio publican una tasa de error, explican exactamente cómo detectan los errores antes de que los clientes los vean y son transparentes sobre cuándo el sistema pasa el relevo a una persona en lugar de limitarse a adivinar. Ese es un argumento de venta muy diferente al de «confía en la IA», y es el que realmente se sostiene cuando el volumen real de incidencias lo pone a prueba.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Empieza a usar Ranktracker... ¡Gratis!

Averigüe qué está impidiendo que su sitio web se clasifique.

Crear una cuenta gratuita

O inicia sesión con tus credenciales

Different views of Ranktracker app