Por qué una sola rúbrica para personas y agentes de IA
Cada vez más centros de atención combinan agentes humanos, chatbots y agentes de voz con IA, y herramientas que redactan respuestas para que una persona las envíe. Si cada uno se evalúa con su propio formato, no puedes contestar la pregunta que va a hacer la dirección: ¿la IA atiende igual de bien que el equipo y en qué falla?
Las fallas que afectan al cliente son las mismas en ambos casos. Un precio equivocado, un aviso que faltó o una transferencia donde el cliente repite todo es una falla, la cause quien la cause. Por eso la rúbrica califica lo que recibió el cliente y tú marcas quién lo atendió.
Cómo se calcula el puntaje
Cada criterio vale puntos y los 13 suman 100. Cumple suma todos los puntos, parcial suma la mitad y no cumple suma cero. No aplica saca el criterio del cálculo, así que un correo no pierde puntos por no dar el aviso de grabación.
Tres criterios son críticos: verificación de identidad, exactitud y avisos obligatorios. Si falta cualquiera, la interacción no aprueba sin importar el total, porque un 92 con una fuga de datos no es una buena llamada. Un parcial en un criterio crítico no reprueba, pero sí merece una plática.
Los rangos son nuestra propuesta: 90 o más es excelente, de 80 a 89 cumple el estándar, de 70 a 79 necesita coaching y menos de 70 está por debajo del estándar. Ajústalos a tu operación y mantenlos fijos por lo menos un trimestre, o la tendencia no te dirá nada.
Cómo evaluar bien a un agente de IA
Califica al agente de IA con la conversación que vio o escuchó el cliente, no con los registros internos. Dos criterios hacen la mayor parte del trabajo. Exactitud detecta respuestas inventadas, que en la IA suelen sonar seguras y muy específicas. Mantenerse en su alcance detecta cuando el agente contesta lo que no debe, como consejos legales o médicos.
Elige las conversaciones de IA a propósito, no al azar. Revisa las que pidieron hablar con una persona, las que se transfirieron y las que duraron mucho. Una muestra al azar del tráfico de IA son sobre todo preguntas fáciles bien resueltas, y eso te dice poco.
Cuando la IA redacta y una persona envía, márcala como híbrida. Si las híbridas bajan en exactitud, puede que los agentes estén aprobando borradores sin leerlos.
Calibración con este formato
Elige cinco interacciones. Que cada evaluador las califique por separado y luego comparen. Donde dos evaluadores difieran por más de un nivel en un criterio, reescribe la guía de ese criterio hasta que coincidan. Hazlo cada mes e incluye en la misma sesión a quien revisa conversaciones de IA.
El registro guarda en este navegador cada interacción que agregas, con el promedio. Descarga el CSV antes de la calibración y pégalo en la hoja de tu equipo.
Preguntas frecuentes
¿Qué es un formato de evaluación de calidad en call center?
Es la rúbrica con la que el área de calidad califica las interacciones con clientes. Cada criterio vale puntos, el total da una calificación, y los criterios críticos como el cumplimiento pueden reprobar la interacción por sí solos. Se usa para coaching, calibración y para ver tendencias por agente, cola o canal.
¿Qué es un scorecard de calidad con IA?
Puede ser un formato para calificar interacciones atendidas por agentes de IA, o un formato que la IA aplica automáticamente a todas las interacciones. Este es del primer tipo. Usa los mismos criterios para personas y para IA, así puedes compararlos directamente, que es el paso previo a automatizar la evaluación.
¿Qué criterios son críticos?
La verificación de identidad, la exactitud de datos y políticas, y los avisos obligatorios, como el aviso de grabación o decirle al cliente que habla con una IA. Si falta cualquiera, la interacción no aprueba. Algunas operaciones agregan el manejo de datos personales a la lista crítica. Agrégalo si tus clientes o la ley lo piden.
¿Cuántas interacciones debo evaluar por agente?
Las suficientes para ver un patrón y no un mal día. Muchos equipos empiezan con unas cuantas por agente por semana y ajustan después. Las herramientas automáticas pueden calificar todas, pero una muestra manual como esta sigue siendo la forma de comprobar que la automatización acierta.
¿Mis datos se guardan o se envían a algún lado?
No. Las calificaciones y el registro se guardan solo en el almacenamiento local de tu navegador. Nada llega a OTRO. No pegues datos personales de clientes en las notas. Usa el número de interacción de tu propio sistema.
¿Puedo cambiar los criterios o los puntos?
No dentro de la herramienta. Imprímela o exporta el registro y adapta la rúbrica en tu propia hoja. Los criterios funcionan bien para la mayoría de las colas de soporte y ventas, y por eso los rangos se presentan como propuesta.