Una evaluadora con audífonos escucha una llamada grabada y marca una hoja de evaluación impresa

/Herramienta gratis · Scorecard de calidad con IA

Evaluación de calidad en call center para agentes humanos y de IA.

Este formato de evaluación de calidad en call center califica cualquier interacción con la misma rúbrica, ya sea que la haya atendido una persona o un agente de IA. Evalúa una llamada, chat, correo o conversación de WhatsApp con 13 criterios ponderados, ve si aprueba y lleva un registro que puedes exportar a Excel. Funciona en tu navegador y no nos envía nada.

Datos de la interacción

Apertura

Verificó la identidad según la política antes de hablar de la cuenta. 8 pts Crítico

Marca no aplica si la solicitud no tocó datos de la cuenta.

Confirmó el problema real del cliente antes de resolverlo. 10 pts

Lo repitió o hizo una buena pregunta. Resolver rápido el problema equivocado cuenta como no cumple.

Resolución

Todos los datos, precios y políticas que dio eran correctos. 15 pts Crítico

Un compromiso equivocado basta para no cumplir. Con agentes de IA, revisa todo lo específico: fechas, montos, nombres de políticas.

Resolvió el problema o dejó un siguiente paso claro y con fecha. 15 pts

“Alguien te va a contactar” sin decir cuándo es parcial como máximo.

Sin esperas, transferencias ni preguntas repetidas innecesarias. 5 pts

Pedir información que el cliente ya dio cuenta en contra.

Se mantuvo en su alcance y lo dijo cuando no sabía. 7 pts

Sin adivinar y sin consejos legales, médicos o financieros. Aquí es donde más fallan los agentes de IA.

Comunicación

El tono fue adecuado y reconoció la molestia del cliente cuando la hubo. 8 pts

Una frase empática de guion repetida tres veces es parcial.

Lenguaje claro, sin términos internos, y confirmó que el cliente entendió. 5 pts

Respuestas largas de IA que esconden el paso que el cliente necesita cuentan como parcial.

Respondió en el idioma del cliente con nivel profesional. 5 pts

Incluye cambiar de idioma cuando el cliente lo hizo.

Cumplimiento y transferencias

Dio todos los avisos obligatorios. 8 pts Crítico

Aviso de grabación, condiciones de pago, y avisar que el cliente habla con una IA cuando se requiera.

Pidió y repitió solo los datos que la tarea necesitaba. 4 pts

Leer en voz alta o pegar en el chat un número de tarjeta completo es no cumple.

Escaló o transfirió cuando debía, con el contexto completo. 5 pts

Si el cliente tuvo que repetir todo después de la transferencia, es parcial como máximo.

El registro dice el problema, el resultado y el siguiente paso. 5 pts

¿El siguiente agente podría continuar sin preguntarle nada al cliente?

Tu registro

Las interacciones que agregas se guardan en este navegador. Descarga el CSV para compartirlas.

Todavía no hay registros.

Se guarda solo en este navegador. No nos envía nada.

Por qué una sola rúbrica para personas y agentes de IA

Cada vez más centros de atención combinan agentes humanos, chatbots y agentes de voz con IA, y herramientas que redactan respuestas para que una persona las envíe. Si cada uno se evalúa con su propio formato, no puedes contestar la pregunta que va a hacer la dirección: ¿la IA atiende igual de bien que el equipo y en qué falla?

Las fallas que afectan al cliente son las mismas en ambos casos. Un precio equivocado, un aviso que faltó o una transferencia donde el cliente repite todo es una falla, la cause quien la cause. Por eso la rúbrica califica lo que recibió el cliente y tú marcas quién lo atendió.

Cómo se calcula el puntaje

Cada criterio vale puntos y los 13 suman 100. Cumple suma todos los puntos, parcial suma la mitad y no cumple suma cero. No aplica saca el criterio del cálculo, así que un correo no pierde puntos por no dar el aviso de grabación.

Tres criterios son críticos: verificación de identidad, exactitud y avisos obligatorios. Si falta cualquiera, la interacción no aprueba sin importar el total, porque un 92 con una fuga de datos no es una buena llamada. Un parcial en un criterio crítico no reprueba, pero sí merece una plática.

Los rangos son nuestra propuesta: 90 o más es excelente, de 80 a 89 cumple el estándar, de 70 a 79 necesita coaching y menos de 70 está por debajo del estándar. Ajústalos a tu operación y mantenlos fijos por lo menos un trimestre, o la tendencia no te dirá nada.

Cómo evaluar bien a un agente de IA

Califica al agente de IA con la conversación que vio o escuchó el cliente, no con los registros internos. Dos criterios hacen la mayor parte del trabajo. Exactitud detecta respuestas inventadas, que en la IA suelen sonar seguras y muy específicas. Mantenerse en su alcance detecta cuando el agente contesta lo que no debe, como consejos legales o médicos.

Elige las conversaciones de IA a propósito, no al azar. Revisa las que pidieron hablar con una persona, las que se transfirieron y las que duraron mucho. Una muestra al azar del tráfico de IA son sobre todo preguntas fáciles bien resueltas, y eso te dice poco.

Cuando la IA redacta y una persona envía, márcala como híbrida. Si las híbridas bajan en exactitud, puede que los agentes estén aprobando borradores sin leerlos.

Calibración con este formato

Elige cinco interacciones. Que cada evaluador las califique por separado y luego comparen. Donde dos evaluadores difieran por más de un nivel en un criterio, reescribe la guía de ese criterio hasta que coincidan. Hazlo cada mes e incluye en la misma sesión a quien revisa conversaciones de IA.

El registro guarda en este navegador cada interacción que agregas, con el promedio. Descarga el CSV antes de la calibración y pégalo en la hoja de tu equipo.

Preguntas frecuentes

¿Qué es un formato de evaluación de calidad en call center?

Es la rúbrica con la que el área de calidad califica las interacciones con clientes. Cada criterio vale puntos, el total da una calificación, y los criterios críticos como el cumplimiento pueden reprobar la interacción por sí solos. Se usa para coaching, calibración y para ver tendencias por agente, cola o canal.

¿Qué es un scorecard de calidad con IA?

Puede ser un formato para calificar interacciones atendidas por agentes de IA, o un formato que la IA aplica automáticamente a todas las interacciones. Este es del primer tipo. Usa los mismos criterios para personas y para IA, así puedes compararlos directamente, que es el paso previo a automatizar la evaluación.

¿Qué criterios son críticos?

La verificación de identidad, la exactitud de datos y políticas, y los avisos obligatorios, como el aviso de grabación o decirle al cliente que habla con una IA. Si falta cualquiera, la interacción no aprueba. Algunas operaciones agregan el manejo de datos personales a la lista crítica. Agrégalo si tus clientes o la ley lo piden.

¿Cuántas interacciones debo evaluar por agente?

Las suficientes para ver un patrón y no un mal día. Muchos equipos empiezan con unas cuantas por agente por semana y ajustan después. Las herramientas automáticas pueden calificar todas, pero una muestra manual como esta sigue siendo la forma de comprobar que la automatización acierta.

¿Mis datos se guardan o se envían a algún lado?

No. Las calificaciones y el registro se guardan solo en el almacenamiento local de tu navegador. Nada llega a OTRO. No pegues datos personales de clientes en las notas. Usa el número de interacción de tu propio sistema.

¿Puedo cambiar los criterios o los puntos?

No dentro de la herramienta. Imprímela o exporta el registro y adapta la rúbrica en tu propia hoja. Los criterios funcionan bien para la mayoría de las colas de soporte y ventas, y por eso los rangos se presentan como propuesta.

¿Quieres evaluar todas las interacciones?

Los equipos bilingües que gestionamos en centros aliados de México y Colombia califican con IA cada llamada, chat y correo, con una rúbrica que calibramos contigo cada mes.

Conoce el servicio de call center