Qué incluye el etiquetado de datos
Etiquetar es cualquier tarea en la que una persona agrega la respuesta que el modelo debe aprender. Según el tipo de dato cambian las herramientas y las habilidades, pero el trabajo es el mismo: aplicar una regla escrita igual, miles de veces, y avisar cuando aparece un caso que la regla no cubre.
Casi todos los proyectos caen en alguno de estos grupos:
- Imágenes y video: recuadros, polígonos y segmentación a nivel de pixel para visión por computadora, y seguimiento de objetos de un cuadro a otro.
- Texto: clasificar mensajes por tema o intención, marcar nombres, lugares, productos y montos, y señalar sentimiento o tono.
- Audio: transcribir, identificar quién habla y cuándo, y marcar ruido de fondo o cambios de idioma.
- Relevancia de búsqueda y evaluación de respuestas: juzgar si un resultado contesta la búsqueda, ordenar dos o más respuestas de una IA y redactar mejores. Es la retroalimentación humana con la que se ajustan los asistentes de IA, lo que en inglés llaman RLHF.
- Documentos: sacar datos de facturas, CFDI, formularios y contratos, y etiquetar la estructura de la página para que el modelo aprenda dónde está cada cosa.
- Moderación de contenido: etiquetar publicaciones, imágenes o videos según una política de seguridad, para moderar en vivo o para entrenar un clasificador.
Cómo corre un proyecto de etiquetado
Empieza por las guías. Cada etiqueta necesita una definición escrita, ejemplos de lo que sí cuenta y lo que no, y una regla para los casos difíciles. Las guías vagas son la razón más común de que las etiquetas salgan disparejas, por eso la primera semana la dedicamos a eso contigo.
Luego, un lote piloto. El equipo etiqueta una muestra chica y tú la revisas. Los desacuerdos enseñan dónde las guías no son claras, y corregirlas en ese momento sale mucho más barato que volver a etiquetar después.
Antes de tocar datos de producción, cada persona pasa una calibración: etiqueta un grupo de ejemplos de referencia cuya respuesta correcta ya acordaste tú. Esos ejemplos siguen apareciendo en la fila de trabajo, así que si alguien se desvía, se nota pronto.
También medimos qué tanto coinciden los etiquetadores entre sí. Dicho fácil: le damos los mismos datos a dos o más personas y vemos qué tan seguido llegan a la misma etiqueta. Si coinciden poco en una etiqueta, casi siempre es que la regla no está clara, no que alguien esté trabajando mal, y eso se corrige en las guías en la revisión semanal.
Seguridad y manejo de la información
El trabajo se hace en tus sistemas o en la plataforma de etiquetado que tú elijas, no en copias de tus datos. Cada etiquetador tiene su propio usuario, solo con los proyectos que necesita, y pierde el acceso el día que sale del proyecto.
Todas las personas del equipo firman un acuerdo de confidencialidad antes de ver un solo dato. La información no sale de los sistemas aprobados: nada de descargas a equipos personales, capturas de pantalla ni herramientas externas. Si los datos incluyen información personal, acordamos contigo desde el inicio cómo se oculta, quién la puede ver y qué pasa con ella al terminar el proyecto, y lo dejamos por escrito en el contrato.
Equipo gestionado o plataforma de crowdsourcing
Las plataformas de crowdsourcing reparten tu trabajo entre muchas personas anónimas. Arrancan rápido y sirven para tareas sencillas y de mucho volumen con respuestas claras, donde puedes tolerar algo de ruido y filtrarlo repitiendo cada tarea.
Un equipo gestionado conviene cuando la tarea pide criterio, capacitación o contexto: textos médicos o legales, guías largas, evaluación de respuestas de IA, contenido bilingüe o cualquier cosa delicada. Las mismas personas se quedan en tu proyecto, aprenden tus casos difíciles y les puedes preguntar por qué etiquetaron algo de cierta forma. Además sabes quién vio tus datos.
Muchas empresas usan las dos cosas: la multitud para el volumen fácil y un equipo gestionado para los casos difíciles, la revisión de calidad y los ejemplos de referencia.
La moderación de contenido necesita un plan de bienestar
Etiquetar contenido dañino le pega a quien lo hace. Si tu proyecto incluye material violento, sexual o de abuso, el plan tiene que contemplarlo desde el principio, no cuando alguien ya está quemado.
Acordamos contigo cuánto tiempo de exposición tiene cada persona por turno, rotamos entre filas de contenido dañino y neutro, usamos difuminado o blanco y negro cuando la herramienta lo permite, y antes de empezar acordamos qué apoyo psicológico ofrece el centro aliado y cómo se puede pedir no trabajar las categorías más duras. Es lo correcto con las personas, y además mantiene el criterio parejo durante meses.
Nearshore u offshore para etiquetar datos
Nearshore, en México y Colombia, conviene cuando el trabajo cambia seguido y necesita ida y vuelta rápida con tu equipo técnico en horario de oficina: guías nuevas, lotes piloto, evaluación de respuestas donde surgen dudas sobre la marcha. También es la opción natural para datos en español o bilingües, etiquetados por hablantes nativos que saben cómo escriben y hablan de verdad los usuarios en Latinoamérica.
Offshore, en Filipinas, India y Egipto, conviene para filas grandes y estables con guías ya definidas, donde lo que entregas al final del día regresa etiquetado a la mañana siguiente. Cuesta menos que nearshore, y nearshore cuesta menos que un equipo en Estados Unidos. Muchos proyectos combinan los dos: guías y casos difíciles en nearshore, volumen constante en offshore.
Preguntas para un proveedor de etiquetado de datos
- Pregunta cómo miden la calidad. Lo que buscas son ejemplos de referencia, comparación entre etiquetadores y una revisión periódica de desacuerdos, no un solo porcentaje en una presentación.
- Pregunta quiénes etiquetan. Averigua si las mismas personas capacitadas se quedan en tu proyecto o si el trabajo se va a quien esté conectado en ese momento.
- Pregunta dónde viven los datos. La mejor respuesta es: en tu plataforma, con usuarios nominales y sin copias fuera de ella.
- Pregunta qué pasa cuando cambian las guías. Un buen proveedor vuelve a capacitar, vuelve a calibrar y te dice qué etiquetas se hicieron con la regla anterior.
- Pregunta cómo manejan la moderación. Si la respuesta no menciona límites de exposición y apoyo para el equipo, busca en otro lado.