Una anotadora marca objetos en fotografías de calles en un monitor grande dentro de una oficina tranquila

/Etiquetado de Datos

Etiquetado de datos para IA. Revisado lote por lote.

Un equipo gestionado que etiqueta tus imágenes, textos, audios y documentos con tus reglas, dentro de tus herramientas y con revisión de calidad en cada lote.

Datos de entrenamiento
en los que puedes confiar

Un modelo solo aprende lo que le enseñan sus etiquetas. El etiquetado de datos para IA es el trabajo humano de marcar información en bruto, encerrar cada coche de una foto en un recuadro, señalar los nombres de empresas en un contrato, calificar cuál de dos respuestas de un chatbot es mejor, para que el modelo tenga ejemplos de dónde aprender y un estándar contra el cual medirse.

En vez de cargarle ese trabajo a tus ingenieros o mandarlo a una multitud anónima en internet, lo hace un equipo capacitado y supervisado. Opera desde centros aliados que nosotros elegimos y gestionamos en México y Colombia, y trabaja en tu plataforma de etiquetado con tus guías.

Tú conservas los datos, las guías y la última palabra sobre qué es una etiqueta correcta. Nosotros nos encargamos de la gente, la capacitación, la revisión de calidad y la retroalimentación que mantiene las etiquetas parejas conforme crece el proyecto.

Lo que entregamos

Imágenes y Video

Recuadros, polígonos, segmentación, puntos clave y seguimiento de objetos cuadro por cuadro.

Texto

Clasificación, sentimiento, intención y etiquetado de entidades en español y en inglés.

Transcripción de Audio

Transcripción, identificación de quién habla y marcas de tiempo, incluido el español con inglés mezclado.

Evaluación de Respuestas de IA

Calificar y ordenar respuestas de modelos, juzgar la relevancia de búsquedas y redactar respuestas de referencia.

Extracción de Documentos

Sacar datos de facturas, CFDI, formularios, tickets y contratos, y etiquetar su estructura para modelos de documentos.

Moderación de Contenido

Revisar y etiquetar contenido de usuarios según tus políticas, con apoyo de bienestar dentro del horario.

Cómo funciona

01

Alcance y Guías

Revisamos tus datos, tus etiquetas y los casos dudosos, y te ayudamos a convertirlos en guías escritas con ejemplos.

02

Equipo y Accesos

Elegimos etiquetadores para la tarea y el idioma, firman confidencialidad y les damos usuarios nominales en tu plataforma.

03

Lote Piloto

El equipo etiqueta un lote chico, tú lo revisas y corregimos las guías donde cada quien las entendió distinto.

04

Calibración y Arranque

Cada persona se mide contra tus ejemplos de referencia antes de entrar a producción, y luego sube el volumen.

05

Revisión Continua

Revisiones por muestreo, comparación entre etiquetadores y una junta semanal de desacuerdos que alimenta las guías.

Qué incluye el etiquetado de datos

Etiquetar es cualquier tarea en la que una persona agrega la respuesta que el modelo debe aprender. Según el tipo de dato cambian las herramientas y las habilidades, pero el trabajo es el mismo: aplicar una regla escrita igual, miles de veces, y avisar cuando aparece un caso que la regla no cubre.

Casi todos los proyectos caen en alguno de estos grupos:

  • Imágenes y video: recuadros, polígonos y segmentación a nivel de pixel para visión por computadora, y seguimiento de objetos de un cuadro a otro.
  • Texto: clasificar mensajes por tema o intención, marcar nombres, lugares, productos y montos, y señalar sentimiento o tono.
  • Audio: transcribir, identificar quién habla y cuándo, y marcar ruido de fondo o cambios de idioma.
  • Relevancia de búsqueda y evaluación de respuestas: juzgar si un resultado contesta la búsqueda, ordenar dos o más respuestas de una IA y redactar mejores. Es la retroalimentación humana con la que se ajustan los asistentes de IA, lo que en inglés llaman RLHF.
  • Documentos: sacar datos de facturas, CFDI, formularios y contratos, y etiquetar la estructura de la página para que el modelo aprenda dónde está cada cosa.
  • Moderación de contenido: etiquetar publicaciones, imágenes o videos según una política de seguridad, para moderar en vivo o para entrenar un clasificador.

Cómo corre un proyecto de etiquetado

Empieza por las guías. Cada etiqueta necesita una definición escrita, ejemplos de lo que sí cuenta y lo que no, y una regla para los casos difíciles. Las guías vagas son la razón más común de que las etiquetas salgan disparejas, por eso la primera semana la dedicamos a eso contigo.

Luego, un lote piloto. El equipo etiqueta una muestra chica y tú la revisas. Los desacuerdos enseñan dónde las guías no son claras, y corregirlas en ese momento sale mucho más barato que volver a etiquetar después.

Antes de tocar datos de producción, cada persona pasa una calibración: etiqueta un grupo de ejemplos de referencia cuya respuesta correcta ya acordaste tú. Esos ejemplos siguen apareciendo en la fila de trabajo, así que si alguien se desvía, se nota pronto.

También medimos qué tanto coinciden los etiquetadores entre sí. Dicho fácil: le damos los mismos datos a dos o más personas y vemos qué tan seguido llegan a la misma etiqueta. Si coinciden poco en una etiqueta, casi siempre es que la regla no está clara, no que alguien esté trabajando mal, y eso se corrige en las guías en la revisión semanal.

Seguridad y manejo de la información

El trabajo se hace en tus sistemas o en la plataforma de etiquetado que tú elijas, no en copias de tus datos. Cada etiquetador tiene su propio usuario, solo con los proyectos que necesita, y pierde el acceso el día que sale del proyecto.

Todas las personas del equipo firman un acuerdo de confidencialidad antes de ver un solo dato. La información no sale de los sistemas aprobados: nada de descargas a equipos personales, capturas de pantalla ni herramientas externas. Si los datos incluyen información personal, acordamos contigo desde el inicio cómo se oculta, quién la puede ver y qué pasa con ella al terminar el proyecto, y lo dejamos por escrito en el contrato.

Equipo gestionado o plataforma de crowdsourcing

Las plataformas de crowdsourcing reparten tu trabajo entre muchas personas anónimas. Arrancan rápido y sirven para tareas sencillas y de mucho volumen con respuestas claras, donde puedes tolerar algo de ruido y filtrarlo repitiendo cada tarea.

Un equipo gestionado conviene cuando la tarea pide criterio, capacitación o contexto: textos médicos o legales, guías largas, evaluación de respuestas de IA, contenido bilingüe o cualquier cosa delicada. Las mismas personas se quedan en tu proyecto, aprenden tus casos difíciles y les puedes preguntar por qué etiquetaron algo de cierta forma. Además sabes quién vio tus datos.

Muchas empresas usan las dos cosas: la multitud para el volumen fácil y un equipo gestionado para los casos difíciles, la revisión de calidad y los ejemplos de referencia.

La moderación de contenido necesita un plan de bienestar

Etiquetar contenido dañino le pega a quien lo hace. Si tu proyecto incluye material violento, sexual o de abuso, el plan tiene que contemplarlo desde el principio, no cuando alguien ya está quemado.

Acordamos contigo cuánto tiempo de exposición tiene cada persona por turno, rotamos entre filas de contenido dañino y neutro, usamos difuminado o blanco y negro cuando la herramienta lo permite, y antes de empezar acordamos qué apoyo psicológico ofrece el centro aliado y cómo se puede pedir no trabajar las categorías más duras. Es lo correcto con las personas, y además mantiene el criterio parejo durante meses.

Nearshore u offshore para etiquetar datos

Nearshore, en México y Colombia, conviene cuando el trabajo cambia seguido y necesita ida y vuelta rápida con tu equipo técnico en horario de oficina: guías nuevas, lotes piloto, evaluación de respuestas donde surgen dudas sobre la marcha. También es la opción natural para datos en español o bilingües, etiquetados por hablantes nativos que saben cómo escriben y hablan de verdad los usuarios en Latinoamérica.

Offshore, en Filipinas, India y Egipto, conviene para filas grandes y estables con guías ya definidas, donde lo que entregas al final del día regresa etiquetado a la mañana siguiente. Cuesta menos que nearshore, y nearshore cuesta menos que un equipo en Estados Unidos. Muchos proyectos combinan los dos: guías y casos difíciles en nearshore, volumen constante en offshore.

Preguntas para un proveedor de etiquetado de datos

  1. Pregunta cómo miden la calidad. Lo que buscas son ejemplos de referencia, comparación entre etiquetadores y una revisión periódica de desacuerdos, no un solo porcentaje en una presentación.
  2. Pregunta quiénes etiquetan. Averigua si las mismas personas capacitadas se quedan en tu proyecto o si el trabajo se va a quien esté conectado en ese momento.
  3. Pregunta dónde viven los datos. La mejor respuesta es: en tu plataforma, con usuarios nominales y sin copias fuera de ella.
  4. Pregunta qué pasa cuando cambian las guías. Un buen proveedor vuelve a capacitar, vuelve a calibrar y te dice qué etiquetas se hicieron con la regla anterior.
  5. Pregunta cómo manejan la moderación. Si la respuesta no menciona límites de exposición y apoyo para el equipo, busca en otro lado.

Preguntas frecuentes

¿Qué es el etiquetado de datos para IA?

Es el trabajo humano de agregarle a tus datos la respuesta que un modelo debe aprender: una categoría, un recuadro alrededor de un objeto, una transcripción o una calificación. Con esos ejemplos el modelo se entrena y se evalúa. Si las etiquetas son disparejas, el modelo aprende esa misma inconsistencia, por eso la revisión de calidad importa tanto como el volumen.

¿Es lo mismo anotación de datos que etiquetado de datos?

En la práctica, sí. Las dos expresiones significan agregar la información de la que el modelo va a aprender. Algunos equipos dicen anotación para marcas más detalladas, como segmentación o entidades dentro de un texto, y etiquetado para categorías simples, pero proveedores y clientes usan los dos términos como sinónimos.

¿En qué herramientas trabaja el equipo?

En la que tú uses. La mayoría de los proyectos corre en la plataforma del cliente, sea una herramienta comercial, una de código abierto o una que hizo tu propio equipo. Cada etiquetador tiene su propio usuario, solo con los proyectos que necesita. Si todavía no tienes herramienta, revisamos las opciones contigo, pero la decisión y la cuenta son tuyas.

¿Pueden etiquetar datos en español y bilingües?

Sí, y es una de las principales razones para hacerlo nearshore. Los equipos en México y Colombia son hablantes nativos de español que también trabajan en inglés, así que pueden marcar la intención de un mensaje de un cliente, transcribir audio que mezcla los dos idiomas o calificar una respuesta de IA en español por su tono además de por su contenido.

¿Cómo mantienen parejas las etiquetas?

Con guías claras, un lote piloto, una calibración con ejemplos de referencia antes de entrar a producción y revisiones constantes de qué tanto coinciden los etiquetadores entre sí. Los desacuerdos se revisan cada semana y se convierten en ajustes a las guías. Cuando cambia una regla, el equipo se vuelve a capacitar y te avisamos qué etiquetas se hicieron con la versión anterior.

¿Cómo se cotiza un proyecto de etiquetado?

Normalmente por hora de trabajo o por dato etiquetado, según qué tan predecible sea la tarea. El precio cambia con el tipo de dato, el tiempo que toma cada uno, cuánta revisión necesitas, el idioma y el modelo de operación: nearshore cuesta más que offshore, y un equipo en Estados Unidos cuesta más que los dos. Cotizamos cuando ya vimos una muestra de tus datos y tus guías.

Mándanos una muestra
de tus datos.

Cuéntanos qué tipo de datos tienes, qué etiquetas necesitas y más o menos cuánto volumen. Te respondemos en 24 horas con el equipo que armaríamos y cómo sería el lote piloto.

Pedir propuesta