Dos anotadores bilingües en una oficina de la Ciudad de México comparan notas sobre una guía de etiquetado impresa, luz de la tarde

/Nearshore · Etiquetado de datos

Etiquetado de datos nearshore, en español y en tu horario.

El etiquetado de datos nearshore pone a quien etiqueta los datos de entrenamiento de tu modelo en México o Colombia, en horarios que comparten casi toda tu jornada. Conviene sobre todo cuando tus datos están en español, cuando mezclan español e inglés y cuando las reglas de etiquetado todavía cambian cada semana. Aquí te explicamos qué tareas encajan, cómo se arma un proyecto, cómo cuidar tus datos y cuándo conviene más el offshore. Para el servicio completo, revisa nuestra página de outsourcing de etiquetado de datos.

Qué es el etiquetado de datos nearshore

Es delegar el etiquetado o la anotación de datos a un equipo en un país cercano que trabaja en tu horario y dentro de tu propia plataforma. El término nació en Estados Unidos. Si tu empresa es mexicana, un equipo en México es local (onshore), Colombia es nearshore, y Filipinas, India o Egipto son offshore.

Desde la Ley de los Husos Horarios, publicada en el DOF en octubre de 2022, casi todo México dejó el horario de verano. La Ciudad de México, Guadalajara y Monterrey se quedan en UTC-6 todo el año; algunas zonas de la frontera norte siguen otro horario. Colombia está en UTC-5 todo el año, una hora adelante de la Ciudad de México.

Con cualquiera de los dos, quien etiqueta y quien entrena el modelo están despiertos al mismo tiempo. Una duda sobre un caso raro se resuelve en una llamada esa misma mañana.

Fuentes: Ley de los Husos Horarios (Cámara de Diputados) Hora legal de Colombia, Instituto Nacional de Metrología

A quién le sirve

Este modelo tiene más sentido para empresas que están construyendo productos con IA para clientes de habla hispana: un chatbot de atención, un clasificador de tickets, un buscador o un modelo que lee documentos en español.

También sirve si tu equipo técnico es chico y no tiene tiempo de etiquetar miles de ejemplos, pero sí de definir las reglas y revisar el resultado. Ese trabajo de etiquetado es el que se delega.

Qué tareas se delegan

Casi cualquier tarea de anotación puede ir nearshore, pero estas son las que más aprovechan el español nativo y el mismo horario:

  • Texto en español: intención, entidades, sentimiento y clasificación de mensajes de clientes reales.
  • Mensajes que mezclan español e inglés en la misma frase, muy comunes en chats y redes sociales.
  • Transcripción de audio en español, con modismos y acentos de México, Colombia y el resto de la región.
  • Evaluación de respuestas de modelos de lenguaje: si la respuesta es correcta, útil y suena natural en español.
  • Relevancia de búsqueda y recomendaciones para mercados latinoamericanos.
  • Proyectos nuevos de cualquier tipo, donde las etiquetas y las reglas todavía cambian.

Por qué importa el español de aquí

El español no es un solo conjunto de datos. Una palabra que en un país es normal en otro es una grosería, y un modelo entrenado con etiquetas de alguien que no conoce la diferencia aprende mal.

Quien etiqueta desde México o Colombia entiende el sarcasmo, el albur, el slang y el cambio de idioma a media frase que una guía traducida nunca menciona. Cuando encuentra un patrón que tus reglas no cubren, te lo explica el mismo día.

Cómo se arma un proyecto

El buen etiquetado es un ciclo, no una entrega. Así lo trabajamos:

  • Guía de etiquetado Tu equipo define cada etiqueta con ejemplos correctos, incorrectos y dudosos. La guía es tuya.
  • Lote piloto Se etiqueta primero un grupo chico y se anotan todas las dudas y diferencias.
  • Calibración El equipo, un revisor líder y tu ingeniero de datos se juntan en llamada para revisar los casos difíciles y ajustar la guía. Con el mismo horario, eso puede pasar varias veces por semana.
  • Preguntas de control Se mezclan en la fila ejemplos con respuesta ya acordada, sin marcarlos, para ver quién se está desviando y en qué etiquetas.
  • Acuerdo entre personas Algunos ejemplos los etiquetan dos o más personas. Si seguido no coinciden, casi siempre la guía no es clara, y se corrige la guía antes de culpar al equipo.
  • Producción El volumen crece solo cuando el piloto cuadra, con un revisor tomando muestras antes de que los datos lleguen a tu entrenamiento.

Seguridad y datos personales

Tus datos no deberían salir de tu control. Lo más seguro es que el equipo trabaje dentro de tu propia plataforma de anotación, no con copias de tus archivos. Deja estas reglas por escrito:

  • Cada persona con su propio usuario y verificación en dos pasos. Nada de usuarios compartidos.
  • Acceso solo a los proyectos que necesita cada quien, y baja del acceso el mismo día que alguien sale.
  • Sin descargas ni capturas de pantalla, bloqueadas desde la configuración cuando tu herramienta lo permite.
  • Nombres, teléfonos y otros datos personales eliminados u ocultos antes de llegar al equipo cuando la tarea no los necesita.

Cuidado del equipo en contenido sensible

Moderar contenido o entrenar un filtro de seguridad implica ver material violento, sexual o de odio. Quien hace ese trabajo necesita protección desde el diseño del proyecto.

Lo acordamos con el centro aliado antes de arrancar: la gente sabe qué tipo de contenido trae la fila antes de aceptarla, el tiempo de exposición por turno tiene límite, hay rotación entre filas sensibles y normales, las imágenes se ven borrosas o en gris por defecto cuando la tarea lo permite y hay apoyo psicológico confidencial. Cualquiera puede salir de una fila sensible sin castigo.

Nearshore frente a onshore y offshore

Si tu empresa es mexicana, onshore es México y nearshore es Colombia. Así se comparan los tres modelos para etiquetado de datos.

Onshore (tu país)Nearshore (país cercano)Offshore (Filipinas, India, Egipto)
Costo relativoDepende del paísMenor que un equipo en EE.UU.El más bajo
Horas compartidas contigoTodasTodas o casi todasPocas, salvo turno nocturno
Cambios a la guíaMismo díaMismo día, muchas veces en llamadaSiguiente turno, por escrito
Datos en españolNativo si estás en MéxicoNativo en México y ColombiaNo conviene
Ideal paraRevisión expertaDatos en español y reglas que cambianFilas grandes, estables y bien definidas

Cuándo conviene más el offshore

El offshore gana cuando la tarea ya es estable, la guía está cerrada y el volumen es muy alto: cajas sobre cientos de miles de imágenes, seguimiento de objetos en video, transcripción en inglés o moderación que corre las 24 horas.

Para datos en español, el offshore casi nunca conviene. Muchas empresas combinan: nearshore para diseñar y calibrar la tarea y para todo lo que es en español, offshore para la fila grande en inglés.

Preguntas frecuentes

¿Qué es el etiquetado de datos nearshore?

Es delegar el etiquetado de los datos con los que entrenas un modelo a un equipo en un país cercano que trabaja en tu horario. El equipo trabaja dentro de tu plataforma con tu guía, y como comparten horario, tu equipo técnico puede resolver dudas en vivo en vez de esperar al día siguiente.

¿Cuál es la diferencia entre etiquetado y anotación de datos?

En la práctica se usan como sinónimos. Algunas personas llaman etiquetado a asignar una categoría a un ejemplo completo y anotación a marcar partes específicas, como una caja en una imagen o una entidad en un texto. Para elegir proveedor, lo que importa es la tarea concreta, no el nombre.

¿Cómo se mide la calidad del etiquetado?

Con controles que tú puedes ver: preguntas de control con respuesta conocida mezcladas en la fila, ejemplos que etiquetan dos o más personas para medir qué tanto coinciden y un revisor que toma muestras. Los resultados te llegan completos, para que tú decidas si los datos sirven para entrenar.

¿Mis datos salen de mi plataforma?

No deberían. El equipo trabaja dentro de la plataforma que tú controlas, con usuarios propios, acceso limitado y descargas bloqueadas cuando tu herramienta lo permite. Los datos personales se eliminan u ocultan antes si la tarea no los necesita. Pide estas reglas en el contrato.

¿Cuánto cuesta el etiquetado de datos nearshore?

Depende del tipo de tarea, el volumen, el idioma, qué tan estable está la guía y cuánta revisión quieres, así que cotizamos por alcance. Como orden general, un equipo en México o Colombia cuesta menos que uno en Estados Unidos y más que uno offshore. Suma también el costo de corregir etiquetas mal hechas.

Define el modelo para tu etiquetado

Cuéntanos qué tipo de datos tienes, en qué idiomas, cuánto volumen y en qué plataforma. Te respondemos con un plan por escrito: dónde conviene cada tarea, cómo se calibra el piloto y cómo se revisa la calidad.

Pide tu plan