Descripción
**¿QUÉ NOS HACE UN EXCELENTE LUGAR PARA TRABAJAR?**
---------------------------------------
Estamos orgullosos de ser reconocidos de forma constante como uno de los mejores lugares para trabajar del mundo. Actualmente somos la firma de consultoría mejor clasificada en la lista de Glassdoor de los Mejores Lugares para Trabajar y hemos ocupado el puesto número 1 en general un récord de siete veces. Equipos extraordinarios son el núcleo de nuestra estrategia empresarial, pero estos no surgen por casualidad. Requieren un enfoque intencional para reunir un amplio espectro de antecedentes, culturas, experiencias, perspectivas y habilidades en un entorno laboral solidario e inclusivo. Contratamos personas con talento excepcional y creamos un entorno en el que cada individuo pueda prosperar tanto profesional como personalmente.
**¿CON QUIÉN TRABAJARÁS?**
------------------------
### **Acerca de Coro℠**
La unidad de negocio Coro℠ reúne el conjunto propio de herramientas de software como servicio (SaaS) y datos como servicio (DaaS) de Bain, incluidos software basados en la nube, evaluaciones en línea de capacidades y análisis avanzados, centrados en habilitar la Excelencia Comercial para empresas B2B.
Trabajarás estrechamente con científicos de datos, ingenieros de datos e ingenieros de software para desarrollar enfoques sofisticados de resolución de entidades a gran escala. Tu enfoque estará en la experimentación y la calidad de los modelos, mientras que tus socios de ingeniería ayudarán a llevar los enfoques exitosos a producción.
**TU ROL DENTRO DEL EQUIPO**
------------------------------------
Como Científico de Datos Aplicado Senior, te centrarás en uno de los problemas más desafiantes en datos a gran escala: determinar cuándo registros procedentes de distintas fuentes hacen referencia a la misma empresa del mundo real.
Desarrollarás y probarás enfoques basados en aprendizaje automático, incrustaciones (embeddings) y modelos de lenguaje grande (LLM) que mejoren cómo coincidimos y resolvemos datos complejos de entidades. Explorarás hasta qué punto las técnicas emergentes basadas en modelos fundamentales pueden mejorar la calidad de las coincidencias, garantizando al mismo tiempo que las soluciones sigan siendo prácticas, escalables y rentables para cientos de millones de entidades.
Este es un puesto altamente aplicado, en el que tendrás la oportunidad de experimentar con técnicas emergentes de inteligencia artificial, medir su impacto y colaborar con equipos de ingeniería para transformar las ideas más prometedoras en soluciones escalables.
**LO QUE HARÁS**
------------------
### **Desarrollar una Coincidencia Inteligente de Entidades**
* Construir y evaluar enfoques basados en aprendizaje automático, incrustaciones (embeddings) y modelos de lenguaje grande (LLM) para la resolución de entidades
* Mejorar la forma en que nuestros sistemas gestionan datos complejos y desordenados, incluidas variaciones de nombres, alias, dominios, sitios web, atributos firmográficos, registros multilingües y jerarquías de datos
* Desarrollar enfoques de puntuación y clasificación que distingan coincidencias genuinas de parecidos, duplicados y entidades no relacionadas
* Evaluar técnicas de inteligencia artificial y aprendizaje automático equilibrando precisión, escalabilidad y costo
* Diseñar soluciones para uso a gran escala, identificando dónde los modelos sofisticados aportan valor y dónde enfoques más eficientes pueden lograr resultados comparables
### **Mejorar la Experimentación y la Calidad de los Modelos**
* Desarrollar enfoques sólidos para medir la calidad de las coincidencias, incluidas precisión, exhaustividad, falsos positivos, falsos negativos, confianza, cobertura y requisitos de revisión manual
* Ayudar a construir conjuntos de datos de referencia fiables para comparar nuevos enfoques con métodos existentes de coincidencia antes de su implementación en producción
* Explorar revisiones y validaciones asistidas por modelos de lenguaje grande (LLM), tanto como técnica de coincidencia como como referencia para enfoques más escalables
* Traducir desafíos ambiguos de coincidencia en hipótesis claras, experimentos, métricas y recomendaciones
* Realizar análisis detallados de errores para comprender el comportamiento del modelo e identificar oportunidades de mejora
### **Llevar los Enfoques Exitosos a Producción**
* Colaborar estrechamente con ingenieros de datos y de software para convertir prototipos prometedores en soluciones de coincidencia listas para producción
* Proporcionar especificaciones claras del modelo, comportamientos esperados, resultados de evaluación, casos límite y criterios de lanzamiento
* Ayudar a determinar las técnicas adecuadas de coincidencia para distintos niveles de datos, niveles de confianza y perfiles de costo
* Medir el impacto, diagnosticar regresiones y recomendar mejoras en los modelos y la lógica de coincidencia
* Comunicar claramente los compromisos entre calidad del modelo, escala, costo, latencia, explicabilidad y riesgo operativo
**ACERCA DE TI**
-------------
### **Cualificaciones Requeridas**
* Entre 5 y 8 años de experiencia profesional relevante en ciencia de datos aplicada, aprendizaje automático o campo relacionado
* Sólida experiencia práctica en aprendizaje automático, incluida experiencia directa construyendo y evaluando modelos con datos del mundo real
* Excelentes habilidades en Python y SQL
* Experiencia práctica con incrustaciones (embeddings), similitud semántica, modelos de lenguaje grande (LLM) o técnicas de IA relacionadas
* Experiencia práctica entrenando modelos supervisados y no supervisados, incluidas aplicaciones de clasificación y procesamiento del lenguaje natural (PLN)
* Conocimientos prácticos de redes neuronales y arquitecturas de transformadores
* Experiencia con marcos de aprendizaje automático como TensorFlow, PyTorch o PyCaret
* Experiencia reentrenando clasificadores taxonómicos o manteniendo modelos de clasificación en producción
* Firme criterio experimental, incluida la capacidad de definir líneas base, métricas de evaluación, conjuntos de prueba y análisis de errores
* Capacidad para explicar claramente el comportamiento del modelo, los compromisos técnicos y los casos límite a partes interesadas de ingeniería y negocios
### **Cualificaciones Preferidas**
* Experiencia en resolución de entidades, vinculación de registros, desduplicación o problemas similares de coincidencia
* Experiencia en clasificación, puntuación de similitud, recuperación, agrupamiento (clustering) o técnicas de generación de candidatos
* Experiencia aplicando modelos de lenguaje grande (LLM) o incrustaciones (embeddings) a problemas empresariales a gran escala donde el rendimiento, la escalabilidad y el costo son consideraciones importantes
* Exposición a plataformas de datos a gran escala como Spark, Snowflake, Databricks o BigQuery
* Familiaridad con datos empresariales, de dominio, de sitios web, firmográficos u otros datos relacionados con entidades comerciales