Descripción
QUÉ NOS CONVIERTE EN UN EXCELENTE LUGAR PARA TRABAJAR
Nos enorgullece ser reconocidos de forma constante como uno de los mejores lugares del mundo para trabajar. Actualmente somos la firma de consultoría mejor clasificada en la lista de Glassdoor de los Mejores Lugares para Trabajar y hemos ocupado el puesto n.º 1 en general un récord de siete veces. Equipos extraordinarios son el corazón de nuestra estrategia empresarial, pero estos no surgen por casualidad. Requieren una atención intencional para reunir un amplio conjunto de antecedentes, culturas, experiencias, perspectivas y habilidades en un entorno laboral solidario e inclusivo. Contratamos a personas con talento excepcional y creamos un entorno en el que cada individuo pueda prosperar tanto profesional como personalmente.
CON QUIÉN TRABAJARÁS
Acerca de Coro℠
La unidad de negocio Coro℠ reúne el conjunto propio de herramientas de software como servicio (SaaS) y datos como servicio (DaaS) de Bain, incluyendo software basado en la nube, evaluaciones en línea de capacidades y análisis avanzados, centrados en habilitar la Excelencia Comercial para empresas B2B.
Trabajarás estrechamente con científicos de datos, ingenieros de datos e ingenieros de software para desarrollar enfoques sofisticados para la resolución de entidades a gran escala. Tu enfoque estará en la experimentación y la calidad de los modelos, mientras que tus socios de ingeniería ayudarán a llevar los enfoques exitosos a producción.
DÓNDE ENCAJARÁS DENTRO DEL EQUIPO
Como Científico de Datos Aplicado Senior, te centrarás en uno de los problemas más desafiantes en datos a gran escala: determinar cuándo los registros procedentes de distintas fuentes hacen referencia a la misma empresa del mundo real.
Desarrollarás y probarás enfoques basados en aprendizaje automático, incrustaciones (embeddings) y modelos de lenguaje grande (LLM) que mejoren cómo emparejamos y resolvemos datos complejos de entidades. Explorarás hasta qué punto las técnicas emergentes basadas en modelos fundamentales pueden mejorar la calidad del emparejamiento, asegurando al mismo tiempo que las soluciones sigan siendo prácticas, escalables y rentables para cientos de millones de entidades.
Se trata de un puesto altamente aplicado en el que tendrás la oportunidad de experimentar con técnicas emergentes de inteligencia artificial, medir su impacto y colaborar con equipos de ingeniería para convertir las ideas más prometedoras en soluciones escalables.
LO QUE HARÁS
Desarrollar un Emparejamiento Más Inteligente de Entidades
* Construir y evaluar enfoques basados en aprendizaje automático, incrustaciones (embeddings) y modelos de lenguaje grande (LLM) para la resolución de entidades
* Mejorar la forma en que nuestros sistemas gestionan datos complejos y desordenados, incluidas las variaciones de nombres, alias, dominios, sitios web, atributos firmográficos, registros multilingües y jerarquías de datos
* Desarrollar enfoques de puntuación y clasificación que distingan entre coincidencias reales y apariencias similares, duplicados o entidades no relacionadas
* Evaluar técnicas de inteligencia artificial y aprendizaje automático equilibrando precisión, escalabilidad y costo
* Diseñar soluciones para uso a gran escala, identificando dónde los modelos sofisticados aportan valor y dónde enfoques más eficientes pueden lograr resultados comparables
Mejorar la Experimentación y la Calidad de los Modelos
* Desarrollar enfoques sólidos para medir la calidad del emparejamiento, incluyendo precisión, exhaustividad, falsos positivos, falsos negativos, confianza, cobertura y requisitos de revisión manual
* Ayudar a construir conjuntos de datos de referencia fiables para comparar nuevos enfoques con métodos existentes de emparejamiento antes de su implementación en producción
* Explorar revisiones y validaciones asistidas por modelos de lenguaje grande (LLM), tanto como técnica de emparejamiento como como referencia para enfoques más escalables
* Traducir desafíos ambiguos de emparejamiento en hipótesis claras, experimentos, métricas y recomendaciones
* Realizar análisis detallados de errores para comprender el comportamiento del modelo e identificar oportunidades de mejora
Llevar los Enfoques Exitosos a Producción
* Colaborar estrechamente con ingenieros de datos y de software para transformar prototipos prometedores en soluciones de emparejamiento listas para producción
* Proporcionar especificaciones claras del modelo, comportamientos esperados, resultados de evaluación, casos límite y criterios de lanzamiento
* Ayudar a determinar las técnicas adecuadas de emparejamiento para distintos niveles de datos, niveles de confianza y perfiles de costo
* Medir el impacto, diagnosticar regresiones y recomendar mejoras en los modelos y la lógica de emparejamiento
* Comunicar claramente los compromisos entre calidad del modelo, escala, costo, latencia, explicabilidad y riesgo operativo
SOBRE TI
Cualificaciones requeridas
* 5 a 8 años de experiencia profesional relevante en ciencia de datos aplicada, aprendizaje automático o campo relacionado
* Amplia experiencia práctica en aprendizaje automático aplicado, incluida experiencia directa en construcción y evaluación de modelos con datos del mundo real
* Excelentes habilidades en Python y SQL
* Experiencia práctica con incrustaciones (embeddings), similitud semántica, modelos de lenguaje grande (LLM) o técnicas relacionadas de inteligencia artificial
* Experiencia práctica en entrenamiento de modelos supervisados y no supervisados, incluyendo aplicaciones de clasificación y procesamiento del lenguaje natural (PLN)
* Conocimientos prácticos sobre redes neuronales y arquitecturas de transformadores
* Experiencia con frameworks de aprendizaje automático como TensorFlow, PyTorch o PyCaret
* Experiencia en el reentrenamiento de clasificadores de taxonomías o en el mantenimiento de modelos de clasificación en producción
* Fuerte capacidad de juicio experimental, incluida la capacidad de definir líneas base, métricas de evaluación, conjuntos de prueba y análisis de errores
* Capacidad para explicar claramente el comportamiento del modelo, los compromisos técnicos y los casos límite a partes interesadas de ingeniería y negocio
Cualificaciones preferidas
* Experiencia en resolución de entidades, vinculación de registros, desduplicación o problemas similares de emparejamiento
* Experiencia en clasificación, puntuación de similitud, recuperación, agrupamiento o técnicas de generación de candidatos
* Experiencia aplicando modelos de lenguaje grande (LLM) o incrustaciones (embeddings) a problemas empresariales a gran escala donde el rendimiento, la escalabilidad y el costo son consideraciones importantes
* Conocimiento de plataformas de datos a gran escala como Spark, Snowflake, Databricks o BigQuery
* Familiaridad con datos de empresas, dominios, sitios web, firmográficos u otros datos de entidades empresariales