Chat rápido, mejores ofertas — Descargar

Ingeniero Senior en Visión por Computadora

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoHíbrido
Nivel de experienciaMás de 10 años
Nivel educativoMaestría

Descripción

Innovamat es una organización educativa centrada en el aprendizaje de las matemáticas. Nuestra misión es mejorar la forma en que se imparte esta asignatura, ofreciendo recursos, formación e investigación a la comunidad educativa. Desde que fuimos fundados en Barcelona en 2017, hemos colaborado con más de 27.000 docentes en más de 2.800 escuelas de nueve países, llegando a más de 600.000 estudiantes. Dentro de Innovamat, **Mathboard AI** es la tecnología que interpreta lo que los estudiantes escriben a mano. Cuando un estudiante resuelve un problema en una pizarra digital, recibimos los trazos del lápiz en sí —no una fotografía, ni texto escrito con teclado—. Nuestros modelos deben determinar qué trazos pertenecen juntos y qué significa cada grupo, para que el estudiante pueda ser comprendido y ayudado en ese mismo instante. Estamos buscando a la persona que lleve esos modelos aún más lejos. Se trata de un problema de detección de múltiples instancias en entradas manuscritas, resuelto directamente sobre los trazos del lápiz en lugar de sobre una imagen renderizada —una formulación para la cual no existe ninguna solución lista para usar ni ninguna referencia pública que sustituya fielmente la realidad—. El trabajo es ingeniería de investigación genuina: comprender dónde falla el modelo, formular una hipótesis sobre la causa, construirla y averiguar honestamente si funcionó. ### **El problema en el que trabajarías** Un estudiante llena una página. En ella podrían aparecer cuatro cálculos independientes, dos flechas que vinculan un resultado con el siguiente, un pequeño diagrama, un intento tachado y algunas marcas que no corresponden a nada en absoluto. El modelo debe identificar cada uno de esos objetos, indicar de qué tipo es cada uno y especificar exactamente qué trazos del lápiz lo componen —todo ello simultáneamente, sin un número fijo de objetos y sin garantía alguna de que dos páginas cualesquiera se parezcan entre sí. Por tanto, se trata de detección de múltiples instancias, pero las unidades básicas son trazos, no píxeles. Un objeto está compuesto por un número variable de trazos; los trazos se cruzan e intercalan; dos objetos distintos ocupan habitualmente la misma región de la página, de modo que la cuestión nunca es *dónde* está aproximadamente un objeto, sino *qué marcas específicas* lo constituyen. Y una página solo se considera correcta cuando toda la interpretación es acertada —cada objeto identificado, cada tipo correctamente clasificado y cada trazo atribuido correctamente—. No hay puntuación parcial. Es un puesto de visión por computadora en cuanto que trata sobre estructura visual y razonamiento espacial. Pero no lo es en el sentido de convoluciones sobre fotografías, y esta diferencia merece ser explicitada claramente antes de que presentes tu candidatura. * **Poca parte de la pila preentrenada es reutilizable.** Los grandes modelos visuales de base sobre los que todos construyen asumen una cuadrícula de píxeles. Aquí, cómo se representa la entrada es una decisión de diseño que tú tomas, no un valor predeterminado que heredas. * **Las relaciones transportan la señal.** Lo que decide si dos trazos pertenecen juntos es su proximidad, su escala relativa, su alineación y qué más hay en la página —no su apariencia aislada. * **Las mejoras directas ya se han obtenido.** El progreso proviene de un diagnóstico cuidadoso y de una buena tasa de acierto con ideas no obvias, así como de extraer información real de los intentos fallidos —los cuales serán muchos—. * **Debe funcionar en un aula.** La respuesta debe llegar mientras el niño sigue mirando la pantalla, en cualquier dispositivo que la escuela tenga disponible. ### **Qué harás** **Serás responsable de los modelos** * Asumirás la responsabilidad arquitectónica de los modelos que interpretan escritura a mano —cómo se representa la entrada, cómo se proponen y asignan las instancias, cómo se entrenan los modelos y cómo mejoran. * Diseñarás los cambios que consideres capaces de avanzar en los casos difíciles, los implementarás correctamente y los ejecutarás a una escala donde el resultado sea fiable. * Mantendrás viva una alternativa válida. Lo que actualmente ejecutamos es el modelo vigente, no un compromiso definitivo, y parte del trabajo consiste en saber cuándo una formulación distinta lo superaría. **Convertirás las mejoras en avances reales** * Realizarás comparaciones controladas con criterios de éxito acordados previamente a la ejecución, de modo que un resultado signifique exactamente lo que parece significar. * Irás más allá del número principal y analizarás qué tipos de página mejoraron y cuáles empeoraron, evaluando si el intercambio realizado fue válido. * Repetirás todo lo que pretendas implementar, y reportarás con la misma claridad los intentos que no dieron resultado que los que sí lo tuvieron. **Llevarás los modelos a las aulas** * Llevarás un modelo hasta un punto en que responda con suficiente rapidez en hardware escolar común, no solo en una GPU de entrenamiento. * Garantizarás que lo que despleguemos se comporte igual que lo que evaluaste, y que podamos revertirlo inmediatamente si no lo hace. * Observarás su comportamiento con trabajos reales de estudiantes una vez esté activo, y transformarás esas observaciones en la siguiente línea de trabajo. **Elegirás qué vale la pena construir a continuación** * Colaborarás estrechamente con la persona responsable de nuestros conjuntos de datos y evaluaciones, siendo específico respecto a qué cambios afectarían realmente los resultados. * Evaluarás con honestidad cuándo el límite está en el modelo, cuándo en los datos y cuándo la propia tarea es genuinamente ambigua. ### **Qué buscamos** Buscamos profundidad, no amplitud. Buscamos a alguien capaz de llevar un problema de este tipo tan lejos como cualquiera lo haya llevado jamás. **Imprescindibles** * **Profunda experiencia en detección de múltiples instancias o segmentación de instancias.** Has construido modelos que identifican un número variable y desconocido de objetos en una única entrada y asignan cada parte de dicha entrada a exactamente uno de ellos —incluyendo cómo se emparejan las predicciones con las anotaciones reales durante el entrenamiento, y qué significan (y qué no significan) las métricas resultantes. * **Experiencia con entradas no rasterizadas, o una comprensión clara de qué cambia al no disponer de una cuadrícula de píxeles.** Trazos, polilíneas, trayectorias, nubes de puntos, grafos, gráficos vectoriales, geometría CAD o trazas de sensores —cualquier contexto en el que la entrada sea un conjunto de primitivas geométricas en lugar de una imagen. Si tu trabajo en detección de instancias ha sido sobre píxeles, querremos conversar sobre cómo lo abordarías sin ellos. * **Arquitecturas basadas en atención sobre conjuntos y grafos**, y una intuición sobre cómo se codifica la estructura espacial y relacional en un modelo —incluyendo la capacidad instintiva para detectar cuándo un modelo simplemente no puede percibir algo que asumiste que vería. * Experiencia sólida entrenando modelos profundos en **PyTorch** —no limitándote a invocar una API de entrenamiento, sino siendo responsable del bucle completo: planes de aprendizaje, estabilidad numérica, ejecuciones distribuidas y depuración de un modelo que entrena sin problemas pero no mejora. * La **disciplina experimental** necesaria para realizar comparaciones justas, resistir la tentación de interpretar el ruido como señal y declarar con claridad cuándo un resultado cae dentro del margen esperado. * Evidencia de que puedes llevar un modelo a **producción** —exportación, latencia, determinismo y una ruta de reversión. * Capacidad para leer la literatura científica de forma crítica: reproducir lo útil y distinguir claramente un avance genuino de un artefacto derivado de una referencia. **Deseables** * Reconocimiento de escritura manuscrita en línea, bocetos, tinta o diagramas, en cualquier sistema de escritura o notación. * Aprendizaje profundo geométrico o redes neuronales gráficas aplicadas a datos espaciales. * Gráficos vectoriales, CAD, SIG o modelado de trayectorias en un entorno industrial. * Optimización e inclusión de cuantización en la inferencia. * Trabajos publicados o de código abierto que podamos consultar. * Español o catalán. Este no es un puesto relacionado con modelos de lenguaje grande (LLM) ni con ingeniería de indicaciones (*prompt engineering*), ni tampoco un puesto centrado en tuberías de datos —existe otra oferta específica para conjuntos de datos y evaluación—. Tampoco es un puesto puramente investigador: lo que construyas debe llegar a los estudiantes. ### **Cómo trabajamos** Te incorporarías a un pequeño equipo técnico con acceso directo a las personas que toman decisiones sobre el producto, y con una cantidad inusual de autonomía sobre la dirección misma del modelo. Documentamos todo por escrito. Cada experimento, incluidos los que fracasan, se registra donde la siguiente persona pueda encontrarlo. Además, seguimos dos reglas con rigor: los resultados se evalúan frente a criterios acordados antes de la ejecución, y ningún número se cita antes de haber verificado sus datos. Ambas existen porque en el pasado nos han pillado sin ellas. Contarás con las GPUs que necesites. La potencia computacional no ha sido nuestra limitación —la limitación ha estado en el juicio sobre en qué invertirla.

Fuentea: indeed
Parte del contenido se ha traducido automáticamente

Publicado por

David Muñoz

Indeed · HR

Ubicación

David Muñoz

Indeed · HR

Empleos similares

Ingeniero Senior en Visión por Computadora empleo de Indeed en 2026 | ok.com