Senior AI Research Engineer
Improving
· Remote
Tiempo completo
🤖 Machine Learning
Hoy
Atención: eliminamos este aviso de nuestra base de datos al cabo de un mes (limpieza mensual), así que el enlace puede dejar de funcionar. Lo guardamos en tu navegador para que puedas volver a encontrarlo.
Requisitos Indispensables
- Nivel de inglés intermedio-avanzado o avanzado (indispensable)
- 4+ años construyendo software, con 2+ años llevando a producción sistemas basados en LLM
- Python sólido — async, streaming, salidas estructuradas, observabilidad — además de comodidad con infraestructura en la nube (AWS preferido)
- Experiencia práctica con patrones agénticos: uso de herramientas, bucles de planificación, gestión de estado, ejecución de largo alcance
- Buenos instintos de evaluación: capaz de diseñar una evaluación que realmente mida lo que importa, y sabe distinguir cuándo un resultado es señal o ruido
- Cómodo leyendo artículos y traduciendo ideas en código funcional; no necesita un doctorado para hacerlo, pero sí necesita la curiosidad
- Trayectoria comprobada de llevar sistemas de prototipo a producción — se responsabiliza de la confiabilidad, la latencia y el costo, además de la calidad
Señales que Buscamos
- Igualmente alérgico(a) a "lanzar sin medir" y a "medir para siempre sin lanzar".
- Investigador(a) pragmático(a) / ingeniero(a) curioso(a) — elige el modo correcto según el problema.
- Opiniones firmes sobre los modos de fallo de los agentes a nivel de sistema, no solo a nivel del modelo.
- Se comunica con claridad ante distintas audiencias — puede explicar un resultado de evaluación complicado a un PM y una arquitectura de memoria a un investigador.
- Eleva el estándar del equipo tanto en rigor como en velocidad tiene que ser una buena traducción es aes correcta.
Qué harás
- Construir sistemas agénticos (agentic systems) de nivel de producción mientras te mantienes cerca de la frontera de la investigación — el puesto vive en el punto de encuentro entre "lánzalo" y "¿es este el enfoque correcto?"
- Prototipar patrones novedosos de agentes (self-evolving loops, orquestación multiagente, arquitecturas de memoria), validarlos con evaluaciones rigurosas (evals), y luego consolidarlos en servicios desplegados
- Ser responsable de la infraestructura de evaluación de principio a fin: diseñar golden datasets, construir harnesses de LLM-as-judge, ejecutar experimentos y usar los resultados para guiar decisiones técnicas
- Leer artículos recientes y decidir qué vale la pena probar — ejecutar ablaciones rápidas, descartar ideas que no funcionan, y llevar a producción las que sí
- Colaborar con ingenieros de plataforma en despliegue, latencia y costo
- Contribuir en toda la pila tecnológica: diseño de agentes, recuperación/clasificación (retrieval/ranking), ingeniería de prompts y contexto, integración de herramientas (Claude Agent SDK, MCP, Bedrock)
Deseable
- Experiencia con Claude Agent SDK, MCP, o marcos de agentes similares
- Familiaridad con la metodología de LLM-como-juez, corrección de sesgo estadístico, o plataformas de evaluación (LangFuse, Braintrust, AgentCore)
- Experiencia en recuperación/clasificación (embeddings, búsqueda híbrida, rerankers, resaltado semántico)
- Exposición a sistemas auto-mejorables, escalado de cómputo en tiempo de inferencia (test-time compute), o investigación agéntica relacionada.
- Experiencia en el dominio de GRC, tecnología legal, o software empresarial regulado
- Contribuciones de código abierto, publicaciones en blogs, o resultados de investigación aplicada
Beneficios
- Contrato a largo plazo.
- 100% Remoto.
- Vacaciones y PTOs
- Posibilidad de recibir 2 bonos al año.
- 2 revisiones salariales al año.
- Clases de inglés.
- Equipamiento Apple.
- Plataforma de cursos en linea
- Budget para compra de libros.
- Budget para compra de materiales de trabajo
- Mucho mas..
PythonLarge Language ModelsCloud Infrastructure
Fuente: GetOnBoard