BC Tecnología

Site Reliability Engineer (SRE)

BC Tecnología · Remote
Full time DevOps & QA Today
Heads up: we remove this job from our database within a month (monthly cleanup), so the link may stop working. We've saved it in your browser so you can find it again.

Requisitos

  • Experiencia comprobable en implementación y operación de stacks de observabilidad en ambientes productivos.
  • Experiencia gestionando incidentes críticos P1/P2 y elaboración de RCA.
  • Experiencia trabajando bajo esquemas on-call y atención fuera de horario hábil.
  • Conocimientos sólidos en alta disponibilidad, monitoreo, performance y automatización.
Buscamos una persona analítica, proactiva y orientada a la mejora continua, con capacidad para actuar rápidamente ante incidentes críticos y colaborar en entornos de alta disponibilidad y operación continua.

Principales responsabilidades

  • Revisión continua del estado de plataformas: métricas, capacidad, rendimiento y latencias.
  • Detección temprana de riesgos operativos y recomendaciones preventivas.
  • Monitoreo y revisión de observabilidad: métricas, logs y alertas definidas por el cliente.
  • Análisis y gestión de alertas durante el horario del servicio, proponiendo acciones de mitigación.
  • Revisión y validación de configuraciones de alta disponibilidad, replicación y failover.
  • Automatización de tareas críticas y repetitivas mediante scripts y procesos.
  • Participación en análisis de incidentes críticos y elaboración de RCA (Root Cause Analysis).
  • Construcción de dashboards, alertamiento proactivo y correlación de eventos.
  • Análisis de desempeño end-to-end de plataformas y servicios.
Tecnologías y herramientas
  • Grafana
  • Zabbix
  • OpenTelemetry
  • Wazuh
  • AWS
  • Linux / Red Hat
  • Herramientas de automatización y scripting

Certificaciones deseables

  • Deseable experiencia en entornos cloud AWS y administración Linux.
  • AWS Certified SysOps Administrator – Associate
  • AWS Certified DevOps Engineer – Professional
  • ITIL Foundation
  • Red Hat Certified System Administrator (RHCSA) o RHCE
  • Grafana Certified Associate
ObservabilityIncident ManagementAutomation
Source: GetOnBoard
Report this job
📬 Looking for remote work? Leave your email and we'll let you know when we launch job alerts.