SRE (Site Reliability Engineer)

SABIA ADMINISTRACAO LTDA

Belo Horizonte - MG

2 posições

Não informado

Elegível para PCD

Integral

PJ
Remoto
Pleno
Tecnologia

Sobre a Vaga: Estamos procurand uma pessoa SRE (Site Reliability Engineer) para reforçar a confiabilidade e resiliência da nossa plataforma na Cometa Gaming.

Operamos no setor de iGaming/apostas: um ambiente de altíssima criticidade, com desafios diários e picos de tráfego constantes — é praticamente uma Black Friday todo dia, e garantir a disponibilidade é inegociável. O foco principal é manter os ambientes de produção estáveis e responder a incidentes com agilidade (investigar, mitigar, resolver e reduzir o MTTR), transformando cada ocorrência em melhoria contínua.

Trabalhamos com a filosofia AI-first (usando inteligência artificial para acelerar nossas entregas), em um ambiente descontraído, de aprendizado constante e com total autonomia para propor e executar.

Responsabilidades:
  • Confiabilidade & Incidentes: Atuar ativamente em incidentes de produção (investigação de causa raiz, mitigação e post-mortem blameless), definindo/acompanhando SLIs, SLOs e Error Budgets, reduzindo toil via automação e realizando troubleshooting avançado em Linux e sistemas distribuídos.
  • Automação & CI/CD: Criar e evoluir pipelines de CI/CD e estratégias GitOps (ArgoCD, Flux ou similares).
  • Infraestrutura como Código (IaC): Provisionar e manter infraestrutura com Terraform, Terragrunt e Ansible em múltiplos cloud providers (AWS, GCP ou Azure).
  • Orquestração & Observabilidade: Gerenciar ambientes baseados em Docker e Kubernetes, implementando e aprimorando a observabilidade (Datadog, Grafana, Prometheus).
  • DevEx & Segurança: Apoiar os times de desenvolvimento com foco na experiência do desenvolvedor (DevEx), garantindo resiliência, performance e segurança cloud-native.
Requisitos:
  • Experiência: Vivência prática prévia como SRE, DevOps Engineer ou equivalente, com experiência real em resposta a incidentes em produção (plantão/on-call).
  • Orquestração & Nuvem: Sólidos conhecimentos em Kubernetes, contêineres e infraestrutura em nuvem (AWS, GCP ou Azure).
  • Práticas Modernas: Domínio de CI/CD, IaC, automação de ambientes e conceitos de Site Reliability Engineering (SLOs, Error Budget, redução de toil).
  • Observabilidade & Segurança: Familiaridade com ferramentas de monitoramento/telemetria e segurança em ambientes cloud-native.
  • Perfil: Proatividade para investigação de problemas complexos e paixão por boas práticas de engenharia.
Diferenciais:
  • Experiência com plataformas internas de desenvolvimento (IDP) e foco em DevEx.
  • Conhecimento de pipelines avançadas (GitHub Actions, GitLab CI, Jenkins).
  • Nivelamento básico em backend (Laravel) e ciclo de vida de aplicações web.
  • Certificações na área (ex: CKA, AWS Certified Solutions Architect).
  • Contribuições em projetos Open Source.

Requisitos

Escolaridade

  • Graduação

Idioma

  • Inglês - Intermediário

Habilidade Técnica

  • Kubernetes & Docker - Avançado
  • Infraestrutura como Código (Terraform / Terragrunt) - Avançado
  • Computação em Nuvem (AWS / GCP / Azure) - Avançado
  • Pipelines CI/CD & GitOps (ArgoCD / Flux) - Avançado
  • Observabilidade (Datadog / Grafana / Prometheus) - Avançado
  • Engenharia de Confiabilidade (SLI, SLO & Error Budgets) - Avançado
  • Troubleshooting Linux & Sistemas Distribuídos - Avançado
  • Gestão e Mitigação de Incidentes (Post-Mortem Blameless) - Avançado
  • Segurança Cloud-Native & Endpoint Security - Avançado
  • Desenvolvimento de DevEx & Internal Developer Platforms (IDP) - Avançado
  • Automação com Ansible - Avançado

Localização

Avenida Francisco Sales, 1499, Funcionários, Belo Horizonte - MG, Brasil, 30150-228