Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server

Dell
Rio Grande do Sul
Workplace: OnsiteFull timeFunction: Hospitality & Food ServiceEducation: bachelorsSkills: ["Collaboration","Troubleshooting","Root cause analysis","Continuous improvement","Incident management"]

Atuar como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) na equipe de Engenharia de Infraestrutura, projetando, desenvolvendo e operando automações do ciclo de vida da infraestrutura compute. Você garantirá escalabilidade, disponibilidade e confiabilidade, construindo diagnósticos e remediações automatizados com Ansible, Python e pipelines CI/CD. Também definirá SLIs/SLOs e error budgets, aprimorará observabilidade e liderará iniciativas de melhoria contínua, participando do plantão para incidentes críticos.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Dell
Dell
1 month ago

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) - Server

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 6 hours agoStatus: Live
Reposted: similar role first listed 1 month ago

Job Summary

Atuar como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) na equipe de Engenharia de Infraestrutura, projetando, desenvolvendo e operando automações do ciclo de vida da infraestrutura compute. Você garantirá escalabilidade, disponibilidade e confiabilidade, construindo diagnósticos e remediações automatizados com Ansible, Python e pipelines CI/CD. Também definirá SLIs/SLOs e error budgets, aprimorará observabilidade e liderará iniciativas de melhoria contínua, participando do plantão para incidentes críticos.
Location: Rio Grande do Sul
Workplace: Onsite
Employment Type: Full time
Job Function: Hospitality & Food Service
Seniority: Mid level

Key Responsibilities

  • •Projetar, desenvolver e manter automações do ciclo de vida da infraestrutura compute, incluindo descoberta de servidores, provisionamento bare-metal, implantação de sistemas operacionais, gerenciamento de firmware e patches, configuração de hipervisores e processos de diagnóstico/remediação automatizados.
  • •Definir e operar práticas de confiabilidade para serviços compute com SLIs, SLOs e error budgets, aprimorando a observabilidade, reduzindo ruído de monitoramento e realizando análises pós-incidente.
  • •Colaborar com equipes de Compute, Automação de Plataforma e Observabilidade para definir requisitos operacionais, integrar automações à plataforma corporativa e contribuir para políticas como código para operação segura e escalável.
  • •Liderar melhoria contínua medindo cobertura de automação, aumentando resolução autônoma, mantendo bases de conhecimento estruturadas e avaliando novas ferramentas para o ecossistema corporativo.
  • •Participar da escala de plantão da torre de Compute como ponto de escalonamento quando incidentes críticos não forem resolvidos por mecanismos automatizados.

Key Requirements

  • •Formação superior completa em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em SRE, Engenharia de Infraestrutura, Engenharia de Servidores ou Operações de Plataformas em larga escala.
  • •Inglês avançado ou fluente para colaborar com equipes globais.
  • •Experiência prática avançada em pelo menos duas áreas: VMware vSphere/vCenter; servidores bare-metal (Dell PowerEdge, HPE, Cisco UCS ou equivalentes); Linux (Oracle Linux, RHEL ou equivalentes) ou Windows Server.
  • •Experiência comprovada desenvolvendo automações de infraestrutura com Ansible, Python, Git, pipelines CI/CD e práticas de GitOps, incluindo gerenciamento automatizado de ciclo de vida de plataformas compute.
  • •Conhecimento sólido em observabilidade, monitoramento, confiabilidade, troubleshooting, gestão de incidentes, análise de causa raiz e resolução de falhas complexas envolvendo hardware, hipervisores e sistemas operacionais.
Experience:Site reliability engineeringInfrastructureBare-metalAutomationObservability
Education:Bachelor's
Skills:CollaborationTroubleshootingRoot cause analysisContinuous improvementIncident management
Languages:English
Tech Stack:AnsiblePythonGitCI/CDGitOpsVMware vSphereVMware vCenterBare-metalDell PowerEdgeHPECisco UCSLinuxOracle LinuxRHELWindows ServerSLIsSLOsError budgetsVROpsZabbix

Company Brief

Dell
Designs, manufactures and sells computers, servers, storage, networking equipment, and related IT solutions and services for consumers, small businesses, and enterprises worldwide.
Industry: Electronics Manufacturing
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Round Rock, United States
Founded: 1984
Glassdoor
Glassdoor: 3.8
WebsiteLinkedInGlassdoor