Principal Site Reliability Engineer

Akamai Technologies
Krakow
Workplace: RemoteFull timeFunction: DevOps, Cloud & InfrastructureSkills: ["Mentoring engineers","Leading cross-team problem solving","Incident investigation"]

Design and qualify Akamai’s server compute infrastructure for a global cloud platform, partnering with the HIVE Server Enablement & Qualification (SEQ) team. Own strategy for hardware/OS/runtime reliability across x64, ARM, and accelerators, improve bare-metal provisioning and CI/CD pipelines, and drive observability, safe rollouts, and recovery. Provide incident expertise for complex HW/SW failures and mentor engineers across multi-domain teams and vendors.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Akamai Technologies
Akamai Technologies
1 day ago

Principal Site Reliability Engineer

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 8 hours agoStatus: Live

Job Summary

Design and qualify Akamai’s server compute infrastructure for a global cloud platform, partnering with the HIVE Server Enablement & Qualification (SEQ) team. Own strategy for hardware/OS/runtime reliability across x64, ARM, and accelerators, improve bare-metal provisioning and CI/CD pipelines, and drive observability, safe rollouts, and recovery. Provide incident expertise for complex HW/SW failures and mentor engineers across multi-domain teams and vendors.
Location: Krakow
Workplace: Remote
Employment Type: Full time
Job Function: DevOps, Cloud & Infrastructure
Seniority: Mid level

Key Responsibilities

  • •Shape compute-platform strategy and qualification for x64, ARM, accelerator, and inference hardware across firmware, OS, runtime, and reliability criteria.
  • •Lead provisioning and CI/CD improvements for reproducible, safe, and scalable bare-metal provisioning, imaging, and infrastructure delivery pipelines.
  • •Drive reliability and observability by addressing systemic failures, improving telemetry/diagnostics, and establishing safe rollout and recovery safeguards for production.
  • •Provide incident expertise for complex HW/SW incidents: investigate root causes, guide decisions, and translate findings into engineering fixes.
  • •Act as a senior technical force multiplier by reviewing designs, mentoring engineers, setting standards, and resolving multi-domain issues across teams and vendors.

Key Requirements

  • •Linux and server-platform expertise, including boot processes, storage, networking, hardware diagnostics, firmware, BIOS/UEFI, BMCs, and server lifecycles.
  • •Experience designing and operating bare-metal provisioning, configuration management, and scalable infrastructure automation.
  • •Fluency in Python and BASH, with experience building automation, APIs, deployment pipelines, and debugging multi-layer failures.
  • •Reliability and operations expertise, including observability, metrics, capacity analysis, incident root-cause investigation, and production readiness.
  • •Hands-on experience with Linux virtualization technologies such as KVM, QEMU, and libvirt, plus troubleshooting of nested virtualization and virtualized networking/storage.
Experience:CloudInfrastructureServer reliabilityLinuxVirtualization
Skills:Mentoring engineersLeading cross-team problem solvingIncident investigation
Tech Stack:LinuxPythonBASHCI/CDAPIsX86ARMFirmwareBIOS/UEFIBMCsKVMQEMULibvirtHardware diagnosticsBoot processesStorageNetworking

Company Brief

Akamai Technologies
Provides a global content delivery network (CDN) and cloud services to improve web and application performance, security, and delivery for enterprises, media companies, and cloud providers.
Industry: Cloud Computing
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Cambridge, United States
Founded: 1998
WebsiteLinkedIn