Staff Site Reliability Engineer
San DiegoLast seen 12 days ago
Summary
This is a Staff Site Reliability Engineer role focused on ensuring reliability, availability, and performance of Altium's large-scale SaaS cloud platforms. The role combines software engineering and systems administration, requiring 6+ years of SRE/DevOps experience and 3+ years of software development (preferably .NET). Responsibilities include designing observability frameworks, automating operational tasks, managing incidents, implementing infrastructure-as-code, and collaborating with engineering teams on reliability best practices across AWS and Kubernetes environments.
DevOps / InfrastructureAWSC#KubernetesTerraformAnsibleApmApplication Performance ManagementArgocdCI CDDevOps.NETElkGitHubGitLabGrafanaHigh Availability ArchitectureIaCIncident ManagementIncident ResponseInfrastructure As CodeJenkinsMicroservicesMySQLNetworking FundamentalsNew RelicObservabilityOtelPagerdutyPostgreSQLRelational DatabasesSdlcSRESystem Design