Overview
This role requires a Principal Site Reliability Engineer (SRE) with expertise in observability to lead the implementation of a new observability solution for a FTSE100 Wealth/Asset Management firm. The contractor will collaborate with digital engineering teams to establish observability best practices and frameworks, driving strategic initiatives and enhancing system reliability across digital platforms.
Responsibilities
- Define and drive the observability roadmap in line with business priorities.
- Establish and manage SLIs, SLOs, and error budgets for system reliability.
- Design and implement observability runbooks for monitoring and alerting.
- Assist engineering teams in implementing monitoring and observability practices.
- Promote a culture of data-driven decision-making across teams.
- Drive adoption of observability standards and governance.
Requirements
- 10+ years of engineering experience, with 5+ years in SRE or DevOps.
- Proficiency in observability tools such as Datadog, Grafana, and Prometheus.
- Strong knowledge of distributed systems and microservices.
- Experience with automation tools like Terraform or Ansible.
- Familiarity with performance engineering and telemetry-based insights.
- Experience with cloud-native platforms and enterprise-grade observability solutions.