We are seeking a Senior Software Engineer / SRE with a strong observability focus to support platform reliability, monitoring, and modernization initiatives. This role combines approximately 60–70% software engineering with 30–40% site reliability engineering and requires hands-on experience working with Kubernetes, cloud infrastructure, observability platforms, APIs, and operational automation. The successful candidate will help build and operate observability capabilities across containerized and microservices-based environments while proactively improving platform reliability, scalability, and performance. Enterprise experience strongly preferred. Key Responsibilities: - Design, build, and maintain software, APIs, integrations, and automation that support platform reliability and observability. - Support monitoring, reliability, maintenance, and continuous improvement across internal platforms and systems. - Work in Kubernetes-based environments across deployment, operations, and monitoring activities. - Build and maintain observability solutions with a focus on Datadog. - Configure dashboards, alerts, application performance monitoring, tracing, metrics, and logging. - Monitor containerized and microservices-based applications. - Integrate observability platforms and monitoring capabilities into AWS environments. - Integrate observability capabilities into CI/CD pipelines and deployment processes. - Automate monitoring and operational tasks through scripting, with Python preferred. - Install and configure Datadog agents and integrations. - Manage observability API keys and secure configurations. - Manage user roles, permissions, and access controls within observability platforms. - Lead proactive maintenance efforts and platform improvements. - Drive improvements in reliability, scalability, performance, and operational efficiency. Must-Have Skills: - Strong proficiency in at least one of Python, JavaScript using Node.js, or Java. - Hands-on experience designing, consuming, and implementing API integrations. - Strong Kubernetes experience covering deployment, operations, and monitoring. - Hands-on experience with Datadog or a comparable observability platform such as Prometheus or Grafana. - Experience configuring dashboards, alerts, application performance monitoring, tracing, metrics, and logging. - Experience monitoring containerized and microservices-based architectures. - Hands-on AWS experience. - Experience integrating observability tooling into cloud environments. - Experience integrating observability capabilities into CI/CD pipelines. - Ability to automate monitoring and operational work through scripting. Nice-to-Have Skills: - Strongly preferred experience owning and operating an internal engineering platform. - Strongly preferred experience owning reliability, scalability, and performance outcomes. - Strongly preferred experience proactively leading maintenance efforts and platform improvements rather than providing only reactive support. - Familiarity with Go or Golang. - Experience with New Relic, Dynatrace, Elastic, or Splunk Observability. - Experience working across multiple observability and monitoring platforms. Required Tools & Platforms: - Python, JavaScript using Node.js, or Java - Kubernetes - Datadog, Prometheus, Grafana, or a comparable observability platform - AWS - CI/CD pipelines - APIs and integration tooling - Application performance monitoring, tracing, metrics, logging, dashboards, and alerting tools Location, Time & Engagement: - Remote contract opportunity. - Candidates must be located in APAC. - Ability to provide overlap with Japan Standard Time is preferred. - Full-time allocation of 40 hours per week. - Expected contract end date is March 31, 2027.
AI Engineer - FDE (Forward Deployed Engineer)
Databricks
Software Development Engineer in Test II
Fivetran
Software Engineering Annotator (Remote)
Jobs Ai
Lead Clinical Care Navigator, Global
Spring Health
Sales Development Representative
Datadog
Merchant Support Specialist
Polar