Pular para o conteúdo principal

Staff Software Engineer | Observability

Descrição da vaga

Estamos em busca de um(a) Staff Software Engineer – Observability para integrar o time de Engenharia da PWS Cloud e atuar na construção e evolução das capacidades de observabilidade da nossa plataforma de nuvem.


Buscamos uma pessoa com sólida experiência em Engenharia de Software, sistemas distribuídos e observabilidade, que combine profundidade técnica, atuação hands-on e visão sistêmica para resolver desafios complexos envolvendo aplicações e infraestrutura.


Como Staff, você terá um papel importante na evolução da observabilidade da plataforma, influenciando decisões técnicas e ajudando a estabelecer padrões para métricas, logs, traces, alertas e monitoramento. A atuação terá impacto entre diferentes times, contribuindo para ampliar a visibilidade sobre o comportamento dos sistemas e tornar a identificação de problemas mais rápida e eficiente.


Mais do que implementar ferramentas, esperamos alguém capaz de transformar necessidades operacionais em soluções reutilizáveis e sustentáveis, avaliando trade-offs entre cobertura, performance, custo e complexidade.


A posição também terá um papel importante em elevar a maturidade de observabilidade e confiabilidade da engenharia, contribuindo para que os times operem seus serviços com cada vez mais autonomia e segurança.

Responsabilidades e atribuições

  • Projetar e evoluir a arquitetura de Observabilidade da plataforma, contemplando métricas, logs, traces e alertas;
  • Definir e disseminar padrões de instrumentação utilizando OpenTelemetry, promovendo consistência entre aplicações e serviços;
  • Desenvolver ferramentas, integrações e automações que simplifiquem a adoção de observabilidade pelos times de engenharia;
  • Evoluir e operar soluções baseadas em Prometheus, Grafana, Loki ou tecnologias relacionadas;
  • Definir estratégias de SLIs, SLOs e alertas, garantindo sinais relevantes para operação e experiência dos produtos;
  • Apoiar os times na instrumentação, troubleshooting e análise de performance de aplicações e sistemas distribuídos;
  • Atuar como referência técnica, liderando decisões arquiteturais e iniciativas de maior complexidade relacionadas à observabilidade;
  • Desenvolver serviços e componentes de plataforma utilizando principalmente Go, quando necessário;
  • Trabalhar em conjunto com Engenharia, SRE, Infraestrutura, Segurança e Produto na evolução da confiabilidade da plataforma;
  • Identificar oportunidades de automação, redução de ruído operacional e melhoria contínua da experiência dos times.

Requisitos e qualificações

  • Sólida experiência com Observabilidade e monitoramento de sistemas distribuídos;
  • Experiência com OpenTelemetry e instrumentação de aplicações utilizando métricas, logs e distributed tracing;
  • Experiência com tecnologias como Prometheus, Grafana, Loki ou soluções equivalentes;
  • Conhecimento de conceitos de SLI, SLO, error budget, alerting e incident response;
  • Experiência com Kubernetes e observabilidade de workloads e aplicações executadas em ambientes cloud native;
  • Experiência em desenvolvimento de software utilizando Go, Python ou linguagens equivalentes, com capacidade de construir ferramentas, integrações e automações;
  • Conhecimento de APIs, sistemas distribuídos e arquiteturas orientadas a eventos;
  • Experiência com troubleshooting, análise de performance e investigação de problemas em ambientes distribuídos;
  • Familiaridade com CI/CD, Infrastructure as Code e práticas modernas de Engenharia de Software;
  • Experiência atuando como referência técnica e contribuindo para decisões arquiteturais e evolução de outros engenheiros.

Informações adicionais

Será considerado um diferencial:


  • Experiência na construção de plataformas de observabilidade para múltiplos times e produtos;
  • Conhecimento de arquiteturas de alta escala para armazenamento e processamento de métricas, logs e traces;
  • Experiência com Grafana Mimir, Tempo, Loki, Prometheus ou tecnologias equivalentes;
  • Experiência com eBPF e ferramentas de observabilidade de infraestrutura e redes;
  • Conhecimento de FinOps aplicado à observabilidade, incluindo controle de cardinalidade, retenção e custos de telemetria;
  • Experiência com plataformas Cloud, SaaS ou ambientes multi-tenant;
  • Experiência com CloudStack, OpenStack, Ceph ou tecnologias equivalentes.

Etapas do processo

  1. Etapa 1: Cadastro
  2. Etapa 2: Entrevista Talent
  3. Etapa 3: Entrevista Gestão
  4. Etapa 4: Etapa Time/Técnica
  5. Etapa 5: Etapa de Cultura
  6. Etapa 6: Contratação

Junte-se ao nosso Time!

A PWS Cloud é uma empresa brasileira com 15 anos de experiência em tecnologia, com atuação em cloud, infraestrutura, cibersegurança e serviços gerenciados. Reconhecida pelo atendimento consultivo e execução ponta a ponta, apoia empresas na modernização e proteção de ambientes críticos, com foco em confiabilidade e performance.


Com uma abordagem orientada ao negócio, a PWS Cloud entende os desafios específicos de cada cliente e constrói soluções sob medida, alinhadas às necessidades operacionais e estratégicas de cada organização. Seu portfólio integra tecnologias de ponta com práticas consolidadas de governança, garantindo não apenas eficiência, mas também segurança e escalabilidade.


Nós atuamos como parceira na jornada de transformação digital, viabilizando a migração e evolução de ambientes on-premises para a nuvem, a otimização de custos operacionais e o aumento da resiliência dos sistemas. Além disso, oferece suporte contínuo e monitoramento proativo, assegurando alta disponibilidade e rápida resposta a incidentes.


Com expertise em ambientes complexos e missão crítica, a PWS Cloud se posiciona como um player estratégico para empresas que não podem parar, entregando soluções robustas que sustentam crescimento, inovação e vantagem competitiva.