Senior DevOps Engineer PagerDuty

Arche Solutions Remote 2026-10-06
  • Min. 7 lat doświadczenia w obszarze DevOps, SRE, Cloud Engineering lub automatyzacji infrastruktury.
  • Bardzo dobra znajomość PagerDuty.
  • Praktyczne doświadczenie w pracy z AWS, Azure lub GCP oraz gotowość do pracy w środowiskach multi-cloud.
  • Bardzo dobra znajomość Terraform / Infrastructure as Code.
  • Doświadczenie w automatyzacji i skryptowaniu z wykorzystaniem Python, Bash i JavaScript.
  • Znajomość REST API, webhooków, event-driven architecture oraz pracy z payloadami i transformacją danych.
  • Doświadczenie z narzędziami monitoringu i observability oraz umiejętność projektowania wartościowych, odpowiednio skonfigurowanych alertów.
  • Znajomość koncepcji SLO/SLI, incident management, on-call oraz zasad SRE.
  • Znajomość narzędzi CI/CD oraz pracy z Git.
  • Dobra znajomość koncepcji AIOps i automatyzacji reakcji na zdarzenia.
  • Zaawansowana znajomość j. angielskiego.

Celem projektu jest zaprojektowanie, wdrożenie i automatyzacja centralnego rozwiązania do zarządzania alertami i obsługi incydentów, opartego na PagerDuty i zintegrowanego z istniejącym ekosystemem monitoringu, observability, chmury oraz narzędzi ITSM.

Projekt ma na celu zapewnienie, aby właściwe alerty trafiały do odpowiednich osób we właściwym czasie, przy jednoczesnym ograniczeniu liczby fałszywych i powtarzających się powiadomień oraz skróceniu czasu reakcji i rozwiązania incydentów.

,[Projektowanie, wdrażanie i utrzymywanie integracji PagerDuty z narzędziami monitoringu i observability, m.in. CloudWatch, Datadog, Prometheus/Alertmanager, Grafana, New Relic, Splunk, Dynatrace, Nagios/Zabbix., Automatyzacja konfiguracji i onboardingu usług w PagerDuty oraz procesów związanych z obsługą i reagowaniem na incydenty., Tworzenie i rozwój automatyzacji z wykorzystaniem Terraform, PagerDuty API, REST API, webhooków oraz Rundeck., Konfiguracja usług PagerDuty, polityk eskalacji, harmonogramów on-call, routingu zdarzeń, event orchestration oraz mechanizmów grupowania i ograniczania liczby alertów., Budowanie mechanizmów auto-remediation i automatycznego wzbogacania informacji o incydentach w środowiskach AWS/Azure/GCP., Integracja PagerDuty z systemami ITSM i narzędziami wspierającymi współpracę, m.in. ServiceNow, Jira, Slack i Microsoft Teams., Tworzenie i utrzymywanie procesów CI/CD dla konfiguracji monitoringu i alertowania jako kodu., Rozwój rozwiązań automatyzujących obsługę incydentów oraz wspierających podejście AIOps / event intelligence.] Requirements: Python, PagerDuty, Terraform