Site Reliability Engineer
Pubblicato il 04-08-2026 - agap2 Italia in Città Metropolitana di Torino
p Siamo alla ricerca di un b Site Reliability Engineer /b motivato a contribuire alla scalabilità e all’ottimizzazione di una complessa b infrastruttura Cloud in produzione su Azure. /bp Si assicuri di inviare la sua candidatura con tutte le informazioni richieste, come indicato nella panoramica del lavoro riportata di seguito. brp Si tratta di un sistema distribuito progettato per raccogliere, gestire e distribuire grosse moli di dati in tempo reale. Include componenti connessi “at the edge” che devono essere in grado di operare in scenari “offline” e garantire “eventual consistency” dei dati. La lingua di lavoro principale è l’inglese, dato che il sistema è utilizzato da clienti internazionali. /p p Il ruolo richiede un forte focus sull’affidabilità, la scalabilità, la sicurezza e la resilienza dell’infrastruttura, con un utilizzo intensivo di b Azure Kubernetes Service (AKS) /b , b Azure Database for PostgreSQL /b , b MongoDB Atlas /b ed b Apache Kafka /b . /p p Il candidato deve inoltre essere disponibile a partecipare alla turnazione on-call, ovviamente remunerata e concordata per essere distribuita equamente nel mese, per la gestione di emergenze e incidenti fuori orario lavorativo standard. /p p Non è necessario avere esperienza approfondita su tutti i tool utilizzati: siamo pronti a offrire formazione tramite corsi e “training on the job” per colmare eventuali lacune e supportare la crescita professionale. /p pb Responsabilità principali /b /pulli Migliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure), assicurando performance, scalabilità, sicurezza ed alta affidabilità dei servizi deployati /lili Configurare ed ottimizzare i database relazionali (PostgreSQL su Azure) e non relazionali (MongoDB Atlas)
per garantire performance, affidabilità e sicurezza dei dati /lili Gestire e ottimizzare Apache Kafka (su AKS) per la raccolta e distribuzione di dati in tempo reale /lili Automatizzare processi operativi per ridurre il “toil” e migliorare l’efficacia dei team (Platform team e Product team) /lili Partecipare alla turnazione on-call per garantire una rapida risposta agli incidenti e alle emergenze /lili Sviluppare pipeline di monitoraggio e alerting per identificare e debuggare rapidamente problemi operativi /lili Identificare prontamente la “root cause” di problemi bloccanti, sviluppando documentazione tecnica dettagliata ed automazioni per evitare che problemi noti si verifichino nuovamente /lili Collaborare con il team di sviluppo per il miglioramento continuo del ciclo di vita dello sviluppo software (SDLC), garantendo pratiche solide e coerenti /li /ul pb Requisiti /b /pulli Laurea in Informatica, Ingegneria o esperienza equivalente /lili3+ anni di esperienza con infrastrutture Cloud, preferibilmente Azure /lili Esperienza con sistemi distribuiti e principi di alta scalabilità e resilienza per applicazioni cloud-native /lili Esperienza consolidata in ambienti Linux, inclusa la gestione e il debugging di problemi di networking (DNS, Load Balancer, firewall e VPN) /lili Esperienza con Docker,
Kubernetes ed Helm /lili Esperienza con tool di monitoraggio e logging (Prometheus, Grafana, Azure Monitor, etc.) /lili Esperienza nella creazione di automazioni (Python, Bash, Terraform) per migliorare i processi operativi, secondo il paradigma Infrastructure-as-Code (IaC) /lili Familiarità con i principi di Site Reliability Engineering, inclusi SLO, SLA ed “error budgets” /lili Disponibilità a partecipare alla turnazione on-call in reperibilità /lili Buona conoscenza della lingua inglese, scritta e parlata, obbligatoria per l’interazione con clienti internazionali /li /ulp xrdbqlu br/ppb Nice to Have /b /pulli Certificazioni Azure (es. Azure Solutions Architect, Azure DevOps Engineer) /lili Esperienza nell’implementazione delle best practices di sicurezza su sistemi distribuiti, dalla configurazione di rete alla gestione dei segreti, fino alla scansione automatica per l’identificazione di vulnerabilità note /lili Esperienza con database relazionali (PostgreSQL) e non relazionali (MongoDB) /lili Esperienza con Apache Kafka e conoscenza dei concetti base di stream processing distribuito /lili Esperienza con CI/CD (Jenkins, Gitlab, etc.) /lili Familiarità con architetture di microservizi e metodologie DevOps/GitOps /lili Esperienza di progettazione e sviluppo di sistemi distribuiti real-time e fault-tolerant /li /ul pb Cosa offriamo /b /pulli Occasione di lavorare su infrastrutture cloud-native moderne, resilienti e scalabili, in un contesto di stream processing ed edge computing /lili Forte attenzione alla cura delle persone, guidata dai nostri valori aziendali di intraprendenza, curiosità, cura e onestà /lili Ambiente collaborativo e stimolante, “remote friendly”, orientato alla crescita professionale e personale /li /ul /p /p
