Site Reliability Engineer

05 ago - Milano
agap2 Italia

Siamo alla ricerca di unSite Reliability Engineermotivato a contribuire alla scalabilità e all'ottimizzazione di una complessainfrastruttura Cloud in produzione su Azure.
Si candidi in fretta: consulti la descrizione completa scorrendo verso il basso per scoprire tutti i requisiti di questo ruolo.
Si tratta di un sistema distribuito progettato per raccogliere, gestire e distribuire grosse moli di dati in tempo reale.
Include componenti connessi "at the edge" che devono essere in grado di operare in scenari "offline" e garantire "eventual consistency" dei dati.
La lingua di lavoro principale è l'inglese, dato che il sistema è utilizzato da clienti internazionali.
Il ruolo richiede un robusto focus sull'affidabilità, la scalabilità, la sicurezza e la resilienza dell'infrastruttura, con un utilizzo intensivo diAzure Kubernetes Service (AKS),Azure Database for PostgreSQL,MongoDB AtlasedApache Kafka.
Il candidato deve inoltre essere disponibile a partecipare alla turnazione on-call, ovviamente remunerata e concordata per essere distribuita equamente nel mese, per la gestione di emergenze e incidenti fuori orario lavorativo standard.
Non è necessario avere esperienza approfondita su tutti i tool utilizzati: siamo pronti a offrire formazione tramite corsi e "training on the job" per colmare eventuali lacune e supportare la crescita professionale.
Responsabilità principali
Migliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure), assicurando performance,



scalabilità, sicurezza ed alta affidabilità dei servizi deployati
Configurare ed ottimizzare i database relazionali (PostgreSQL su Azure) e non relazionali (MongoDB Atlas) per garantire performance, affidabilità e sicurezza dei dati
Gestire e ottimizzare Apache Kafka (su AKS) per la raccolta e distribuzione di dati in tempo reale
Automatizzare processi operativi per ridurre il "toil" e migliorare l'efficacia dei team (Platform team e Product team)
Partecipare alla turnazione on-call per garantire una rapida risposta agli incidenti e alle emergenze
Sviluppare pipeline di monitoraggio e alerting per identificare e debuggare rapidamente problemi operativi
Identificare prontamente la "root xrdbqlu cause" di problemi bloccanti, sviluppando documentazione tecnica dettagliata ed automazioni per evitare che problemi noti si verifichino nuovamente
Collaborare con il team di sviluppo per il miglioramento continuo del ciclo di vita dello sviluppo software (SDLC), garantendo pratiche solide e coerenti
Cosa offriamo
Opportunità di lavorare su infrastrutture cloud-native moderne, resilienti e scalabili, in un contesto di stream processing ed edge computing
Forte attenzione alla cura delle persone, guidata dai nostri valori aziendali di intraprendenza, curiosità, cura e onestà
Ambiente collaborativo e stimolante, "remote friendly", orientato alla crescita professionale e personale

Supervisore Della Manutenzione

08 ago - Italia
Jobtome

Progettista Meccanico Senior

08 ago - Bologna
Food Processing Equipment

Ricevi nuove offerte di lavoro

Crea una Job Alert gratuita per site reliability engineer / milano

SCM Change Management and Continuous Improvement Manager (f/m/d)

08 ago - Milano
Informatica / Software

Pasticcere Senior

08 ago - Perugia
RICCI GROUP