
Senior Linux / HPC Infrastructure Engineer (SRE)
MARGO • Paris
No Relocation
Posted: October 8, 2026
Job Description
- Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI. Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible, Pythona, Basha i Gita. To nie jest typowa praca DevOps skupiona na chmurze i wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.
- 200 zł - 250 zł an hour Czym będziesz się zajmować? Utrzymaniem i rozwojem infrastruktury Linux oraz klastrów HPC/GPU. Diagnozowaniem i rozwiązywaniem problemów produkcyjnych, zarówno systemowych, jak i sprzętowych czy sieciowych. Automatyzacją konfiguracji i zarządzania infrastrukturą. Rozwijaniem monitoringu i poprawianiem stabilności środowiska. Współpracą przy wdrożeniach i rozwiązywaniu incydentów. Dokumentowaniem rozwiązań i usprawnianiem codziennej pracy. Czego oczekujemy (Hard Skills)? Bardzo dobrej znajomości Linuxa Debian-like i doświadczenia z systemami produkcyjnymi. Doświadczenia z bare-metal i infrastrukturą Data Center. Dobrej znajomości sieci (TCP/IP, DNS, VLAN, routing). Umiejętności samodzielnego diagnozowania problemów systemowych, sieciowych i wydajnościowych. Znajomości Ansible, Git oraz umiejętności pisania skryptów w Bashu i Pythonie. Doświadczenia z monitoringiem i narzędziami diagnostycznymi. Angielskiego pozwalającego na swobodną codzienną komunikację.
- Mile widziane Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU. Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit). Znajomość InfiniBand, RDMA, SLURM. Doświadczenie z Prometheus, Grafana, GitLab CI/CD. Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph). Kim jesteś (Soft Skills)? Potrafisz samodzielnie podejść do problemu i nie boisz się szukać rozwiązań. Lubisz współpracować z innymi i potrafisz jasno komunikować, co robisz. Bierzesz odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji. Chętnie automatyzujesz powtarzalne zadania. Nie masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą. Organizacja pracy Około 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową. Godziny pracy 8:00–18:00, z dwugodzinną przerwą. Praca na Linuxie lub macOS. Scrum, regularne spotkania i dużo bezpośredniej komunikacji w zespole. Obecnie bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest wprowadzenie rotacyjnego on-call. Co oferujemy? Pracę z dużymi klastrami GPU i infrastrukturą AI/HPC. Sporo samodzielności i realny wpływ na to, jak działa infrastruktura. Bezpośrednią współpracę z doświadczonymi inżynierami i Tech Leadem. Możliwość poznania i rozwijania się w technologiach HPC/AI GPU. Krótką ścieżkę decyzyjną, bez zbędnych formalności.
- We may use artificial intelligence (AI) tools to support parts of the hiring process, such as reviewing applications, analyzing resumes, or assessing responses and identifying potential inconsistencies or verification signals in application materials based on available information. These tools assist our recruitment team but do not replace human judgment. Final hiring decisions are ultimately made by humans. If you would like more information about how your data is processed, please contact us.
- apply for this job
