SRE HPC AI Infrastructure H/F/N
- Hiring from
- France
- Work type
- Hybrid
- Posted
Show job descriptionHide job description
Vous voulez contribuer à des projets uniques pour construire ensemble le cloud libre ? Allons-y !
Chez OVHcloud, nous sommes animés par la même volonté, celle de construire l’avenir ensemble pour défendre la liberté d’innover.
► Découvrez l’acteur majeur du cloud libre et responsable
DÉTAILS
VOTRE MISSION
SRE HPC AI Infrastructure H/F/N
Au sein de votre équipe #OneTeam
-
Intégrer l’équipe AI Infrastructure & Data au sein de la BU AI. Votre mission sera de manager une équipe de 3 ingénieurs pour concevoir, déployer, superviser, maintenir et faire évoluer notre infrastructure IA de training et d’inférence dédiée aux besoins internes.
-
Fournir aux équipes Data Science, ML Engineering et produits internes une plateforme IA performante, disponible, sécurisée et efficiente en coûts et en énergie, en vous appuyant sur nos datacenters et notre savoir-faire industriel.
-
Ces utilisateurs, vos futurs collègues, exploiteront notre infrastructure GPU, de stockage et réseau afin d'utiliser une plateforme hautement automatisée en self-service, du dataset au modèle en production.
Vos principales responsabilités
-
Manager une équipe de 3 ingénieurs pour concevoir, déployer, superviser, maintenir et faire évoluer notre infrastructure IA
-
Être le point d’entrée unique de nos équipes clientes internes (recueil des besoins, engagements de service SLO, communication)
-
Porter la gouvernance des données de la plateforme (cycle de vie, classification, conformité RGPD, ISO 27001, SecNumCloud, accès)
-
Définir et faire vivre l’architecture cible de la plateforme et porter les décisions structurantes (ADR) ainsi que les revues de code
-
Piloter les SLO, la capacité, les budgets GPU et les indicateurs de coûts et d’efficience énergétique de la plateforme
-
Apporter un leadership technique expérimenté sur les pratiques Infrastructure as Code, GitOps, CI/CD, observabilité et HA
-
Encadrer nos ingénieurs par une gestion personnalisée sur le plan du développement personnel et technique
-
Participer à l’astreinte et assurer le rôle de point d’escalade et d’interlocuteur client en cas d’incident majeur
-
Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes
-
Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur
-
Travailler en étroite collaboration avec les équipes OVHcloud en France et à l’International
Votre futur impact
Dans 6 mois
- Vous aurez pris vos marques au sein de l'équipe AI Infrastructure & Data et du département IT.
- Vous comprendrez l'infrastructure existante, les défis actuels liés aux workloads IA et les besoins des équipes internes.
- Vous aurez participé à la conception des évolutions techniques, apportant votre expertise GPU/HPC et vos idées.
- Vous aurez peut-être même commencé à prototyper ou à tester certaines solutions d'orchestration ou de stockage.
- Vous aurez établi des relations avec les utilisateurs internes (Data Scientists, ML Engineers), recueillant leurs besoins et leurs retours sur l'infrastructure actuelle.
- Vous aurez mis en place des boucles de feedback pour assurer une amélioration continue.
- Vous aurez exploré les solutions du marché et les meilleures pratiques en matière d'infrastructures IA, afin de recommander des approches adaptées aux besoins d'OVHcloud.
Et dans 1 an
-
Vous aurez joué un rôle clé dans le déploiement et l'automatisation de la nouvelle infrastructure IA.
-
Vous aurez mis en place des outils et des processus (IaC, GitOps) pour assurer son bon fonctionnement, sa sécurité et sa scalabilité.
-
Vous aurez partagé votre expertise en matière d'infrastructure HPC/IA avec les équipes internes, en organisant des formations, des présentations ou des ateliers.
-
Vous aurez peut-être même contribué à des événements ou des conférences.
-
Vous aurez interagi avec la communauté de développeurs, en partageant vos connaissances, en posant des questions et en contribuant à des projets open source.
Compétences requises :
- Vous possédez une forte expérience technique sur la conception et l'exploitation d'infrastructures GPU/HPC ou cloud à grande échelle
- Vous maîtrisez les orchestrateurs (Kubernetes, Slurm), l'IaC (Terraform, Ansible) et les outils CI/CD / GitOps (ArgoCD, Prometheus)
- Vous avez de solides connaissances des réseaux haute performance (InfiniBand, RoCE) et du stockage distribué (Ceph, Lustre, S3)
- Vous maîtrisez des langages de scripting/développement tels que Python, Go et Bash
- Vous êtes autonome et capable de travailler main dans la main avec votre équipe ainsi que les utilisateurs des services que vous proposez Vous êtes capable de vous concentrer sur les tâches techniques complexes et de vous adapter à un contexte changeant
- Avec un grand sens du service, vous souhaitez avoir un impact positif sur vos contacts internes
- Vous êtes ouvert sur le monde et travailler dans un contexte international en anglais est un aspect important pour vous
NOTRE PARCOURS DE RECRUTEMENT
3. Cas pratique (si pertinent)
4. Rencontre avec un pair, un membre de l'équipe ou de la direction
5. Débriefing ensemble
NOS AVANTAGES ET BÉNÉFICES
✔︎ Une politique de télétravail hybride
✔︎ Un plan d'actionnariat salarié
✔︎ Un programme de reconnaissance de l'ancienneté
✔︎ Des subventions vacances et sport
✔︎ Berceau et crèche d'entreprise (selon site)
Mais aussi :
✔︎ Des équipes multiculturelles
✔︎ Des locaux bien équipés
✔︎ Une plateforme de formation et de certification en ligne
✔︎ Une offre d'accompagnement médical et social digitalisée pour vous et votre famille
REJOINDRE L’AVENTURE OVHCLOUD
OVHcloud valorise la diversité des personnes qu’elle embauche et accompagne.
La diversité pour nous, c’est favoriser un milieu de travail où les différences individuelles sont reconnues, appréciées et respectées de façon à développer le plein potentiel et les forces de chacune et chacun.
Soyez libre d’être vous-même !
L'IA DANS L'ADN
L'intelligence artificielle réinvente nos métiers au quotidien.
Rejoignez-nous pour explorer ses immenses possibilités et coconstruire l'avenir !
LE DÉVELOPPEMENT DURABLE CHEZ OVHCLOUD, UN ENGAGEMENT PROFOND
À CHACUNE SON POTENTIEL, OSEZ POSTULER !
Nous savons que les femmes peuvent parfois s'abstenir de postuler si elles ne répondent pas à 100% des critères d'une offre.
Nous souhaitons clarifier : nos fiches de poste sont des repères, pas des barrières. Nous avons hâte de recevoir votre candidature.
Cette offre ne répond pas tout à fait à vos attentes ? Candidatez malgré tout !
C'est l'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.
Cette offre ne répond pas tout à fait à vos attentes ? Candidatez spontanément sur le portail candidat pour rejoindre l'une de nos équipes !
L'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.
Vous voulez contribuer à des projets uniques pour construire ensemble le cloud libre ? Allons-y ! Chez OVHcloud, nous sommes animés par la même volonté, celle de construire l’avenir ensemble pour défendre la liberté d’innover.
► Découvrez l'acteur majeur du cloud libre et responsable
VOTRE MISSION
SRE HPC AI Infrastructure H/F/N
Au sein de votre équipe #OneTeam
-
Intégrer l’équipe AI Infrastructure & Data au sein de la BU AI. Votre mission sera de manager une équipe de 3 ingénieurs pour concevoir, déployer, superviser, maintenir et faire évoluer notre infrastructure IA de training et d’inférence dédiée aux besoins internes.
-
Fournir aux équipes Data Science, ML Engineering et produits internes une plateforme IA performante, disponible, sécurisée et efficiente en coûts et en énergie, en vous appuyant sur nos datacenters et notre savoir-faire industriel.
-
Ces utilisateurs, vos futurs collègues, exploiteront notre infrastructure GPU, de stockage et réseau afin d'utiliser une plateforme hautement automatisée en self-service, du dataset au modèle en production.
Vos principales responsabilités
-
Manager une équipe de 3 ingénieurs pour concevoir, déployer, superviser, maintenir et faire évoluer notre infrastructure IA
-
Être le point d’entrée unique de nos équipes clientes internes (recueil des besoins, engagements de service SLO, communication)
-
Porter la gouvernance des données de la plateforme (cycle de vie, classification, conformité RGPD, ISO 27001, SecNumCloud, accès)
-
Définir et faire vivre l’architecture cible de la plateforme et porter les décisions structurantes (ADR) ainsi que les revues de code
-
Piloter les SLO, la capacité, les budgets GPU et les indicateurs de coûts et d’efficience énergétique de la plateforme
-
Apporter un leadership technique expérimenté sur les pratiques Infrastructure as Code, GitOps, CI/CD, observabilité et HA
-
Encadrer nos ingénieurs par une gestion personnalisée sur le plan du développement personnel et technique
-
Participer à l’astreinte et assurer le rôle de point d’escalade et d’interlocuteur client en cas d’incident majeur
-
Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes
-
Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur
-
Travailler en étroite collaboration avec les équipes OVHcloud en France et à l’International
Votre futur impact
Dans 6 mois
- Vous aurez pris vos marques au sein de l'équipe AI Infrastructure & Data et du département IT.
- Vous comprendrez l'infrastructure existante, les défis actuels liés aux workloads IA et les besoins des équipes internes.
- Vous aurez participé à la conception des évolutions techniques, apportant votre expertise GPU/HPC et vos idées.
- Vous aurez peut-être même commencé à prototyper ou à tester certaines solutions d'orchestration ou de stockage.
- Vous aurez établi des relations avec les utilisateurs internes (Data Scientists, ML Engineers), recueillant leurs besoins et leurs retours sur l'infrastructure actuelle.
- Vous aurez mis en place des boucles de feedback pour assurer une amélioration continue.
- Vous aurez exploré les solutions du marché et les meilleures pratiques en matière d'infrastructures IA, afin de recommander des approches adaptées aux besoins d'OVHcloud.
Et dans 1 an
-
Vous aurez joué un rôle clé dans le déploiement et l'automatisation de la nouvelle infrastructure IA.
-
Vous aurez mis en place des outils et des processus (IaC, GitOps) pour assurer son bon fonctionnement, sa sécurité et sa scalabilité.
-
Vous aurez partagé votre expertise en matière d'infrastructure HPC/IA avec les équipes internes, en organisant des formations, des présentations ou des ateliers.
-
Vous aurez peut-être même contribué à des événements ou des conférences.
-
Vous aurez interagi avec la communauté de développeurs, en partageant vos connaissances, en posant des questions et en contribuant à des projets open source.
Compétences requises :
- Vous possédez une forte expérience technique sur la conception et l'exploitation d'infrastructures GPU/HPC ou cloud à grande échelle
- Vous maîtrisez les orchestrateurs (Kubernetes, Slurm), l'IaC (Terraform, Ansible) et les outils CI/CD / GitOps (ArgoCD, Prometheus)
- Vous avez de solides connaissances des réseaux haute performance (InfiniBand, RoCE) et du stockage distribué (Ceph, Lustre, S3)
- Vous maîtrisez des langages de scripting/développement tels que Python, Go et Bash
- Vous êtes autonome et capable de travailler main dans la main avec votre équipe ainsi que les utilisateurs des services que vous proposez Vous êtes capable de vous concentrer sur les tâches techniques complexes et de vous adapter à un contexte changeant
- Avec un grand sens du service, vous souhaitez avoir un impact positif sur vos contacts internes
- Vous êtes ouvert sur le monde et travailler dans un contexte international en anglais est un aspect important pour vous
Cette offre ne répond pas tout à fait à vos attentes ? Candidatez malgré tout !
C'est l'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.
Cette offre ne répond pas tout à fait à vos attentes ? Candidatez spontanément sur le portail candidat pour rejoindre l'une de nos équipes !
L'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.