Ingénieur.e sénior en apprentissage automatique distribué
- Montréal, QC
- Sur place
- Publié 23 avr. 2026
- 1 poste
Ouvre un site externe
- Type d’emploi
- Temps plein
- Niveau d’expérience
- Intermédiaire · 2+ ans
- Formation minimale
- Baccalauréat
- Langue de l’offre
- français
- Heures de travail
- 40 heures par semaine
Résumé du poste
The role involves collaborating with machine learning researchers to accelerate model training and inference, focusing on large-scale models in distributed computing environments. Key tasks include investigating performance bottlenecks, profiling research code, debugging issues, optimizing resource utilization, and developing software tools to simplify distributed computing workflows.
Détails du poste
Nous recherchons un.e ingénieur.e sénior en apprentissage automatique distribué (distributed ML) pour rejoindre notre équipe travaillant sur un agenda de recherche novateur en sécurité de l'IA. Dans ce rôle, vous travaillerez en étroite collaboration avec des chercheur.se.s en apprentissage automatique pour résoudre des problèmes complexes d'entraînement et d'inférence utilisant des modèles de très grande taille. Responsabilités Clés * Collaborer avec les chercheurs.se.s pour accélérer la recherche, l'entraînement et l'inférence des modèles, et faciliter l'utilisation de modèles à grande échelle dans des environnements de calcul distribué. * Investiguer les goulots d'étranglement de performance, profiler le code des expériences de recherche, déboguer les problèmes signalés et optimiser l'utilisation des ressources de calcul. * Développer des outils et des bibliothèques logicielles pour simplifier et orchestrer l'utilisation des ressources de calcul distribué pour les expériences de recherche. * Établir, documenter et maintenir les meilleures pratiques pour les flux de travail de développement de modèles ML distribués à grande échelle. Compétences et Qualifications * Un diplôme dans un domaine pertinent de l'informatique (par exemple, informatique, génie informatique, génie logiciel) est requis. Un diplôme d'études supérieures (maîtrise ou doctorat) lié à l'apprentissage automatique ou aux systèmes ML distribués est préférable, mais n'est pas obligatoire si le candidat démontre des capacités et une expérience exceptionnelles. * Plus de 3 ans d'expérience dans la conception et la mise en œuvre de “frameworks” d'entraînement ML distribué, avec une expérience récente dans l'utilisation, par exemple, de Megatron, DeepSpeed, HuggingFace Accelerate, FSDP, vLLM et/ou verl. * Capacité à collaborer efficacement avec des équipes interfonctionnelles, à documenter les meilleures pratiques et à se tenir au courant des dernières avancées en ML et en développement de logiciels. * Expérience avec les plateformes “cloud” (par exemple, AWS, GCP, Azure) et les gestionnaires de charge de travail (par exemple, Ray, SLURM). * Expérience avec les outils de profilage GPU (par exemple, PyTorch profiler, PyProf, NVIDIA Nsight). * Familiarité avec les outils de conteneurisation (par exemple, gRPC, Docker, Kubernetes). * Familiarité avec les infrastructures et plateformes de données (par exemple, bases de données vectorielles). * Expérience avérée de contribution à des projets de recherche de haute qualité en apprentissage profond. Le titre d'Ingénieur est utilisé à des fins de référence et peut ou non être le titre officiel du candidat en fonction de la juridiction. Ce que nous offrons * L’occasion de contribuer à une mission unique avec un impact important. * Des avantage sociaux complets en matière de santé (incluant un compte de gestion de la santé mentale et du bien-être). * 20 jours de vacances par an dès l'embauche. * Une contribution de l'employeur de 4 % à votre épargne-retraite, sans exigence de contribution équivalente de la part de l'employé. * Une rémunération supplémentaire totalisant 8 % de votre salaire, à attribuer à une épargne-retraite supplémentaire ou à des primes (non lié à la performance). * Une équipe d'experts passionnés et compétents. * Un environnement de travail collaboratif et inclusif dans nos bureaux situés au cœur de la Petite Italie, dans le quartier branché de Mile-Ex, à proximité des transports en commun. À propos de LoiZéro LoiZéro est une organisation à but non lucratif dédiée à faire progresser la recherche et à développer des solutions techniques permettant de concevoir des systèmes d'IA sécuritaires. Son approche scientifique repose sur de nouvelles recherches et méthodes proposées par le professeur Yoshua Bengio, le chercheur en IA le plus cité au monde. Basée à Montréal, LoiZéro mène des recherches pour concevoir des systèmes d’IA non agentiques qui apprennent à comprendre le monde plutôt qu'à y intervenir, en répondant de manière véridique aux questions posées sur la base d'un raisonnement probabiliste transparent et extériorisé. De tels systèmes d'IA pourraient être utilisés pour accélérer la découverte scientifique, superviser les systèmes d'IA agentiques et faire progresser notre compréhension des risques de l'IA et des moyens de les éviter. LoiZéro croit que l’IA doit être considérée comme un bien public mondial, développée et utilisée de manière sécuritaire pour favoriser l’épanouissement humain. Plus d’information : www.loizero.org [https://www.loizero.org/] Vous avez votre place ici À LoiZéro, la diversité nous tient à cœur. Nous valorisons un environnement de travail équitable, ouvert et respectueux des différences. Nous encourageons les candidatures de personnes hautement qualifiées désireuses de travailler à la réalisation de notre mission dans un cadre respectueux, inclusif et collaboratif. Vos informations personnelles seront collectées et traitées par LoiZéro afin d'évaluer votre demande d'emploi conformément à notre politique de vie privée [https://lawzero.org/fr/politique-de-vie-privee]. En vertu des lois sur la protection de la vie privée en vigueur dans votre pays de résidence, vous pouvez disposer de plusieurs droits en matière de protection de la vie privée, comme celui de demander l'accès à vos informations personnelles ou de demander que vos informations personnelles soient rectifiées ou effacées. Vous trouverez des détails sur la manière dont vous pouvez exercer vos droits dans notre politique de protection de la vie privée.
Ce que vous ferez
The role involves collaborating with machine learning researchers to accelerate model training and inference, focusing on large-scale models in distributed computing environments. Key tasks include investigating performance bottlenecks, profiling research code, debugging issues, optimizing resource utilization, and developing software tools to simplify distributed computing workflows.
Exigences
A degree in a relevant computer science field is required, with a postgraduate degree in ML or distributed ML systems being preferred but not mandatory with exceptional experience. Candidates must have over 3 years of experience designing distributed ML training frameworks, proficiency with tools like Megatron/DeepSpeed/FSDP, and familiarity with cloud platforms, workload managers, and GPU profiling tools.
Avantages
• Health Insurance • Mental Health And Wellness Management Account • Vacation Days • Retirement Savings Contribution
Compétences indiquées
- Software · Souhaitée
- Microsoft Azure · Souhaitée
- Kubernetes · Souhaitée
- Respectueux · Souhaitée
- Training · Souhaitée
- Collaboration · Souhaitée
- Docker · Souhaitée
- Health · Souhaitée
- management · Souhaitée
- Apprentissage automatique · Souhaitée
- Amazon Web Services · Souhaitée
- Google Cloud · Souhaitée
Autres compétences pertinentes
Relevées dans la description du poste. Confirmez les exigences importantes ci-dessus.
- Distributed ML Training
- Inference Optimization
- Performance Bottleneck Investigation
- Code Profiling
- Resource Optimization
- Software Tool Development
- Distributed Computing Orchestration
- ML Model Development Workflows
- Cloud Platforms
- Workload Managers
- GPU Profiling Tools
- Containerization Tools
- Vector Databases
- Deep Learning Research Contributions
Domaines d’emploi
- Science & Research
- Engineering
- Software
- Data & Analytics
- Technology
D’autres postes auxquels postuler directement
Des possibilités semblables publiées par des employeurs qui recrutent sur Jobs.ca, sans formulaire externe.
Bédard Ressources Humaines
Gestionnaire d'usine - Industrie alimentaire #1812
CommanditéEmployeur directCandidature simplifiée- Sur place
- Publié 9 sept. 2026
Desjardins
Senior Litigation Advisor -
CommanditéEmployeur directCandidature simplifiée- Hybride
- Calgary, AB
- Publié 9 sept. 2026
Bédard Ressources Humaines
Responsable d’expédition
CommanditéEmployeur directCandidature simplifiée- Sur place
- Mascouche, QC
- Publié 16 sept. 2026