AI and ML Infra Software Engineer, GPU Clusters - New College Grad 2026

NVIDIA AI
US - Washington - Redmond
View Company Profile / << Go Back

  • Job Type: Full time
  • 30+ days ago

Job Description

Collaborate with AI/ML research teams to identify infrastructure gaps and implement scalable solutions on GPU clusters. Monitor and optimize infrastructure performance to ensure high availability and efficient resource utilization for researchers.

Requirements: Requires a recent graduate with a MS, PhD, or equivalent in Computer Science with experience in HPC and accelerated computing. Proficiency in Python, Go, and distributed training frameworks like PyTorch or JAX is essential.

Key Skills: AI/ML Infrastructure, HPC Workloads, GPU Computing, PyTorch, Kubernetes, Slurm, Docker, Python, Go, Bash, Distributed Training, Infiniband, Cloud Computing, Data Processing, Model Inference, Parallel Computing

Benefits: Competitive salaries, Comprehensive benefits package, Equity




Fast Track Upload