About this role
Research Scientist / Engineer – Training Infrastructure at Luma Labs. Location: Palo Alto or London or Remote. Role: Design training, Optimize performance, Build monitoring Requirements: Distributed PyTorch training experience; GPU clusters; networking/storage; NCCL/MPI; Linux scripting; containerization; cloud experience. Category: Engineering Seniority: Senior Level Tools: PyTorch, CUDA, NCCL, MPI, Linux, Docker, Kubernetes, NVIDIA GPUs Commitment: Full Time Workplace: Hybrid Languages: English