About this role
Member of Technical Staff - ML Infrastructure & Performance at Moonlake. Location: San Mateo, California, United States. Role: optimize GPU, implement serving, tune parallelism Requirements: Develop ML infrastructure; GPU performance; serving stack; parallelism; quantization; systems; on-site in San Mateo. Category: Research and Development (R&D) Seniority: Senior Level Tools: CUDA, Triton, FlashAttention, TensorRT, vLLM, TGI, NCCL, Ray, Kubernetes, Argo, Prometheus, Grafana, OpenTelemetry Commitment: Full Time Workplace: Onsite Languages: English