About this role
Research Engineer, Reinforcement Learning at TensorStax. Location: San Francisco, California, United States. Role: Develop rewards, Create environments, Fine-tune models Requirements: Strong RL knowledge, LLM fine-tuning (PPO, DPO, KTO), RL for language models, dataset curation, experimental design, independent work. Category: Research and Development (R&D) Seniority: Mid Level Tools: PyTorch, PPO, DPO, KTO, GRPO, SWE-Gym, SWE-RL, Snowflake, BigQuery, Redshift Commitment: Full Time Workplace: Hybrid Languages: English