Remotely
machine learningdata qualitydata processingdatatokenizationdatasetsvq representations
Job Description
📋 Description
- Advance how OpenAI builds and understands pretraining data at scale
- Develop methods to select, combine, and transform data
- Create datasets that improve model capabilities
- Design rigorous experiments to understand data choices and interventions
- Translate successful research into scalable data processing pipelines
- Collaborate with frontier models and web-scale data to build evidence
🎯 Requirements
- Strong track record of new or improved ML ideas (publications, projects, or applied research)
- Ability to own and drive a research agenda with long-running impact
- Interest in empirical, collaborative research approaches
🎁 Benefits
- Equity opportunity
- Competitive salary and equity package