James Aung
Source-listed: AI Security Institute (AISI), United Kingdom
- Information retrieval
- Evaluation
Selected work
5- Measuring AI Agents’ Progress on Multi-Step Cyber Attack ScenariosContributor · 2026
- PaperBench: Evaluating AI’s Ability to Replicate AI ResearchContributor · 2025
- MLE-bench: Evaluating Machine Learning Agents on Machine Learning EngineeringContributor · 2024
- SWE-bench VerifiedContributor · 2024
- GPT-4o System CardContributor · 2024