500AI
Search

Jan Leike

  • Scalable agent alignment via reward modeling
  • Auditing Language Models for Hidden Objectives

All names