500AI
Search

Ethan Perez

  • Constitutional AI: Harmlessness from AI Feedback
  • Many-shot Jailbreaking
  • Alignment Faking in Large Language Models
  • Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

All names