Jerry Wei
Source-listed: AI researcher; lead of the deployment-robustness team · Anthropic
- Language models
- Efficient ML
Selected work
5- Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal JailbreaksAuthor · 2026
- Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red TeamingAuthor · 2025
- Long-form factuality in large language modelsContributor · 2024
- Simple synthetic data reduces sycophancy in large language modelsContributor · 2023
- Symbol tuning improves in-context learning in language modelsContributor · 2023