500AI
← People

Nabeel Shan

Website ↗GitHub ↗Hugging Face ↗Institution ↗
  • Language models
  • Reinforcement learning

Selected work

5
  1. Advanced LLM Adaptation: From Supervised Fine-Tuning to Reinforcement Learning for Dialogue SummarizationMaintainer↗
  2. End-to-End Reinforcement Learning from Human Feedback (RLHF)Creator↗
  3. The Transformer Adaptation PlaybookCreator↗
  4. GPT-Forge: A From-Scratch Transformer for Text GenerationCreator↗
  5. Math VLM Pipeline: Handwritten Math to LaTeXCreator↗
Suggest an edit
About & privacy