← People

Ajay Pravin Mahale

  • Language models
  • Interpretability

Selected work

5
  1. Causally Grounded Mechanistic Interpretability for LLMs with Faithful Natural-Language ExplanationsContributor · 2026
  2. Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic VariationContributor · 2026
  3. Glassbox — mechanistic interpretability and EU AI Act compliance toolkitMaintainer · 2026
  4. Causally Grounded Mechanistic Interpretability and Faithful Natural-Language ExplanationsMaintainer · 2026
  5. Activation Patching FrameworkMaintainer · 2025