500AI
Search

Guangxuan Xiao

  • Efficient Streaming Language Models with Attention Sinks
  • SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
  • DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
  • FastComposer: Tuning-Free Multi-Subject Image Generation with Localized Attention

All names