Guangxuan Xiao
- Efficient Streaming Language Models with Attention Sinks
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
- DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
- FastComposer: Tuning-Free Multi-Subject Image Generation with Localized Attention