Lukasz KaiserAttention Is All You NeedReformer: The Efficient TransformerCan Active Memory Replace Attention?Evaluating Large Language Models Trained on CodeAll names