什么是 FlashAttention?为什么注意力计算能更快更省显存
FlashAttention 是什么?它没有改变 Transformer 的结果,为什么却能加速长上下文训练与推理?讲清显存读写瓶颈、分块计算与实际意义。
共 3 篇
FlashAttention 是什么?它没有改变 Transformer 的结果,为什么却能加速长上下文训练与推理?讲清显存读写瓶颈、分块计算与实际意义。
Transformer 一次看所有 token,为什么还能分清“我喜欢你”和“你喜欢我”?位置编码是什么、有哪些做法、它和上下文长度有何关系,一文讲清。
ChatGPT 背后到底在做什么?用最直白的方式讲清大模型的核心:它其实只是在「预测下一个词」,以及 Transformer、注意力机制、训练两阶段。