Memory-efficient attention

英文原文文件:memory_efficient_attention.md

计算解释

将 GPU 显存层级与 I/O 流量视为首要约束的注意力实现。

支撑阅读卡

后续计算范式下过时或退居次要的内容

仅通过已链接的阅读卡追踪,不将本方法页视为独立证据来源。