
个人 Maker
Tri Dao
把 Transformer 注意力和状态空间模型压进高效 GPU 内核的机器学习系统 Maker
持续在做什么
Tri Dao 是机器学习系统与高效算法研究者,现任普林斯顿大学计算机科学助理教授、Dao AI Lab 负责人,并联合创办 Together AI、担任首席科学家。他长期研究算法与现代硬件的协同设计:FlashAttention 以 IO 感知的精确注意力算法减少显存读写并加速 Transformer,FlashAttention-2/3/4 持续提高 GPU 利用率;Mamba、状态空间对偶与 ReplaySSM 等工作则把长序列建模、推理缓存和底层 CUDA/CuTe 内核连接起来。他通过论文、技术博客和开源仓库持续把研究成果转化为可复用的训练与推理基础设施。
值得先看
0 条内容还没有整理值得先看的内容。
