to learn


稍微写一下自己想学点什么好了

算子优化
通信优化
调度优化
计算与通信overlap
c++/python
cuda编程模型
了解Tensor core、WGMMA、Shared Memory等底层细节
并行算法设计与优化
GEMM、注意力、MoE、稀疏算子优化
Megatron、vLLM、SGLang、TensorRT-LLM等分布式训练/推理框架


文章作者: Austin
版权声明: 本博客所有文章除特別声明外,均采用 CC BY 4.0 许可协议。转载请注明来源 Austin !
评论
  目录