导读:从朴素内核到 cuBLAS 的 94%——CUDA 矩阵乘法优化工作记录
Published:
一篇围绕 CUDA SGEMM 逐步优化的导读:从朴素实现的 1.3% 到 warptiling 的 93.7%,拆解每一版内核的性能瓶颈、优化手段与实测数据,并梳理其中可迁移的方法论。
Published:
一篇围绕 CUDA SGEMM 逐步优化的导读:从朴素实现的 1.3% 到 warptiling 的 93.7%,拆解每一版内核的性能瓶颈、优化手段与实测数据,并梳理其中可迁移的方法论。
Published:
对 veRL、TRL、DeepSpeed、OpenRLHF、slime、NeMo-RL 六个主流后训练框架做源码级横向对比:推理引擎选型、训练并行路线、同步与异步、权重同步难题、多轮 TITO 与 MoE 路由回放,并附 Miles v0.1 的谱系对照。
Published:
对 DeepSeek-V4.1-Flash 技术报告的模块化拆解:CED 因果编码器-解码器、CSA2 压缩稀疏注意力、MoE 规格、KV Cache 与上下文预算,逐条标注证据等级并回溯一手来源。