沿着问题的线索持续探索,关注技术学习与数字生活,记录学习路径整理、方法总结和真实实践中的思考;不追求堆砌概念,只记录验证过的经验。这里不卖焦虑,只分享方法和真实经验。
确实,兼容ROCm这个策略很聪明,能直接吃CUDA生态的存量红利。但我也好奇,如果只是保证框架能跑通,那海光DCU在算子库深度优化上,比如对FlashAttention这类高频模块有没有针对性加速?不然同样跑通Llama,性能差距还是硬伤啊。