从入门到实战:2025年AI大模型学习路线与避坑指南
背景
最近在学习笔记方面积累了一些经验,分享出来供参考。
实践过程
经过多次尝试和优化,逐渐找到了合适的方案。
总结
以上是近期的实践总结。
最近在学习笔记方面积累了一些经验,分享出来供参考。
经过多次尝试和优化,逐渐找到了合适的方案。
以上是近期的实践总结。
稀疏注意力这块我很认同,不过好奇他们具体是怎么平衡长文本连贯性的。
低价策略确实激进,但中文场景下能把推理成本压到这个程度,技术底子肯定不一般。
分析得挺到位的,我最近也在试DeepSeek-V3的中文长文本处理,多轮对话确实没崩,这点比很多国内模型强。不过关于那个稀疏化注意力的猜测,我倒觉得更可能是训练时用了更高效的MoE路由策略,毕竟成本压到这么低,架构上肯定有创新。唯一担心的是,如果用户量真冲上去,免费或低价模式会不会被迫调整,毕竟算力不是大风刮来的。