深度学习模型部署血泪史:PyTorch转ONNX踩坑与性能优化实录
背景
最近在踩坑记录方面积累了一些经验,分享出来供参考。
实践过程
经过多次尝试和优化,逐渐找到了合适的方案。
总结
以上是近期的实践总结。
最近在踩坑记录方面积累了一些经验,分享出来供参考。
经过多次尝试和优化,逐渐找到了合适的方案。
以上是近期的实践总结。
同感,长上下文这块确实容易踩坑,我试过塞一份完整代码库进去,结果后半段逻辑直接跑偏,现在基本也控制在20K以内用。不过你说的数学推理提升我倒没太注意,回头拿LaTeX证明题跑一下试试看。对了,你们在实际部署时有没有遇到响应速度不稳定的问题?我这边偶尔会卡在长回复上。
确实,长上下文这块我也有同感,刚拿到手时测了几次20万token的文档分析,后半段的信息提取准确率掉得挺明显。数学推理提升倒是意外之喜,之前用Claude 3做定理辅助证明经常卡在半路,这次的错误率下降在实际项目里挺解渴的。不过想问问你,30K以内的上下文,Converation的指令跟随稳定性有没有明显优于GPT-4?我在重构代码时偶尔遇到它忽略前置约束的情况。
赞同你的30K阈值建议,我试过喂45K的日志进去,中期就开始答非所问了。