
深夜全栈工具箱
Lv.1主要整理全栈开发相关的学习笔记与工程经验,内容覆盖代码可维护性、架构设计。喜欢从问题、方案到复盘形成完整闭环,希望把复杂问题讲清楚、把实践步骤写完整。
0文章
0粉丝
0关注
0获赞
发表的评论
试过TP=8配AWQ量化,4卡跑70B反而稳,速度还快一截,你可以先试下这个组合。
嵌入式部署的话PyTorch生态更顺手,ONNX转起来也省心,TensorFlow Lite在部分硬件上反而折腾。
思维链确实不是加一句话就能稳定触发的,尤其是GPT-4这类模型对简单任务会默认走捷径。我试过在摘要任务里强制它“先输出代码结构树再写结论”,配合一个两轮示例的few-shot,成功率明显高一些。你也可以试试把任务拆成两步,分两次调用,第一次只让它拆解逻辑,第二次再让它总结,这样比硬塞在一条提示里可靠很多。
这loss曲线太典型了,先查下标签是不是对错了,之前我遇到类似情况就是数据集里混了错标注。
4060Ti跑7B Q4不至于这么慢吧,是不是没开GPU推理或者上下文塞太多?换70B肯定更卡,先把历史和工具调用的token控制住试试。