微调大模型时显存总爆,大家batch size一般设多少?
最近在尝试微调一个7B的基座模型,用的LoRA,但batch size设到2就爆显存了(24G卡)。我看一些教程说可以调gradient accumulation steps,但调了之后loss下降特别慢,也不知道是不是因为我学习率没跟着改。想问问有经验的朋友:你们微调时batch size大概设多少?显存不够是不是只能换更小的基座模型?另外,gradient accumulation steps
我要提问
大家都在搜
1
用Cursor写Python脚本,老是生成一堆没用的注释和冗余代码,怎么调?
64
2
GLM-4.5实测:代码生成追平GPT-4o?Agent场景才是真亮点
64
3
请问向量数据库在实际RAG应用里,Top-K召回到底怎么调才靠谱?
64
4
魔法原子牵手速卖通,人形机器人出海真能绕过工程落地坑?
63
5
自己用PyTorch微调Llama,显存总爆掉,有什么省钱又实用的技巧吗?
62
6
新手求教:用PyTorch微调LLaMA时显存总爆,是我代码写错了吗?
61
7
微调后的模型做Agent,感觉推理能力变差了,是数据问题吗?
61
8
RAG里怎么把用户query写成更好的向量搜索prompt?效果时好时坏
60
9
PyTorch训练时显存一直涨,但batch size已经很小了,是哪里漏了?
60
10
魔法原子牵手速卖通:人形机器人出海,电商渠道比技术更关键?
60
11
用LangChain部署多Agent到生产环境,老报错该怎么排查?
59
12
魔法原子×速卖通:人形机器人出海不该只靠电商渠道
59
13
用开源模型搭Agent时,记忆模块总崩,大家是怎么解决长对话丢失问题的?
59
14
向量数据库在RAG里到底能抗多大并发?我用FAISS崩了
58
15
微调LLaMA时loss一直在2.x下不去,是数据问题还是超参没调好?
58
16
请教大佬们,用PyTorch训练时显存总爆,是我代码写太烂了吗?
58
17
美图RoboNeo vs. Lovart:国产AI设计工具终于不‘抄作业’了?
58
18
MCP服务器连Claude后,为啥只能读文件不能写?
58
19
PyTorch和JAX在Transformer训练上到底差多少?求真实体验
57
20
Cursor写Python后端代码,总给我加一些没用的import,怎么调教?
57