微调大模型时显存总爆,大家batch size一般设多少?
最近在尝试微调一个7B的基座模型,用的LoRA,但batch size设到2就爆显存了(24G卡)。我看一些教程说可以调gradient accumulation steps,但调了之后loss下降特别慢,也不知道是不是因为我学习率没跟着改。想问问有经验的朋友:你们微调时batch size大概设多少?显存不够是不是只能换更小的基座模型?另外,gradient accumulation steps
我要提问
大家都在搜
1
向量数据库到底怎么选?Milvus和Chroma看懵了
36
2
深度学习框架选择困惑:PyTorch和TensorFlow到底该深入学哪个?
32
3
LoRA微调7B模型后推理显存爆炸,是我的方法不对吗?
31
4
大家用开源编程模型写生产代码时,真的敢直接信任它的重构建议吗?
31
5
微调LLaMA3用来做中文客服,显存不够怎么破?QA数据该咋准备?
30
6
RAG里Prompt模板怎么写才能让大模型老实引用原文而不是乱编?
29
7
微调Llama3后推理变傻了,是数据问题还是我超参设置不合理?
29
8
MCP服务器接入深度学习框架做数据闭环,有大佬趟过坑吗?
28
9
Prompt里加了角色设定反而变笨了,是格式问题还是模型问题?
27
10
用向量数据库做RAG,embedding后直接暴力检索和用索引差距真的大吗?
27
11
RAG里Prompt模板怎么写?感觉调来调去效果都一般
27
12
RAG系统检索结果太碎片化,生成答案逻辑断裂怎么办?
27
13
MCP服务器连多了会不会拖慢Agent响应?感觉越用越卡
27
14
大家用Qwen2.5-Coder写代码时,长上下文真的靠谱吗?
27
15
Copilot和Cursor都用过了,为什么感觉AI写代码还是不太靠谱?
27
16
用LoRA微调Llama3中文能力,效果反而变差了,是我姿势不对吗?
27
17
MCP服务器接入深度学习框架,大家都怎么设计数据流的?
26
18
向量数据库召回率上不去,调了embedding模型也没用,求大佬指点
26
19
部署本地大模型做Agent,显存一直吃紧,有什么省显存的经验吗?
26
20
向量数据库到底该怎么选?Milvus和Pinecone快把我整懵了
26