用RAG做代码问答,上下文太长经常截断,有好的方案吗?
我在做一个基于公司内部代码库的RAG问答工具,用的是LlamaIndex加一个本地部署的模型。现在遇到的问题是,用户问一个稍微复杂点的问题,比如“这个模块的接口是怎么和数据库层交互的”,检索出来的代码片段就特别长,经常超过模型的上下文窗口,然后就被强行截断了,回答也变得支离破碎。试过用滑动窗口和摘要,但效果不太稳定。想问下大家,有没有什么更优雅的方式来处理这种长代码上下文的切分和问答?或者有没有专RAG里给大模型喂prompt时,上下文太多反而答不好,怎么优化?
最近在做RAG系统,检索出来的文档片段加到prompt里,结果发现上下文一多(比如超过5个片段),模型反而开始胡言乱语,甚至忽略检索内容自己编。我试过压缩片段长度、调整相似度阈值,但效果不稳定。想请教各位大佬,有没有什么好的prompt设计策略或者片段排序技巧,能让模型更“专注”地利用检索结果?还是说我应该直接限制上下文数量?先谢过!用MCP微调模型时,工具调用总是跑偏,有人遇到吗?
最近在试MCP协议做模型微调,想用Function Calling能力让模型学会调用外部工具。但发现微调后,模型在复杂场景下老是把工具参数搞错,比如把 `get_weather` 的 `city` 参数填成 `temperature` 的值。 我用的开源模型基座是Qwen2.5-7B,训练数据是自己写的一些工具调用示例,大概500条,格式按MCP的tool schema写的。 想问下是不是MCP里用PyTorch做分布式训练,DDP和FSDP到底怎么选?
最近在MCP平台上跑一个多卡分布式训练任务,模型大概7B参数,用的是PyTorch。我看了官方文档,DDP(DistributedDataParallel)和FSDP(FullyShardedDataParallel)都能做数据并行,但搞不太清楚在实际场景下该怎么选。大模型部署后Prompt效果不稳定,有没有什么调优技巧?
最近在部署一个7B的对话模型到线上服务,发现同一个prompt在不同请求下输出质量波动很大,有时候回答很准确,有时候会跑偏甚至重复。试过调整temperature和top_p,但效果不太稳定。想请教大家,在模型部署阶段,有没有针对prompt工程方面的调优经验?比如固定seed是否能改善一致性?或者是否需要在prompt里加一些格式约束?目前用的是vLLM框架,batch推理也开了。求指点,谢谢!用向量数据库做RAG,embedding后直接查还是先聚类再查?
最近在用ChromaDB搭一个简单的RAG系统,数据源是几千篇技术文档。现在做法是把每篇文档切块后embedding,然后直接存进向量库,用户提问时也是embedding后去库里做相似度搜索。微调大模型时显存总爆,大家batch size一般设多少?
最近在尝试微调一个7B的基座模型,用的LoRA,但batch size设到2就爆显存了(24G卡)。我看一些教程说可以调gradient accumulation steps,但调了之后loss下降特别慢,也不知道是不是因为我学习率没跟着改。想问问有经验的朋友:你们微调时batch size大概设多少?显存不够是不是只能换更小的基座模型?另外,gradient accumulation steps
我要提问
大家都在搜
1
魔法原子×速卖通:人形机器人出海不该只靠电商渠道
32
2
用LangChain部署多Agent到生产环境,老报错该怎么排查?
30
3
大家用开源模型写Prompt时,怎么判断模型“理解”了我的意图?
29
4
用ollama本地部署7B模型,8G显存跑起来很慢正常吗?
29
5
魔法原子牵手速卖通:人形机器人出海,电商渠道比技术更关键?
29
6
PyTorch训练时显存一直涨,但batch size已经很小了,是哪里漏了?
27
7
GLM-4.5实测:代码生成追平GPT-4o?Agent场景才是真亮点
27
8
用Cursor写Python脚本,老是生成一堆没用的注释和冗余代码,怎么调?
26
9
用开源模型搭Agent时,记忆模块总崩,大家是怎么解决长对话丢失问题的?
25
10
RAG系统里给大模型加few-shot示例,到底该放query还是放检索结果?
25
11
搞AI Agent时,向量数据库到底该用本地还是上云?好纠结
24
12
用向量数据库做记忆管理,RAG和Agent该选哪个方案?
24
13
用RAG做法律问答,检索到的法条前后矛盾怎么办?
24
14
部署开源大模型做Agent,遇到并发推理+长上下文时OOM怎么破?
24
15
Codex美化升级失效?深度解析Dream Skin的架构设计
24
16
RAG部署后检索效果差,换了好几个embedding模型都不行咋办?
24
17
用Cursor写React组件,prompt怎么组织才能让它一次生成靠谱代码?
24
18
用开源模型做代码补全,老是补出语法错误,是我的幻觉吗?
24
19
星尘Lumo-2隐式世界模型:具身智能的工程化突破还是炫技?
24
20
WAIC大佬发言:AGI落地比想象中更远
24