最近把项目从GPT-4换到了开源的Qwen2.5-Coder-32B,主要看中它128K上下文和免费商用。但实际用下来有点困惑:单文件重构(比如500行以内)表现确实惊艳,几乎能一次改对。可只要涉及跨文件调用,或者让它参考项目里另一个文件里的函数签名,它就开始“胡编”参数名了。我试过把相关代码片段手动贴进对话,但一旦总输入超过2万token,它明显开始忽略中段信息,只盯着最后一两千字回答。想问下大家,是我用的量化版(AWQ)问题,还是这模型本身的长程注意力就这么拉胯?有没有在复杂仓库上成功用起来的兄弟,传授下prompt组织技巧?