最近在个人项目里用Qwen2.5-Coder-14B(本地部署,8bit量化)做一个小工具的重构,代码库大概几千行Python。我发现一个现象:如果我把整个项目文件都塞进上下文(大概3万token),它生成的代码风格确实更一致,但偶尔会在某个函数里突然“忘记”前面定义的变量名,或者重复实现一个已经存在的工具函数。而如果我只给单个文件的上下文(几千token),它反而更稳,但跨文件调用时又经常瞎猜接口。想问问大家,这种“长上下文反而变笨”的情况是我量化精度的问题,还是模型本身的注意力机制局限?有没有什么好的上下文管理技巧?