最近在搭一个带长期记忆的Agent,用LangChain接的Chroma和Pinecone。看官方文档懵了:有的教程让直接存用户对话历史的向量,有的说还要把原始文本一起塞进metadata里,还有的推荐只存embedding,说省空间。我现在是每次对话都把整段历史重新向量化再存进去,结果token消耗爆炸,检索还老返回重复的旧内容。想问下实际工程里,大家存记忆的字段结构一般怎么设计?有没有必要做时间衰减或者重要性过滤?还有,用Pinecone这种托管服务,和本地用FAISS,在Agent场景下差别大吗?求真实踩坑经验。