最近在搭一个文档问答的Agent,用的LangChain+Chroma,文档主要是财报和研报PDF。遇到一个头疼的事:PDF里只要带表格(资产负债表、利润表那种),解析出来就是乱码或者排版全乱,喂给embedding模型后检索出来根本没法看。试过pypdf、pdfplumber,还有用unstructured的partition_pdf,效果都一般。想问问大家生产环境里一般怎么处理表格型PDF?是先用OCR转成Markdown再切块,还是有专门的表格抽取模型?另外,表格转成文本后,切块策略有什么讲究?感觉直接按字符切会把表头和数值拆散,检索效果很差。希望有踩过坑的朋友指点一下,感谢!