最近在做一个行业知识库的问答Agent,文档里有大量带表格的PDF。我用PyPDF2直接抽文本,表格内容全挤成一团,检索时经常把表头和数值拆得七零八落,重新排序后答非所问。试过把表格转成markdown再切块,效果比纯文本好一点,但碰到跨页表格还是容易错位。也考虑过用RAGFlow或者unstructured,但没敢直接上,担心部署成本和学习曲线。想问问大家在生产环境里一般怎么处理表格类PDF的?是直接转图片丢给多模态模型,还是有什么轻量的结构化工具能嵌入现有pipeline?求个成熟点的方案,实在有点头疼。