from langchain_community.document_loaders import PyMuPDFLoader import re def load_pdf_document(pdf_path: str)-> list: # 创建加载器实例,传⼊ PDF ⽂件路径 pdf_loader = PyMuPDFLoader(pdf_path) # 调⽤ load() ⽅法,返回⼀个 Document 列表(每⻚⼀个 Document) pdf_pages = pdf_loader.load() # 看看加载结果 print(f"⽂档类型:{type(pdf_pages)}") print(f"PDF 共 {len(pdf_pages)} ⻚") return pdf_pages def clean_pdf_text(text: str) -> str: #删除换行符 text = text.replace('\n', '') #删除多余空格 text = re.sub(r'\s+', ' ', text) #删除连续换行符,只保留一个 text = re.sub(r'\n+', '\n', text) return text.strip()