| 123456789101112131415161718192021 |
- from langchain_community.document_loaders import PyMuPDFLoader
- import re
- def load_pdf_document(pdf_path: str)-> list:
- # 创建加载器实例,传⼊ PDF ⽂件路径
- pdf_loader = PyMuPDFLoader(pdf_path)
- # 调⽤ load() ⽅法,返回⼀个 Document 列表(每⻚⼀个 Document)
- pdf_pages = pdf_loader.load()
- # 看看加载结果
- print(f"⽂档类型:{type(pdf_pages)}")
- print(f"PDF 共 {len(pdf_pages)} ⻚")
- return pdf_pages
- def clean_pdf_text(text: str) -> str:
- #删除换行符
- text = text.replace('\n', '')
- #删除多余空格
- text = re.sub(r'\s+', ' ', text)
- #删除连续换行符,只保留一个
- text = re.sub(r'\n+', '\n', text)
- return text.strip()
|