document.py 731 B

123456789101112131415161718192021
  1. from langchain_community.document_loaders import PyMuPDFLoader
  2. import re
  3. def load_pdf_document(pdf_path: str)-> list:
  4. # 创建加载器实例,传⼊ PDF ⽂件路径
  5. pdf_loader = PyMuPDFLoader(pdf_path)
  6. # 调⽤ load() ⽅法,返回⼀个 Document 列表(每⻚⼀个 Document)
  7. pdf_pages = pdf_loader.load()
  8. # 看看加载结果
  9. print(f"⽂档类型:{type(pdf_pages)}")
  10. print(f"PDF 共 {len(pdf_pages)} ⻚")
  11. return pdf_pages
  12. def clean_pdf_text(text: str) -> str:
  13. #删除换行符
  14. text = text.replace('\n', '')
  15. #删除多余空格
  16. text = re.sub(r'\s+', ' ', text)
  17. #删除连续换行符,只保留一个
  18. text = re.sub(r'\n+', '\n', text)
  19. return text.strip()