check_pdf_images.py 993 B

12345678910111213141516171819202122232425262728293031323334353637
  1. """检查PDF是否为图片型PDF"""
  2. import fitz # PyMuPDF
  3. # 打开PDF文件
  4. pdf_path = r"D:\investment\疯狂的里海 · 投资方法论 — 基于 367 篇投资周记提炼.pdf"
  5. try:
  6. doc = fitz.open(pdf_path)
  7. print(f"PDF文件: {pdf_path}")
  8. print(f"总页数: {len(doc)}")
  9. # 检查前几页
  10. for i in range(min(5, len(doc))):
  11. page = doc[i]
  12. # 获取文本
  13. text = page.get_text()
  14. # 获取图片
  15. images = page.get_images()
  16. print(f"\n=== 第 {i+1} 页 ===")
  17. print(f"文本长度: {len(text)}")
  18. print(f"图片数量: {len(images)}")
  19. if len(text) == 0 and len(images) > 0:
  20. print(" → 这页是图片型PDF,需要OCR处理")
  21. elif len(text) > 0:
  22. print(f" → 文本内容: {text[:100]}...")
  23. doc.close()
  24. except Exception as e:
  25. print(f"错误: {e}")
  26. import traceback
  27. traceback.print_exc()