| 12345678910111213141516171819202122232425262728293031323334353637 |
- """检查PDF是否为图片型PDF"""
- import fitz # PyMuPDF
- # 打开PDF文件
- pdf_path = r"D:\investment\疯狂的里海 · 投资方法论 — 基于 367 篇投资周记提炼.pdf"
- try:
- doc = fitz.open(pdf_path)
-
- print(f"PDF文件: {pdf_path}")
- print(f"总页数: {len(doc)}")
-
- # 检查前几页
- for i in range(min(5, len(doc))):
- page = doc[i]
-
- # 获取文本
- text = page.get_text()
-
- # 获取图片
- images = page.get_images()
-
- print(f"\n=== 第 {i+1} 页 ===")
- print(f"文本长度: {len(text)}")
- print(f"图片数量: {len(images)}")
-
- if len(text) == 0 and len(images) > 0:
- print(" → 这页是图片型PDF,需要OCR处理")
- elif len(text) > 0:
- print(f" → 文本内容: {text[:100]}...")
-
- doc.close()
-
- except Exception as e:
- print(f"错误: {e}")
- import traceback
- traceback.print_exc()
|