"""检查PDF是否为图片型PDF""" import fitz # PyMuPDF # 打开PDF文件 pdf_path = r"D:\investment\疯狂的里海 · 投资方法论 — 基于 367 篇投资周记提炼.pdf" try: doc = fitz.open(pdf_path) print(f"PDF文件: {pdf_path}") print(f"总页数: {len(doc)}") # 检查前几页 for i in range(min(5, len(doc))): page = doc[i] # 获取文本 text = page.get_text() # 获取图片 images = page.get_images() print(f"\n=== 第 {i+1} 页 ===") print(f"文本长度: {len(text)}") print(f"图片数量: {len(images)}") if len(text) == 0 and len(images) > 0: print(" → 这页是图片型PDF,需要OCR处理") elif len(text) > 0: print(f" → 文本内容: {text[:100]}...") doc.close() except Exception as e: print(f"错误: {e}") import traceback traceback.print_exc()