dataclean.py 490 B

123456789101112131415
  1. def clean_pdf_text(text: str) -> str:
  2. """清洗 PDF 解析出的文本,去除常见噪声"""
  3. import re
  4. # 删除非中文字符之间的换行符
  5. text = re.sub(r'[^一](\n)[^一]',
  6. lambda m: m.group(0).replace('\n', ''), text)
  7. # 删除项目符号和多余空格
  8. text = text.replace('•', '').replace(' ', ' ')
  9. # 删除连续的换行符(保留一个)
  10. text = re.sub(r'\n{2,}', '\n', text)
  11. return text.strip()