| 123456789101112131415 |
- def clean_pdf_text(text: str) -> str:
- """清洗 PDF 解析出的文本,去除常见噪声"""
- import re
-
- # 删除非中文字符之间的换行符
- text = re.sub(r'[^一](\n)[^一]',
- lambda m: m.group(0).replace('\n', ''), text)
-
- # 删除项目符号和多余空格
- text = text.replace('•', '').replace(' ', ' ')
-
- # 删除连续的换行符(保留一个)
- text = re.sub(r'\n{2,}', '\n', text)
-
- return text.strip()
|