def clean_pdf_text(text: str) -> str: """清洗 PDF 解析出的文本,去除常见噪声""" import re # 删除非中文字符之间的换行符 text = re.sub(r'[^一](\n)[^一]', lambda m: m.group(0).replace('\n', ''), text) # 删除项目符号和多余空格 text = text.replace('•', '').replace(' ', ' ') # 删除连续的换行符(保留一个) text = re.sub(r'\n{2,}', '\n', text) return text.strip()