【无标题】word 中的中文排序

复制代码
import docx
from docx import Document
from docx.shared import Pt
from pypinyin import pinyin, Style, lazy_pinyin
import re


def get_first_char_pinyin(text):
    """获取中文段落开头汉字的拼音(首字母大写)"""
    if re.match(r'[\u4e00-\u9fff]', text):
        return lazy_pinyin(text[0], style=Style.FIRST_LETTER)[0].upper()
    return ''


def is_chinese_paragraph(paragraph):
    """判断段落是否为中文段落"""
    return bool(re.match(r'[\u4e00-\u9fff]', paragraph.text.strip()))


def apply_font_to_paragraph(paragraph, font_name='宋体'):
    """为段落应用指定的字体"""
    for run in paragraph.runs:
        try:
            run.font.name = font_name
        except ValueError:
            # 如果字体名称无效或不受支持,可能会引发ValueError
            # 这里可以捕获异常并做适当处理,比如记录日志或回退到默认字体
            pass


def sort_paragraphs(paragraphs):
    """根据要求排序段落,处理空文本段落"""
    chinese_paragraphs = []
    english_paragraphs = []

    for p in paragraphs:
        stripped_text = p.text.strip()
        if stripped_text:  # 只处理非空文本段落
            if is_chinese_paragraph(p):
                # 对中文段落,使用拼音首字母作为排序键(如果文本非空)
                # 注意:这里假设 get_first_char_pinyin 能处理单字符输入
                chinese_paragraphs.append(
                    (p, get_first_char_pinyin(stripped_text[0]) if len(stripped_text) > 0 else ''))
            else:
                # 对英文段落,使用文本首字母小写作为排序键(如果文本非空)
                english_paragraphs.append((p, stripped_text[0].lower() if len(stripped_text) > 0 else ''))

                # 对中英文段落分别按排序键排序(注意这里我们存储了段落和排序键的元组)
    chinese_paragraphs.sort(key=lambda x: x[1])
    english_paragraphs.sort(key=lambda x: x[1])

    # 提取排序后的段落对象列表
    sorted_chinese = [p for p, _ in chinese_paragraphs]
    sorted_english = [p for p, _ in english_paragraphs]

    # 合并排序后的中英文段落列表
    return sorted_chinese + sorted_english


def main(input_path, output_path):
    # 读取Word文档
    doc = Document(input_path)
    paragraphs = doc.paragraphs

    # 排序段落
    sorted_paragraphs = sort_paragraphs(paragraphs)

    # 创建新的Word文档并添加排序后的段落
    new_doc = Document()
    for para in sorted_paragraphs:
        new_para = new_doc.add_paragraph()
        # 复制段落内容
        new_para.add_run(para.text)
        # 为中文段落应用宋体字体(如果可用)
        if is_chinese_paragraph(para):
            apply_font_to_paragraph(new_para, '宋体')

            # 保存新的Word文档
    new_doc.save(output_path)


if __name__ == "__main__":
    input_path = 'input.docx'  # 输入的Word文件路径
    output_path = 'sorted_output.docx'  # 输出的Word文件路径
    main(input_path, output_path)
相关推荐
SmartRadio1 天前
CH585M+MK8000、DW1000 (UWB)+W25Q16的低功耗室内定位设计
c语言·开发语言·uwb
kylezhao20191 天前
C#winform数据绑定
c#
rfidunion1 天前
QT5.7.0编译移植
开发语言·qt
rit84324991 天前
MATLAB对组合巴克码抗干扰仿真的实现方案
开发语言·matlab
大、男人1 天前
python之asynccontextmanager学习
开发语言·python·学习
hqwest1 天前
码上通QT实战08--导航按钮切换界面
开发语言·qt·slot·信号与槽·connect·signals·emit
AC赳赳老秦1 天前
DeepSeek 私有化部署避坑指南:敏感数据本地化处理与合规性检测详解
大数据·开发语言·数据库·人工智能·自动化·php·deepseek
不知道累,只知道类1 天前
深入理解 Java 虚拟线程 (Project Loom)
java·开发语言
国强_dev1 天前
Python 的“非直接原因”报错
开发语言·python
YMatrix 官方技术社区1 天前
YMatrix 存储引擎解密:MARS3 存储引擎如何超越传统行存、列存实现“时序+分析“场景性能大幅提升?
开发语言·数据库·时序数据库·数据库架构·智慧工厂·存储引擎·ymatrix