【Python Cookbook】S02E15 在文本中处理 HTML 和 XML 实体

目录

问题

我们如果想要将 HTML 实体以及 XML 实体内容替换成相对应的文本内容,怎么做?

解决方案

python 复制代码
s = "Elements are written as '<tag>txt</tag>'."

import html
print(html.escape(s))
print("-"*20, "Disable escaping of quotes", "-"*20)
print(html.escape(s, quote=False))

结果为

python 复制代码
Elements are written as &#x27;&lt;tag&gt;txt&lt;/tag&gt;&#x27;.
-------------------- Disable escaping of quotes --------------------
Elements are written as '&lt;tag&gt;txt&lt;/tag&gt;'.

其中,解析出的各结果解释如下:

  • &#x27 代表 "
  • &lt 代表 <
  • &gt 代表 >

在第二个输出中,因为我们在 html.escape() 函数中添加参数 quote=False ,所以在结果中并不会解析 " 引号~

如果要生成 ASCII 文本,并且想针对非 ASCII 字符将其对应的字符编码实体嵌入到文本中,可以在各种同 I/O 相关的函数中使用 errors='xmlcharrefreplace' 参数来实现。

python 复制代码
s = "Spicy Jalapeño"
print(s.encode("ascii", errors="xmlcharrefreplace"))

结果:

python 复制代码
b'Spicy Jalape&#241;o'

如果由于某种原因在得到的文本中带有一些实体,而我们又想要得到其内容,可以利用 HTML 以及 XML 解析器自带的功能函数和方法来完成。

python 复制代码
s = "Spicy &quot;Jalape&#241;o&quot"
import html
print(html.unescape(s))
t = "The prompt is &gt;&gt;&gt;"
from xml.sax.saxutils import unescape
print(unescape(t))

结果

python 复制代码
Spicy "Jalapeño"
The prompt is >>>

讨论

在生成 HTMLXML 文档时,适当的对特殊字符做转义处理推荐使用如 html.escape() 这样的函数。

而如果要反过来,即将 HTMLXML 实体转换成对应的字符,推荐使用像 html.unescape()xml.sax.saxutils.unescape() 这样的函数。

相关推荐
ahead~1 小时前
【大模型入门】访问GPT_API实战案例
人工智能·python·gpt·大语言模型llm
iphone1081 小时前
一次编码,多端运行:HTML5多终端调用
前端·javascript·html·html5
大模型真好玩1 小时前
准确率飙升!GraphRAG如何利用知识图谱提升RAG答案质量(额外篇)——大规模文本数据下GraphRAG实战
人工智能·python·mcp
19891 小时前
【零基础学AI】第30讲:生成对抗网络(GAN)实战 - 手写数字生成
人工智能·python·深度学习·神经网络·机器学习·生成对抗网络·近邻算法
applebomb2 小时前
没合适的组合wheel包,就自行编译flash_attn吧
python·ubuntu·attention·flash
Chasing__Dreams2 小时前
python--杂识--18.1--pandas数据插入sqlite并进行查询
python·sqlite·pandas
彭泽布衣3 小时前
python2.7/lib-dynload/_ssl.so: undefined symbol: sk_pop_free
python·sk_pop_free
喜欢吃豆4 小时前
从零构建MCP服务器:FastMCP实战指南
运维·服务器·人工智能·python·大模型·mcp
一个处女座的测试4 小时前
Python语言+pytest框架+allure报告+log日志+yaml文件+mysql断言实现接口自动化框架
python·mysql·pytest
nananaij4 小时前
【Python基础入门 re模块实现正则表达式操作】
开发语言·python·正则表达式