在正则表达式中匹配汉字

在正则表达式中,匹配汉字主要有以下几种方式:

1. Unicode 范围匹配(最常用)

regex 复制代码
[\u4e00-\u9fa5]

这个范围涵盖了大部分常用汉字,是最常用的匹配方式。

2. 不同编码范围的汉字匹配

regex 复制代码
# 基本汉字(常用)
[\u4e00-\u9fff]

# 扩展汉字范围(包括生僻字)
[\u4e00-\u9fff\u3400-\u4dbf\uf900-\ufaff]

# 更完整的汉字范围
[\u4e00-\u9fff\u3400-\u4dbf\uf900-\ufaff\u2e80-\u2eff\u3000-\u303f\uff00-\uffef]

3. 实际应用示例

javascript 复制代码
// JavaScript 示例
const chineseRegex = /[\u4e00-\u9fa5]/g;
const text = "Hello 世界!Hello World!";
const chineseChars = text.match(chineseRegex);
console.log(chineseChars); // ["世", "界"]

// 匹配连续汉字
const chineseWordsRegex = /[\u4e00-\u9fa5]+/g;
const chineseWords = text.match(chineseWordsRegex);
console.log(chineseWords); // ["世界"]
python 复制代码
# Python 示例
import re

text = "Hello 世界!Hello World!"
chinese_regex = r'[\u4e00-\u9fa5]'
chinese_chars = re.findall(chinese_regex, text)
print(chinese_chars)  # ['世', '界']

# 匹配连续汉字
chinese_words_regex = r'[\u4e00-\u9fa5]+'
chinese_words = re.findall(chinese_words_regex, text)
print(chinese_words)  # ['世界']

4. 常用匹配模式

regex 复制代码
# 匹配纯汉字字符串
^[\u4e00-\u9fa5]+$

# 匹配汉字开头
^[\u4e00-\u9fa5]

# 匹配汉字结尾
[\u4e00-\u9fa5]$

# 匹配2-4个汉字
^[\u4e00-\u9fa5]{2,4}$

# 匹配汉字、字母、数字混合
^[\u4e00-\u9fa5a-zA-Z0-9]+$

5. 各语言中的注意事项

5.1 JavaScript

JavaScript 复制代码
// 需要添加 u 标志来正确处理 Unicode
const regex = /[\u4e00-\u9fa5]/gu;

5.2 Python

Python 复制代码
# Python 3 默认支持 Unicode,直接使用即可
import re
pattern = re.compile(r'[\u4e00-\u9fa5]')

5.3 Java

java 复制代码
// Java 中使用双反斜杠
String regex = "[\\u4e00-\\u9fa5]";
Pattern pattern = Pattern.compile(regex);

6. 实际应用场景

javascript 复制代码
// 验证中文姓名(2-4个汉字)
const nameRegex = /^[\u4e00-\u9fa5]{2,4}$/;
console.log(nameRegex.test("张三")); // true
console.log(nameRegex.test("张三丰")); // true
console.log(nameRegex.test("John")); // false

// 提取文本中的所有中文
const text = "Hello 世界,这是一段包含中文的文本。Hello World!";
const chineseRegex = /[\u4e00-\u9fa5]+/g;
const result = text.match(chineseRegex);
console.log(result); // ["世界", "这是一段包含中文的文本"]

这些正则表达式可以满足大部分汉字匹配的需求,根据具体的使用场景选择合适的范围即可。

相关推荐
2301_781833521 天前
Python 正则表达式入门教程
开发语言·python·正则表达式
五阿哥永琪1 天前
正则表达式
数据库·mysql·正则表达式
小森林之主1 天前
深入正则表达式:核心语法与实战剖析
javascript·python·正则表达式·编程技巧·字符串处理
小森林之主1 天前
JavaScript 正则表达式:从零开始的实战对比
javascript·正则表达式·前端开发·性能对比·文本处理
不吃土豆的马铃薯1 天前
C++ 正则表达式入门详解
linux·服务器·网络·数据库·c++·正则表达式
二月夜4 天前
剖析Java正则表达式回溯问题
java·正则表达式
小林ixn5 天前
从拼多多手机号验证到模板引擎:深入正则表达式与 JS 字符串处理
开发语言·javascript·正则表达式
水木流年追梦6 天前
大模型入门-大模型优化方法12-YaRN 长文本外推技术
人工智能·分布式·算法·正则表达式·prompt
水木流年追梦6 天前
大模型入门-大模型优化方法13- MTP 多 token 输出、DCA 双块注意力
人工智能·分布式·算法·正则表达式·prompt
YHHLAI7 天前
[特殊字符] 拼多多大厂笔试题——正则表达式
正则表达式