关于C++遍历中文字符串的问题

今天来介绍一个C++中的基础问题:中文字符串的遍历问题。可就是这么的一个基础问题,也坑了我不少时间,真是应了那句话基础不牢,地动山摇

小试牛刀

首先我们来一个demo,假如要使用std::string遍历"你好,世界123"这个字符串,你会怎么写?

当时笔者是这么想的

于是大手一挥,Ctrl C + Ctrl V写下了一下代码:

c 复制代码
using namespace std;
int main() {
    std::string text = "你好,世界123";
    for (const auto c:text) {
        std::cout << "c:" << c << std::endl;
    }
    return 0;
}

运行起来一看,我都懵逼了,居然是乱码...

一看到乱码,笔者首先想到的可能编码不是utf-8的,于是我改了一行代码:

c 复制代码
 std::string text = u8"你好,世界123";

结果还是于事无补,还是乱码的,我开始有点慌了...

在这里说明一下当在C++中使用字符串字面值时,可以使用前缀u8来表示使用UTF-8编码。这意味着该字符串会以UTF-8编码的格式存储在内存中。

面对这些乱码,我不得不拿出CV工程师的杀手锏,赶紧上stackoverflow求助...

不负众望,果然被我找到了答案。。。

马上复制粘贴来验证一波...

ini 复制代码
using namespace std;
int main() {
    std::string text = u8"你好,世界123";
    for(size_t i = 0; i < text.length();)
    {
        int cplen = 1;
        if((text[i] & 0xf8) == 0xf0) cplen = 4;
        else if((text[i] & 0xf0) == 0xe0) cplen = 3;
        else if((text[i] & 0xe0) == 0xc0) cplen = 2;
        if((i + cplen) > text.length()) cplen = 1;
        cout << text.substr(i, cplen) << endl;
        i += cplen;
    }
    return 0;
}

运行起来,果然是想要的结果。666,凭实力攻克了一个技术难题,带领公司往前跨了一大步,这回升级加薪稳了吧!!!

寻根问底

本着举一反三的学习态度,我想知道为什么中文字符串的遍历要特殊处理,我找到了这个:en.wikipedia.org/wiki/UTF-8#...

原来一个中文字符不一定是和英文一样占用一个字符,它们可能会占用几个字符,但它们的长度其实可以从字符的头中读取出来的。

我简单地用浏览器翻译了一下,大家将就这看一下大概意思

当然如果你不想自己写获取中文字符长度的逻辑代码,也可以用别人写好的开源库。这里给大家推荐一个轻量级的,只有一个utf8.h文件的开源库: github.com/sheredom/ut...

那么我们的代码就变成了这样:

c 复制代码
int main() {
    std::string text = u8"你好,世界123";
    for (size_t i = 0; i < text.size();)
    {
        auto cplen = utf8codepointcalcsize(&text[i]);
        std::cout << text.substr(i, cplen) << std::endl;
        i += cplen;
    }
    return 0;
}

其实我们查看下utf8.h这个库的utf8codepointcalcsize函数内部实现,和我们上面说的是一样的。

这么一个简单的坑,以前怎么没发现这个问题?一个是没遇到过这样的需求,二是就算用到了也不是用C++实现的,例如在QT上直接使用QString就没有这些问题。

好了,关于C++遍历中文字符串的坑就分享到这里啦,关注我,后期不定期更新...

相关推荐
liu****5 分钟前
10.排序
c语言·开发语言·数据结构·c++·算法·排序算法
快乐的划水a12 分钟前
std::thread与pthread关系
c++
_OP_CHEN13 分钟前
【算法基础篇】(三十二)动态规划之背包问题扩展:从多重到多维,解锁背包问题全场景
c++·算法·蓝桥杯·动态规划·背包问题·算法竞赛·acm/icpc
Studying 开龙wu1 小时前
Windos 10系统安装OpenPose的CPU版本过程说明和Release版本直接使用
c++·windows
温柔の敲代码1 小时前
从微观到宏观了解C++项目的编译
开发语言·c++
另寻沧海1 小时前
C++ Lambda表达式的隐式转换陷阱
java·c++·算法
好评1241 小时前
C++ 字符串:始于 char*,终于深拷贝
开发语言·c++·stl·字符串
小尧嵌入式1 小时前
QT软件开发知识点流程及记事本开发
服务器·开发语言·数据库·c++·qt
HyperAI超神经2 小时前
活动回顾丨 北大/清华/Zilliz/MoonBit共话开源,覆盖视频生成/视觉理解/向量数据库/AI原生编程语言
人工智能·ai·开源·编程语言·向量数据库·视频生成·视觉理解
冷崖2 小时前
单例模式-创建型
c++·单例模式