中文分词

goujunwe2 分钟前
搜索引擎·网络安全·游戏引擎·全文检索·中文分词
GEO 评估方法:如何自测你的内容,会不会被 AI 引用随着生成式 AI 的普及,越来越多用户通过 ChatGPT、Claude、文心一言、Kimi 等 AI 助手获取信息。AI 在回答问题时,会从海量网页中筛选、提炼并引用内容。如果你的内容被 AI 引用,就能获得大量免费流量;反之,则可能被淹没在信息洪流中。
你想知道什么?1 天前
中文分词
jieba分词器-学习笔记jieba 是一个常用的 Python 中文分词库,主要用于把连续的中文文本切分成词语。它简单易用,支持多种分词模式、自定义词典、词性标注和关键词提取。
醉颜凉7 天前
全文检索·中文分词·索引构建·搜索排序·redissearch
RedisSearch 全文检索:中文分词、索引构建与搜索结果排序RedisSearch 是 Redis 生态系统中的一个强大的全文搜索模块,基于 RediSearch 模块构建,为 Redis 数据库增加了搜索功能。它支持复杂的查询、全文搜索、地理空间查询以及向量化搜索等多种功能,特别适合需要高性能实时搜索的场景。
HwJack2010 天前
全文检索·中文分词·harmonyos
HarmonyOS开发全文检索 FTS 小实战:中文分词与聊天记录搜索关系型数据库除了普通表,还支持 FTS(Full-Text Search)虚拟表,专门做全文检索。普通表用 LIKE ‘%关键词%’ 查询,数据量一大就慢得没法用;FTS 建了倒排索引,检索速度是数量级的提升。下面用一个"聊天记录搜索"的完整案例,讲清楚 FTS 虚拟表创建、中文分词器配置、关键词检索的全流程。
2601_9620996811 天前
python·自然语言处理·中文分词·jieba·开源社区
Python环境下中文分词实现与应用探索这篇文档对基于的中文分词技术以及其应用做了详细介绍, 包含了分词的原理, 方法, 还有实际代码实现, 作者意在为未来的开源中文搜索引擎赋予分词功能, 借由编程的趣味性促使开源社区发展, 文档主要划分成五个部分, 分别是分词模块, 包装模块, 应用程序接口, 模块, 中文分词身为自然语言处理的关键部分, 牵涉到字符串匹配, 理解以及统计等不同种类的分词算法, 中文分词是自然语言处理的根基, 特别是在环境下, 对于理解和解析中文文本极为关键。存在于文档里被提及的分词方法主要涵盖基于字符串匹配、基于理解以及基于
诗词在线21 天前
中文分词
《江东文学发展史》,东吴文风,和中原文坛有什么不同江东地区的文学发展,并非一开始就与中原分庭抗礼。在东汉时期,中原(尤其是洛阳、许都、邺城)是绝对的文化中心。江东文学真正的崛起,是在东吴立国之后,特别是孙权中后期至孙皓时期。
@LiX1 个月前
自然语言处理·中文分词
NLP问题--中文分词①分词是一个被长期研究的任务,通过了解分词算法的发展,可以看到NLP的研究历程②分词是NLP中一类问题的代表
m沐沐2 个月前
人工智能·算法·机器学习·自然语言处理·分类·中文分词·词向量转换
【自然语言处理】词向量转换与中文文本情感分类——从CountVectorizer到朴素贝叶斯jieba库、朴素贝叶斯算法和TF-IDF值是自然语言处理(NLP)中常用的工具和技术,各自在文本处理的不同阶段发挥作用。在自然语言处理的世界里,如何让计算机"读懂"人类语言一直是核心难题,而词向量转换正是破解这一难题的关键钥匙。本次机器学习专题,我们就来深入探讨这一基础又核心的技术。词向量转换的本质,是将文本中离散的词语转化为连续的数值向量。这一步看似简单,却实现了从"机器无法理解的文字"到"可计算的数字"的跨越,为后续的文本分类、情感分析、机器翻译等任务铺平了道路。
knighthood20013 个月前
python·中文分词·harmonyos
鸿蒙PC迁移:jieba 中文分词 Python 三方库鸿蒙PC适配全记录欢迎加入鸿蒙PC开发者社区,共同打造开发者工具生态:鸿蒙PC开发者社区:https://harmonypc.csdn.net/
2601_961845423 个月前
搜索引擎·中文分词·solr·lucene·sphinx·高考
考研公共课资料推荐|英语数学政治|电子版|资料已整理The author argues that education should focus not only on knowledge, ______ on ability.
2601_961845423 个月前
搜索引擎·中文分词·solr·lucene·sphinx·高考
高考真题下载|2025高考全科真题网盘分类整理高考真题下载 后较合理的整理方式是( )A. 按年份、科目、卷别分文件夹保存,原卷与解析分开存放 B. 全部堆在一个文件夹不分类 C. 只下载不保存 D. 下载后立刻删除
蓦然回首却已人去楼空3 个月前
java·算法·中文分词
【分词:中文分词】BPE字节级分词算法实现汉字表达!https://www.bilibili.com/video/BV1AYdiYpE65/?spm_id_from=333.788.videopod.sections&vd_source=173edcc8f6052bd44ad224e1284119c3
m沐沐4 个月前
人工智能·python·机器学习·自然语言处理·nlp·中文分词·tf-idf
【机器学习】NLP---用 Python+TF-IDF 给《红楼梦》自动提取关键词在信息爆炸的时代,快速从文本中抓取核心信息的能力非常重要。TF-IDF 是 NLP 领域最经典、也最容易上手的关键词提取算法之一。本文将带你从零开始,完成从文本读取、分词、去停用词,到使用 TF-IDF 提取每一回关键词的全过程,代码清晰易懂,有需要可直接运行。
莽撞的大地瓜4 个月前
自然语言处理·全文检索·中文分词
多模态内容校对智能体新突破:蜜度校对通以全流程自动化重塑校对标准在信息爆炸的时代,内容生产的效率与准确性成为组织竞争力的核心要素。蜜度推出的多模态内容校对智能体,凭借全流程自动化校对能力与多模态文件兼容性,为政务、媒体、企业等领域提供了高效、精准的内容质检解决方案,重新定义了智能校对的行业标准。
risc1234564 个月前
自然语言处理·中文分词
Viterbi 算法直接用在中文分词上我们把 Viterbi 算法直接用在中文分词上,用你熟悉的“字”和“词”来解释,保证比天气例子更贴近你的直觉。
MaoziShan5 个月前
前端·人工智能·机器学习·语言模型·自然语言处理·中文分词
CMU Subword Modeling | 23 Syllables and Syllabification本文解读 CMU “Subword Modeling” (Spring 2026) 第23讲:Syllables and Syllabification。
尽兴-6 个月前
elasticsearch·中文分词·jenkins·分词器·字符过滤器·切词器·词项过滤器
Elasticsearch 中文分词与自定义 Analyzer 实战:IK、同义词、词库治理分词是 Elasticsearch 构建倒排索引的核心环节,直接决定了检索的精准度与效率。中文因无天然分隔符,原生分词器常难以满足复杂业务需求——自定义分词器成为破局关键。
WongLeer6 个月前
elasticsearch·中文分词·ik
Elasticsearch 从入门到实战(含 IK 分词器 + 完整查询示例)本文基于 Elasticsearch 8.x,总结了一套从基础操作到进阶查询、再到中文分词优化的完整实践流程,适合初学者快速上手。
深念Y6 个月前
大数据·数据库·elasticsearch·中文分词·jenkins·ki分词器
Elasticsearch 8.11 + IK 分词器安装踩坑记录最近在做视频搜索功能,需要在 Windows 环境下搭建 Elasticsearch 环境。本以为是个简单的任务,结果踩了一堆坑,记录一下供后人参考。
LEAKSENSE6 个月前
中文分词
机房漏水监测系统白皮书:技术革新×应用实践·未来蓝图《数字化转型背景下机房漏水监测系统白皮书》执行摘要 机房作为数字经济时代的核心基础设施,其安全稳定运行直接关系到数据资产与业务连续性。液漏风险是威胁机房物理安全的首要隐患,一次微小的渗漏即可引发服务器短路、数据丢失及业务中断,造成数百万乃至千万级的经济损失。然而,传统人工巡检与早期监测技术存在响应滞后、误报率高、定位困难等核心瓶颈。本白皮书基于行业深度洞察,结合立科(广州)检测技术有限公司(以下简称“立科LEAKSENSE”)二十年的专业实践,系统剖析机房漏水监测的现状、挑战,并提出一套融合前沿技术与系统