jieba

2601_9620996811 天前
python·自然语言处理·中文分词·jieba·开源社区
Python环境下中文分词实现与应用探索这篇文档对基于的中文分词技术以及其应用做了详细介绍, 包含了分词的原理, 方法, 还有实际代码实现, 作者意在为未来的开源中文搜索引擎赋予分词功能, 借由编程的趣味性促使开源社区发展, 文档主要划分成五个部分, 分别是分词模块, 包装模块, 应用程序接口, 模块, 中文分词身为自然语言处理的关键部分, 牵涉到字符串匹配, 理解以及统计等不同种类的分词算法, 中文分词是自然语言处理的根基, 特别是在环境下, 对于理解和解析中文文本极为关键。存在于文档里被提及的分词方法主要涵盖基于字符串匹配、基于理解以及基于
仅此,9 个月前
运维·docker·postgresql·容器·中文分词·jieba
docker 方式,postgreSQL18 安装 jieba 分词器扩展首先用 docker 启动 pgsql 最新版,目前最新版是 18:然后按照如下命令来就行了
最晚的py9 个月前
分词·jieba
jieba分词jieba分词是一款流行的中文分词工具,支持精确模式、全模式和搜索引擎模式三种分词方式。其核心功能包括分词、词性标注、关键词提取等,广泛应用于自然语言处理任务。
AndrewHZ9 个月前
python·beautifulsoup·jieba·语言学·文本分析·文学分析·朱自清
【Python与生活】Python文本分析:解码朱自清散文的语言密码朱自清的散文以“语言洗练、情感真挚、意境优美”著称,是中国现代散文的典范。如果用Python对他的经典作品进行数据分析,会发现哪些隐藏的语言规律和创作特色?本文将通过数据获取→文本处理→多维度分析→可视化的完整流程,用技术手段解锁朱自清散文的语言密码。
王伯安呢1 年前
python·百度·中文分词·jieba·新手教程·技术教程
Python实战:爬取百度热搜榜,制作动态可视化报告今天,我将带大家用Python实现一个完整的项目:爬取百度热搜榜,并生成高颜值的柱状图和词云图。这个进阶版教程不仅能让你学会基础爬虫,还将深入数据可视化,让你轻松驾驭分词、配色和自定义图形,最终效果绝对让你眼前一亮!
姜—姜1 年前
数据挖掘·数据分析·numpy·pandas·matplotlib·jieba·seaborn
数据分析总结数据分析是对数据进行系统性梳理,方便人们更好的去了解。其目的是提炼核心结论,揭示数据背后的规律,为决策提供理论依据。接下来我从以下几个方面展示一份数据是怎么做到可视化的效果的,为决策提供理论的。
卡戎-caryon1 年前
linux·前端·网络·搜索引擎·boost·jieba·cpp-http
【项目实践】boost 搜索引擎boost搜索引擎具体讲解视频对于boost库,官方是没有提供搜索功能的,我们这个项目就是来为它添加一个站内搜索的功能。
多吃轻食1 年前
人工智能·深度学习·自然语言处理·中文分词·分词·jieba·隐马尔可夫
Jieba分词的原理及应用(三)“结巴”中文分词:做最好的 Python 中文分词组件上一篇文章讲了使用TF-IDF+分类器范式进行企业级文本分类的案例。其中提到了中文场景不比英文场景,在喂给模型之前需要进行分词操作。
是十一月末2 年前
开发语言·python·自然语言处理·tf-idf·jieba
自然语言处理之jieba分词和TF-IDF分析结巴分词(Jieba)是一个广泛使用的中文分词Python库,它支持多种分词模式,并且可以添加自定义词典来提高分词的准确性。
友猫2 年前
python·jieba·wordcloud
wordcloud分词生成代码如下 _使用的文本 _ 1.xiaoshuo.txt文件 2.背景为白色的一张图片,538eba130bea1e8c.webp 结果
林鸿群2 年前
tensorflow·matplotlib·jieba·xtarfile
macOS平台TensorFlow环境安装1.安装xtarfile2.安装3.安装jieba4.安装tensorflow安装成功
逐梦苍穹2 年前
人工智能·自然语言处理·jieba·结巴分词
【NLP】文本处理的基本方法【jieba分词、命名实体、词性标注】🍃作者介绍:双非本科大三网络工程专业在读,阿里云专家博主,专注于Java领域学习,擅长web应用开发、数据结构和算法,初步涉猎人工智能和前端开发。 🦅个人主页:@逐梦苍穹 📕所属专栏:人工智能 🌻gitee地址:xzl的人工智能代码仓库 ✈ 您的一键三连,是我创作的最大动力🌹
有勇气的牛排2 年前
自然语言处理·中文分词·jieba
中文分词库 jieba 详细使用方法与案例演示jieba 是一个非常流行的中文分词库,具有高效、准确分词的效果。它支持3种分词模式:测试环境:python3.10.9
guts3502 年前
python·搜索引擎·自然语言处理·jieba·nltk
【python】swjtu西南交大互联网搜索引擎 项目一 报告:搜索引擎文本预处理通过下载引擎(Web Crawler/Spider)自动下载至少500个英文文档/网页,以及500个中文文档/网页,越多越好,并保留原始的文档/网页备份(如:News_1_Org.txt)
Mount2563 年前
python·jieba·wordcloud·词云
wordcloud库和jieba库的使用在使用wordcloud库的时候,运行报错:ValueError: Only supported for TrueType fonts
爱看书的小沐3 年前
python·自然语言处理·tf-idf·分词·sklearn·jieba·nltk
【小沐学NLP】Python实现TF-IDF算法(nltk、sklearn、jieba)TF-IDF(term frequency–inverse document frequency)是一种用于信息检索与数据挖掘的常用加权技术。TF是词频(Term Frequency),IDF是逆文本频率指数(Inverse Document Frequency)。
微小冷3 年前
python·tkinter·jieba·wordcloud·词云
Python词云生成工具3:定制更多参数我们所有的设置都放在了wcDct中,所以若想用更多的参数来定制词云,那么只需在wcDct中添加内容,例如下面这些整型参数
llsxily3 年前
django·haystack·whoosh·jieba
稍微深度踩坑haystack + whoosh + jieba说到django的全文检索,网上基本推荐的都是 haystack + whoosh + jieba 的方案。 由于我的需求对搜索时间敏感度较低,但是要求不能有数据的错漏。 但是没有调试的情况下,搜索质量真的很差,搞得我都想直接用Like搜索数据库算了。 但是峰回路转,还是让我找到几个信息,稍微优化了一下搜索结果。
我是有底线的