R语言jiebaR包使用摘要

r 复制代码
library(tidyverse)
library(jiebaR)

1、jiebaR安装

=========================

github中有包,但已经近十年未更新,下载地址: !\[\]https://github.com/qinwf/jiebaR
注意,jiebaR和jiebaRD必须一同下载

r 复制代码
install.packages(
  "C:/Users/ostri/Downloads/jiebaR.tar.gz", 
  repos = NULL, type = "win.binary")
setwd("C:/Documents/chn")
getwd()
(fl <- list.files())
read_excel(fl[1])

2、创建词典

=========================

3、用结巴分词

=========================

r 复制代码
wk <- worker( )
# 增加自定义的词典
my_dict <- read_lines('my_dict.txt',header=FALSE)
new_user_word(wk,my_dict$V1)
segment(txt,wk)

4、设置STOP_WRODS

=========================

自定义词典,规定了哪些字组成词

但对stop_wrod没有涉及,需要单独导入

将stop_wrod保存在stop_words.txt文件中

将其作为jiebaR的stop_words:

R 复制代码
# 注意在worker中,只能用目录,不能是R的对象
wk <- worker(stop_word = 'stop_words.txt')

5、开始分词

===========================

r 复制代码
txt <- read_lines('a.txt')
head(txt)
dt <- tibble(
  txt=segment(txt,wk)
  )%>% 
  group_by(txt) %>% 
  mutate(
    cnt=n()
  ) %>% 
  ungroup() %>% 
  arrange(desc(cnt)) %>% 
  unique()

6、对结果进行二次过滤

==================

即将一些词视作stop_words,在结果中剔除

r 复制代码
flter <- c("也就是说","我说","敬启者")
dt <- tibble(
  txt=segment(txt,wk) %>% 
  filter_segment(flter)) %>% 
    group_by(txt) %>% 
    mutate(
      cnt=n()
    ) %>% 
    ungroup() %>% 
    arrange(desc(cnt)) %>% 
    unique() 
相关推荐
神仙别闹10 小时前
基于 C++ 实现(控制台)学生成绩管理系统
开发语言·c++
伞伞悦读11 小时前
【第36期】Python 目录与路径详解:pathlib、文件遍历、创建、复制、移动和删除风险
开发语言·python
2601_9669496514 小时前
只拿到股票代码还不够:量化程序到底还需要哪些标的信息?——从数据建模开始理解股票元数据
开发语言·python·数据分析·pandas·量化交易·股票数据·quantdash
m0_7345717614 小时前
深入理解5g <十八>传输块tbsize的计算
开发语言·5g
RAN114267600815 小时前
1.3第一个程序的介绍
开发语言·qt
blue_ice .16 小时前
Verilog DDS 数字信号发生器:DAC 输出模拟波形与 ADC 回采观测
开发语言·单片机·嵌入式硬件·fpga开发
远翔调光芯片^1382879887216 小时前
ECP5702能芯科技PD取电芯片在市场上的优势有哪些?
开发语言·人工智能·单片机·嵌入式硬件·智能家居
泡海椒17 小时前
规则引擎对比:JQuick-Java vs Drools 轻量场景选型对比
java·开发语言
泡泡鱼(敲代码中)17 小时前
Python 容器类型学习笔记:列表、元组、字典、集合
开发语言·笔记·python·pycharm
2501_9336707917 小时前
平台招商运营校招能力模型:数据分析、SQL与增长场景拆解
开发语言