Lua 第11部分 小插曲:出现频率最高的单词

在本章中,我们要开发一个读取并输出一段文本中出现频率最高的单词的程序。像之前的小插曲一样,本章的程序也十分简单但是也使用了诸如迭代器和匿名函数这样的高级特性。

该程序的主要数据结构是一个记录文本中出现的每一个单词及其出现次数之间关系的表。使用这个数据结构,该程序可以完成 3 个主要任务。

(1)读取文本并计算每一个单词的出现次数。

(2)按照出现次数的降序对单词列表进行排序。

(3)输出有序列表中的前 n 个元素。

要读取文本,可以遍历每一行,然后遍历每一行的每一个单词。对于我们读取的每一个单词,增加对应计数器的值:

Lua 复制代码
local  counter = {}

for line in io.lines() do
	for word in string.gmatch(line, "%w+") do
		counter[word] = (counter[word] or 0) + 1
	end
end

这里,我们使用模式"%w+"来描述"单词", 也就是一个或多个字母或数字。

下一步就是对单词列表进行排序。不过,就像一些有心的读者可能已经注意到的那样,我们并没有可以用来排序的单词列表。尽管如此,使用表 counter 中作为键的单词来创建一个列表还是很简单的:

Lua 复制代码
local words = {}		-- 文本中所有单词的列表

for w in pairs(counter) do
	words[#words + 1] = w
end

一旦有了单词列表,就可以使用函数 table.sort 对其进行排序 :

Lua 复制代码
table.sort( words, function (w1, w2)
	return counter[w1] > counter[w2] or
			counter[w1] == counter[w2] and w1 < w2
end )

统计单词出现频率的程序完整的代码如下:

Lua 复制代码
local  counter = {}

for line in io.lines() do
	for word in string.gmatch(line, "%w+") do
		counter[word] = (counter[word] or 0) + 1
	end
end

local words = {}		-- 文本中所有单词的列表

for w in pairs(counter) do
	words[#words + 1] = w
end

table.sort( words, function (w1, w2)
	return counter[w1] > counter[w2] or
			counter[w1] == counter[w2] and w1 < w2
end )

-- 要输出的字数
local n = math.min(tonumber(arg[1]) or math.huge, #words)

for i = 1, n do
	io.write(words[i], "t", counter[words[i]], "\n")
end

最后一个循环输出了结果,也就是前 n 个单词及它们对应的计数值。这个程序假定第 1个参数是要输出单词的个数;默认情况下,如果没有参数,它会输出所有的单词 。

相关推荐
自学AI的鲨鱼儿24 分钟前
ubuntu22.04安装gvm管理go
开发语言·后端·golang
旭意38 分钟前
C++微基础备战蓝桥杯之数组篇10.1
开发语言·c++·蓝桥杯
MediaTea1 小时前
Python:匿名函数 lambda
开发语言·python
R-G-B1 小时前
【06】C#入门到精通——C# 多个 .cs文件项目 同一项目下添加多个 .cs文件
开发语言·c#·c# 多个 .cs文件项目
数据知道2 小时前
Go基础:正则表达式 regexp 库详解
开发语言·mysql·golang·正则表达式·go语言
小蒜学长2 小时前
jsp基于JavaWeb的原色蛋糕商城的设计与实现(代码+数据库+LW)
java·开发语言·数据库·spring boot·后端
zhangfeng11332 小时前
亲测可用,R语言 ggplot2 箱线图线条控制参数详解,箱线图离散数值控制
开发语言·python·r语言·生物信息
yzx9910132 小时前
国庆科技感祝福:Python 粒子国旗动画
开发语言·人工智能·python
迪丽热爱2 小时前
【练】C程序设计-01程序设计和C语言
c语言·开发语言
扶尔魔ocy2 小时前
【QT常用技术讲解】opencv实现摄像头图像检测并裁剪物体
开发语言·qt·opencv