linux命令 根据某一字段去掉txt中重复的数据

前提:

文档为格式化好的数据。比如一行是一个json。

判断总共有多少行数据:

grep No f.txt | wc -l

查询重复数据有多少行:

grep No f.txt | sort -u | wc -l

找到重复的那行数据:(如果每行的json数据大,可忽略此操作)

grep No f.txt |sort|uniq -d

去除重复数据:

awk -v No=2 '!seen$No++' f.txt > output.txt

去重命令的工作原理是:

  • awk:文本处理工具。

  • -v No=2:设置awk变量No为2,这是我们要去重的列号。

  • !seen[$No]++:前缀运算符!用来判断数组seen中是否存在当前行的第No列的值。如果不存在,则执行后面的操作,即打印当前行。

  • input.txt:输入文件名。

  • > output.txt:将结果输出到output.txt文件中。

请确保你的输入文件是以空格或者制表符分隔的,并且列号是从1开始计数的。如果列与列之间的分隔符是其他字符,可以通过-F选项来指定分隔符。

相关推荐
MaximusCoder9 分钟前
等保测评命令——weblogic
运维·安全·安全威胁分析
xixingzhe216 分钟前
nginx无网络升级
服务器·nginx
喜欢吃燃面17 分钟前
HTTP协议深度解析:从请求响应到状态管理与安全传输
linux·网络协议·学习
Tanner_SL24 分钟前
Linux笔记之正则表达式和文本处理grep,sed,awk命令
linux·正则表达式
学linux的QQ蛋42 分钟前
Linux 文件 IO vs 标准 IO:缓冲区、目录操作、常用函数汇总
linux·运维·服务器
比兔代理1 小时前
静态住宅IP在品牌保护中的角色:稳定出口与长期监测
服务器·网络·ip
苍狗T1 小时前
k8s 控制器管理
linux·运维·云原生·容器·kubernetes
Linux运维技术栈1 小时前
筑牢业务信息安全防线:雷池WAF+后端日志溯源的全链路防护体系落地实践
linux·安全·雷池
笨笨饿1 小时前
#121_图传中的H.364编码与MP4的联系
linux·运维·前端·单片机·嵌入式硬件·面试·职场和发展
运维糕手1 小时前
一次 EVS"disk doesn't exist"报错的完整排查:我差点删掉生产Kafka
运维