linux命令 根据某一字段去掉txt中重复的数据

前提:

文档为格式化好的数据。比如一行是一个json。

判断总共有多少行数据:

grep No f.txt | wc -l

查询重复数据有多少行:

grep No f.txt | sort -u | wc -l

找到重复的那行数据:(如果每行的json数据大,可忽略此操作)

grep No f.txt |sort|uniq -d

去除重复数据:

awk -v No=2 '!seen$No++' f.txt > output.txt

去重命令的工作原理是:

  • awk:文本处理工具。

  • -v No=2:设置awk变量No为2,这是我们要去重的列号。

  • !seen[$No]++:前缀运算符!用来判断数组seen中是否存在当前行的第No列的值。如果不存在,则执行后面的操作,即打印当前行。

  • input.txt:输入文件名。

  • > output.txt:将结果输出到output.txt文件中。

请确保你的输入文件是以空格或者制表符分隔的,并且列号是从1开始计数的。如果列与列之间的分隔符是其他字符,可以通过-F选项来指定分隔符。

相关推荐
OpenPomeloxCommunity11 分钟前
Linux 同步机制之 spinlock 设计与实现(二):ARM32实现
linux
Shell运维手记19 分钟前
交换机(二层交换机)完整工作原理
运维·网络·网络协议·macos·交换机
飞飞传输26 分钟前
金融数字化转型新基建:替代FTP的国产传输软件筑牢数安全防线
大数据·运维·安全
码农学院26 分钟前
GEO团队SOP、绩效考核与知识沉淀:技术团队管理体系化工程实践
运维·人工智能·windows
爱莉希雅&&&30 分钟前
Rocky Linux 10.1 + K8s 1.36.3 离线集群部署笔记(Kubernetes)
linux·笔记·docker·kubernetes·calico
三84435 分钟前
基于 NFS 共享存储的 Nginx Web 服务部署项目
linux·运维·服务器
逻极39 分钟前
Shell脚本实战:从“能跑”到“高效”的3个关键跃升
linux·服务器·shell·脚本
ARM|X86+FPGA工业主板厂家40 分钟前
Linux+Xenomai 实时系统在机器人中的应用
linux·运维·机器人
難釋懷1 小时前
Nginx-proxy缓存清理
运维·nginx·缓存
唔661 小时前
Linux工具使用情况buildroot
linux·运维·服务器