记一次在一亿数据的大表里删除重复数据 by 勤勤学长

场景

10月11日,某个用户出现了信息重复推送,导致出现重复数据,影响到了统计。

需要通过用户ID、时间戳、事件,找出相同msgid字段相同的数据,并删除。

已知,表有接近1亿条数据。

解决

查询重复数据

查看表索引,刚好有匹配的索引

sql 复制代码
 KEY `idx_storeid_event_ctime` (`store_id`,`event`,`ctime`),
sql 复制代码
SELECT
    msgid,
    COUNT(*) AS duplicate_count,
    min(id) as id
FROM
    `user_msg_list`
WHERE
    store_id = 233
    AND ctime > 1728615600
    AND ctime < 1728622800
    AND `event` = 'EventGroupChat'
GROUP BY
    msgid
HAVING
    COUNT(*) > 1;
# 查询的时候不要用 order by id desc
# 否则查询的时候,因为缺少id的索引,引起慢查询。
遍历删除

防止删除到其他的数据,所以还得把前边的条件一起放进来

sql 复制代码
DELETE 
FROM
	user_msg_list` 
WHERE
		store_id = 233
    AND ctime > 1728615600
    AND ctime < 1728622800
    AND `event` = 'EventGroupChat'
		AND id != 10086
		AND msgid !=318692996

项目上完整代码

我用的是thinkphp框架

php 复制代码
$where = "store_id = 233
            AND ctime > 1728615600
            AND ctime < 1728622800
            AND `event` = 'EventGroupChat'";

        $data = Db::table("user_msg_list")->where($where)->field("msgid,COUNT(*) AS duplicate_count,min(id) as id")->group("msgid")->having("COUNT(*) > 1")
            ->select()->toArray();

        foreach ($data as $v) {
            $id = $v['id'];
            $msgid = $v['msgid'];
            $msgIds = Db::table("user_msg_list")
                ->where($where)
                ->where("id!={$id}")
                ->where("msgid", $msgid)
                ->column("id");
            $res = Db::table("user_msg_list")->whereIn('id',$msgIds)->delete();
            dump($res);
        }

结束

数据太多了,动不动就是几秒都还无结果,3秒无结果的时候我都会停止运行。

防止出现缩表影响到正常业务的开展。

相关推荐
SEO_juper4 分钟前
不同国家服务器、域名选择,提升本地谷歌抓取优先级
运维·服务器·seo·外贸·geo·独立站·跨境电商独立站
DeboPXK6 分钟前
NSK VH25EM 高防尘法兰型导轨技术手册
服务器·网络·数据库·经验分享·规格说明书
浮云中的神马-潘帅7 分钟前
魔兽世界自动化打地鼠方案
运维·自动化
鼎讯信通23 分钟前
1024J冲击能量+三种放电模式:DLG-1高压发生器覆盖电缆故障全场景
运维·能源·信息与通信
图灵追慕者24 分钟前
Nginx安裝以及配置顯示本地服務器文件夾
运维·nginx
超级赛博搬砖工26 分钟前
SEO代理解析:成功搜索引擎抓取你需要了解的事项
大数据·运维·服务器·网络
换个昵称都难29 分钟前
webrtc peerconnection_server 模块介绍
运维·服务器·webrtc
志栋智能33 分钟前
超自动化安全的技术选型与架构设计指南
运维·安全·自动化
isyangli_blog36 分钟前
SDN 基本应用实践 —— 使用命令行实现简易防火墙功能实验报告
服务器·php·apache
ai_coder_ai37 分钟前
在自动化脚本中操作excel文件
运维·自动化·excel