用简单SQL语句怎么找出业务表中完全重复的脏数据记录?

作者:袖梨 2026-07-10
最稳方式是用所有字段作GROUP BY分组并HAVING COUNT(*)>1筛选;若字段含NULL或过多,推荐用ROW_NUMBER()窗口函数标记重复行,或用EXISTS自连接验证,操作前务必SELECT核对再执行删除。

用 GROUP BY + HAVING 找出完全重复的整行记录

直接查出哪些行在表里出现了不止一次,最稳的方式是把所有字段当分组依据。MySQL、PostgreSQL、SQL Server 都支持这种写法,但注意:如果表有 NULL 值,不同数据库对 NULL = NULL 的处理可能不一致(比如 MySQL 默认认为两个 NULL 相等,而 SQL Server 在 GROUP BY 中会把它们归为同一组)。

实操建议:

  • 先确认业务表主键或唯一约束是否缺失——完全重复往往意味着建表时漏了约束
  • 避免在大表上直接 SELECT * 分组,可先用 COUNT(*) 看重复频次,再用子查询捞具体记录
  • 字段太多时手动写 GROUP BY 易出错,可用脚本生成字段列表(比如从 INFORMATION_SCHEMA.COLUMNS 拼接)
SELECT *, COUNT(*) AS cntFROM ordersGROUP BY order_id, user_id, amount, created_at, statusHAVING COUNT(*) > 1;

用窗口函数 ROW_NUMBER() 标记并过滤重复行

比起 GROUP BYROW_NUMBER() 更灵活,能保留原始行结构,也天然兼容 NULL(各数据库对窗口函数中 ORDER BYNULL 的排序行为较统一)。

实操建议:

  • ORDER BY 子句必须包含足够区分度的字段,否则同组内排序不稳定,ROW_NUMBER() 可能每次执行结果不同
  • 如果只想删重复只留一条,通常取 ROW_NUMBER() OVER (PARTITION BY ... ORDER BY id) = 1;若要删掉所有重复行(不留任何副本),得用 COUNT(*) OVER (PARTITION BY ...) > 1
  • PostgreSQL 和 SQL Server 支持在 CTE 中直接用窗口函数,MySQL 8.0+ 也可以,但老版本需嵌套子查询
WITH dup AS (  SELECT *,         ROW_NUMBER() OVER (           PARTITION BY order_id, user_id, amount, created_at, status           ORDER BY id         ) AS rn  FROM orders)SELECT * FROM dup WHERE rn > 1;

WHERE 子句里用 EXISTS 或 IN 处理小规模去重验证

当表不大(比如几万行以内),且你只想快速确认某几列组合是否重复,用 EXISTS 比全字段分组更轻量。它不依赖 GROUP BYNULL 的隐式处理,逻辑更透明。

实操建议:

  • EXISTS 写法适合“找任意一对重复”,不是“列出全部重复块”;想看完整重复组还得回退到前两种方式
  • 注意关联条件里别漏掉 AND t1.id != t2.id,否则每行都会和自己匹配上
  • 如果字段含 TEXT / JSON 等不可比较类型,多数数据库会报错,得提前 CAST 或排除这些列
SELECT DISTINCT t1.*FROM orders t1WHERE EXISTS (  SELECT 1 FROM orders t2  WHERE t2.order_id = t1.order_id    AND t2.user_id = t1.user_id    AND t2.amount = t1.amount    AND t2.created_at = t1.created_at    AND t2.status = t1.status    AND t2.id != t1.id);

删重复数据前务必加 WHERE 条件限制影响范围

线上表一旦 DELETE 跑错,恢复成本极高。哪怕语句逻辑正确,没加 WHERE 或条件太宽,也可能误删大量正常数据。

实操建议:

  • 永远先用 SELECT 把要删的行查出来,人工核对 3–5 条样本
  • 生产环境禁止直接 DELETE FROM table GROUP BY ... —— 没有标准语法支持这种写法,容易写出错误的自连接删除
  • DELETE + JOIN 或子查询时,确保子查询结果集不含歧义(例如 MySQL 不允许在子查询中直接引用待删表)
  • 涉及千万级数据时,分批删比单次大事务更安全,避免锁表过久

真正麻烦的从来不是找出重复,而是确认哪些字段该参与判重、哪些 NULL 是业务允许的、以及删完后怎么补约束防止再生。这些没法靠一条 SQL 解决。

相关文章

精彩推荐