最稳方式是用所有字段作GROUP BY分组并HAVING COUNT(*)>1筛选;若字段含NULL或过多,推荐用ROW_NUMBER()窗口函数标记重复行,或用EXISTS自连接验证,操作前务必SELECT核对再执行删除。
直接查出哪些行在表里出现了不止一次,最稳的方式是把所有字段当分组依据。MySQL、PostgreSQL、SQL Server 都支持这种写法,但注意:如果表有 NULL 值,不同数据库对 NULL = NULL 的处理可能不一致(比如 MySQL 默认认为两个 NULL 相等,而 SQL Server 在 GROUP BY 中会把它们归为同一组)。
实操建议:
SELECT * 分组,可先用 COUNT(*) 看重复频次,再用子查询捞具体记录GROUP BY 易出错,可用脚本生成字段列表(比如从 INFORMATION_SCHEMA.COLUMNS 拼接)SELECT *, COUNT(*) AS cntFROM ordersGROUP BY order_id, user_id, amount, created_at, statusHAVING COUNT(*) > 1;
比起 GROUP BY,ROW_NUMBER() 更灵活,能保留原始行结构,也天然兼容 NULL(各数据库对窗口函数中 ORDER BY 里 NULL 的排序行为较统一)。
实操建议:
ORDER BY 子句必须包含足够区分度的字段,否则同组内排序不稳定,ROW_NUMBER() 可能每次执行结果不同ROW_NUMBER() OVER (PARTITION BY ... ORDER BY id) = 1;若要删掉所有重复行(不留任何副本),得用 COUNT(*) OVER (PARTITION BY ...) > 1
WITH dup AS ( SELECT *, ROW_NUMBER() OVER ( PARTITION BY order_id, user_id, amount, created_at, status ORDER BY id ) AS rn FROM orders)SELECT * FROM dup WHERE rn > 1;
当表不大(比如几万行以内),且你只想快速确认某几列组合是否重复,用 EXISTS 比全字段分组更轻量。它不依赖 GROUP BY 对 NULL 的隐式处理,逻辑更透明。
实操建议:
EXISTS 写法适合“找任意一对重复”,不是“列出全部重复块”;想看完整重复组还得回退到前两种方式AND t1.id != t2.id,否则每行都会和自己匹配上TEXT / JSON 等不可比较类型,多数数据库会报错,得提前 CAST 或排除这些列SELECT DISTINCT t1.*FROM orders t1WHERE EXISTS ( SELECT 1 FROM orders t2 WHERE t2.order_id = t1.order_id AND t2.user_id = t1.user_id AND t2.amount = t1.amount AND t2.created_at = t1.created_at AND t2.status = t1.status AND t2.id != t1.id);
线上表一旦 DELETE 跑错,恢复成本极高。哪怕语句逻辑正确,没加 WHERE 或条件太宽,也可能误删大量正常数据。
实操建议:
SELECT 把要删的行查出来,人工核对 3–5 条样本DELETE FROM table GROUP BY ... —— 没有标准语法支持这种写法,容易写出错误的自连接删除DELETE + JOIN 或子查询时,确保子查询结果集不含歧义(例如 MySQL 不允许在子查询中直接引用待删表)真正麻烦的从来不是找出重复,而是确认哪些字段该参与判重、哪些 NULL 是业务允许的、以及删完后怎么补约束防止再生。这些没法靠一条 SQL 解决。