GROUP BY + COUNT(DISTINCT user_id) 是统计每组不同用户数的标准解法,主流数据库均支持;需避免写成 COUNT(user_id) 或误用 SELECT DISTINCT,NULL 默认被忽略,大数据量时注意执行计划中的 Using temporary。
统计每个分组下的不同用户数,核心就是去重计数。MySQL、PostgreSQL、SQL Server(2017+)、Oracle 都支持 COUNT(DISTINCT column),这是标准且可靠的写法。
常见错误是写成 COUNT(user_id) 或 COUNT(*) —— 这会统计所有行,包含重复用户;或者误用 SELECT DISTINCT user_id FROM ... GROUP BY group_col,结果根本没法聚合出每组数量。
GROUP BY 使用,否则报错或语义错误user_id 不能为空(NULL),否则 COUNT(DISTINCT user_id) 自动忽略 NULL 值,这通常符合预期,但需确认业务是否把 NULL 视为有效用户DISTINCT 可能触发临时表或文件排序,执行计划里注意看 Using temporary; Using filesort
SELECT category, COUNT(DISTINCT user_id) AS unique_user_countFROM ordersGROUP BY category;
SQL Server 2016 及之前版本不支持 COUNT(DISTINCT) 在窗口函数中使用,但对普通聚合是支持的——真正不支持的是更老的版本(如 2005)。不过,如果遇到“不支持 DISTINCT”报错,大概率是语法写错,或误用了子查询结构。
若真受限(比如对接遗留系统或某些嵌入式数据库),可用子查询去重再计数:
SELECT DISTINCT group_col, user_id,再外层按 group_col 计数COUNT(DISTINCT) 差,尤其当 user_id 重复率高时,中间结果集可能很大WHERE 条件——必须在内层子查询里过滤,否则逻辑错误SELECT category, COUNT(*) AS unique_user_countFROM ( SELECT DISTINCT category, user_id FROM orders WHERE status = 'completed' -- 过滤必须放这里) AS dedupedGROUP BY category;
COUNT(DISTINCT user_id) 天然忽略 NULL,但有时业务上 “未登录用户” 用 NULL 表示,你可能需要把它算作一类独立用户。
COUNT(DISTINCT COALESCE(user_id, -1)) 把 NULL 映射为固定值(如 -1),前提是 user_id 本身不会取 -1
COUNT(DISTINCT CASE WHEN user_id IS NULL THEN 'anonymous' ELSE CAST(user_id AS VARCHAR) END)
ISNULL(user_id, 0) —— 若 user_id 是字符串类型,类型转换可能失败这是初学者高频翻车点:只写 GROUP BY category 却在 SELECT 里多加了 region,MySQL 5.7+ 和 PostgreSQL 会直接报错 ERROR 1055 或 ERROR: column "region" must appear in the GROUP BY clause。
SELECT 列表:所有非聚合字段(即没套 COUNT、SUM 等函数的)必须出现在 GROUP BY 中sql_mode=only_full_group_by 关闭状态——关了只是“不报错”,结果不可靠category 和 region),GROUP BY 必须写全:GROUP BY category, region
实际跑起来前,先 EXPLAIN 看执行计划,重点关注 key 是否命中索引,以及有没有 Using temporary。去重计数在千万级表上很容易成为瓶颈,不是语法写对就万事大吉。