直接用 numpy.average 即可,它原生支持加权平均,比手动循环快10–100倍,自动处理广播、NaN跳过和dtype推导,但需注意weights形状匹配、NaN同步掩码及dtype优化。
numpy.average 就行,别自己写循环NumPy 的 numpy.average 原生支持加权平均,底层用 C 实现,比 Python 循环快 10–100 倍。只要传入 weights 参数,它会自动处理广播、NaN 跳过和 dtype 推导。
常见错误是手动用 np.sum(a * w) / np.sum(w) —— 看似等价,但没处理 w 全为 0 或含 NaN 的情况,也不支持 axis 指定维度的加权归约。
weights 必须和输入数组 shape 兼容(广播规则),不能是纯 Python list(会触发低效路径)a 含 nan,默认不跳过;加 returned=False 且设 weights 时,nan 会污染结果;需先用 np.nan_to_num 或掩码预处理axis 不为 None,weights 若为 1D,会沿该轴广播;若要按不同维度加权,weights 必须显式匹配对应维度 shapereturned 和 weights 逻辑很多人以为 numpy.average 默认像 np.nanmean 那样忽略 NaN,其实不会——它把 NaN 当普通值参与加权,导致结果也是 NaN。
正确做法是先对数据和权重同步掩码,再调用:
立即学习“Python免费学习笔记(深入)”;
import numpy as npa = np.array([1.0, 2.0, np.nan, 4.0])w = np.array([1, 1, 1, 1])<p>mask = ~np.isnan(a)result = np.average(a[mask], weights=w[mask])
a 而保留全部 w,否则权重和失配,结果偏差np.where 构造 masked weight: w_masked = np.where(np.isnan(a), 0, w),再配合 np.average(..., weights=w_masked)
returned=True 返回 (weighted_mean, sum_of_weights),可用于后续归一化校验,但 sum_of_weights 在 mask 后也得同步计算axis 和 weights 的维度对齐比如你有一个 shape=(1000, 50) 的数据矩阵,想对每行做加权平均(即每行一个标量结果),权重是 per-feature 的长度为 50 的向量。这时候 weights 必须是 shape=(50,),且指定 axis=1。
若误把 weights 设成 shape=(1000,),NumPy 会尝试广播,结果不是你想要的“每行加权”,而是“每列加权”或报错。
w.reshape(1, -1) 表示作用于 axis=1(列方向);w.reshape(-1, 1) 表示作用于 axis=0(行方向)keepdims=True 可保留维度,方便后续广播运算,比如结果用于减去原始数组做中心化weights 数组和隐式类型转换如果在循环中反复调用 np.average 且每次 weights 相同,不要每次都传 Python list 或 float64 list——每次都会触发 array 构造开销。提前转成 np.ndarray 并固定 dtype。
np.float32 足够(除非需要极高精度),比默认 float64 节省内存且计算略快weights.tolist() 或嵌套 list,这会让 NumPy 回退到慢速 object 模式.values 取出 ndarray,别直接传 Series(会触发 pandas 分支,慢 3–5 倍)加权平均本身不复杂,但容易在 mask 对齐、维度广播和 dtype 控制上出错,这些地方一错,结果就 quietly wrong。