np.cumsum([1, 2, 3, np.nan, 4, 5, 6]) devolverá nan para cada valor después del primer np.nan . Además, hará lo mismo con cualquier generador. Sin embargo, np.cumsum(df['column']) no lo hará. ¿Qué hace np.cumsum(...) para que los marcos de datos se traten de manera especial?
In [2]: df = pd.DataFrame({'column': [1, 2, 3, np.nan, 4, 5, 6]}) In [3]: np.cumsum(df['column']) Out[3]: 0 1.0 1 3.0 2 6.0 3 NaN 4 10.0 5 15.0 6 21.0 Name: column, dtype: float64Cuando llama a np.cumsum(object) con un objeto que no es una matriz numpy, intentará llamar a object.cumsum() Vea este hilo para más detalles. También puedes verlo en la fuente de Numpy .
El método pandas tiene un valor predeterminado de skipna=True . Entonces np.cumsum(df) se convierte en el equivalente de df.cumsum(axis=None, skipna=True, *args, **kwargs) , que, por supuesto, omite los valores de NaN. El método Numpy no tiene una opción skipna .
También puede verificar esto usted mismo anulando el método pandas con el suyo propio:
class DF(pd.DataFrame): def cumsum(self, axis=None, skipna=True, *args, **kwargs): print('calling pandas cumsum') return super().cumsum(axis=None, skipna=True, *args, **kwargs) df = DF({'column': [1, 2, 3, np.nan, 4, 5, 6]}) # does calling the numpy function call your pandas method? np.cumsum(df)Esto se imprimirá
calling pandas cumsumy devolver el resultado esperado:
column 0 1.0 1 3.0 2 6.0 3 NaN 4 10.0 5 15.0 6 21.0 Luego puede experimentar con el resultado de cambiar skipna=True .