Tengo un marco de datos de pandas con columna de índice = date .
Aporte:
value date 1986-01-31 22.93 1986-02-28 15.46Quiero pisotear la fecha al primer día de ese mes
Producción:
value date 1986-01-01 22.93 1986-02-01 15.46Lo que probé:
df.index.floor('M') ValueError: <MonthEnd> is a non-fixed frequency Esto se debe potencialmente a que el df es generado por df = df.resample("M").sum() (La salida de este código es la entrada al comienzo de la pregunta)
También probé df = df.resample("M", convention='start').sum() . Sin embargo, no funciona.
Lo sé en R, es fácil simplemente llamar a floor(date, 'M') .
Puede usar el desplazamiento de la serie temporal MonthBegin
from pandas.tseries.offsets import MonthBegin df['date'] = pd.to_datetime(df['date']) - MonthBegin(1)Editar: la solución anterior no maneja las fechas que ya están fijadas a principios de mes. Aquí hay una solución alternativa.
Aquí hay un marco de datos con casos de prueba adicionales:
value date 1986-01-31 22.93 1986-02-28 15.46 2018-01-01 20.00 2018-02-02 25.00Con el método timedelta,
df.index = pd.to_datetime(df.index) df.index = df.index - pd.to_timedelta(df.index.day - 1, unit='d') value date 1986-01-01 22.93 1986-02-01 15.46 2018-01-01 20.00 2018-02-01 25.00Esto hará el truco y no es necesario importar. Numpy tiene un dtype datetime64 que, por defecto, pandas establece en [ns] como se ve al verificar el dtype. Puede cambiar esto a mes, que comenzará el primer día del mes accediendo a la matriz numpy y cambiando el tipo.
df.date = pd.to_datetime(df.date.values.astype('datetime64[M]')) Sería bueno que los pandas implementaran esto con su propio método astype() , pero desafortunadamente no es posible.
Lo anterior funciona para datos como valores de fecha y hora o cadenas, si ya tiene sus datos como tipo de fecha y datetime[ns] , puede omitir pd.to_datetime() y simplemente hacer:
df.date = df.date.values.astype('datetime64[M]')