Estoy tratando de obtener el precio promedio de los productos que contienen subcadenas de una lista de palabras de un marco de datos. Pude hacerlo con el siguiente código en varias hojas de cálculo:
dframe['Product'].fillna('', inplace=True) dframe['Price'].fillna(0, inplace=True) total_count = 0 total_price = 0 for word in ransomware_wordlist: mask = dframe.Product.str.contains(word, case=False) total_count += mask.sum() total_price += dframe.loc[mask, 'Price'].sum() average_price = total_price / total_count print(average_price)Sin embargo, una de las hojas de cálculo arroja un error en la línea:
dframe['Product'].fillna('', inplace=True)con
ValueError: cannot index with vector containing NA / NaN values No entiendo por qué dframe['Product'].fillna('', inplace=True) no está manejando este problema.
¡Necesita desesperadamente ayuda! ¡Gracias!
Si la primera línea falla, aún es posible reemplazar NaN s en condición en str.contains por el parámetro na=False :
mask = dframe.Product.str.contains(word, case=False, na=False) O intente omitir inplace=True y asigne de nuevo:
dframe['Product'] = dframe['Product'].fillna('')Una forma de resolver problemas con el índice es usar index de uso real:
# define x x = "Price" # make sure to fill Na/NaN values dframe[x] = dframe[x].fillna('00') # identify rows that contain a specific value, returns a list of True/False id_rows = dframe[x].str.contains(r"^ransom") # save row index for identified rows, basically save all True row_index = dframe.loc[id_rows].index # update the chosen variable `x` with new value on identified rows using row index dframe.loc[row_index, x] = 'cleaned'Hace este truco!