Tengo un marco de datos grande con números de identificación:
ID.head() Out[64]: 0 4806105017087 1 4806105017087 2 4806105017087 3 4901295030089 4 4901295030089Estas son todas las cadenas en este momento.
Quiero convertir a int sin usar bucles, para esto uso ID.astype(int) .
El problema es que algunas de mis líneas contienen datos sucios que no se pueden convertir a int , por ejemplo
ID[154382] Out[58]: 'CN414149' ¿Cómo puedo (sin usar bucles) eliminar este tipo de ocurrencias para poder usar astype con tranquilidad?
Necesita agregar el parámetro errors='coerce' para funcionar to_numeric :
ID = pd.to_numeric(ID, errors='coerce') Si ID es una columna:
df.ID = pd.to_numeric(df.ID, errors='coerce') pero los no numéricos se convierten a NaN , por lo que todos los valores son float .
Para int necesita convertir NaN a algún valor, por ejemplo, 0 y luego convertir a int :
df.ID = pd.to_numeric(df.ID, errors='coerce').fillna(0).astype(np.int64)Muestra:
df = pd.DataFrame({'ID':['4806105017087','4806105017087','CN414149']}) print (df) ID 0 4806105017087 1 4806105017087 2 CN414149 print (pd.to_numeric(df.ID, errors='coerce')) 0 4.806105e+12 1 4.806105e+12 2 NaN Name: ID, dtype: float64 df.ID = pd.to_numeric(df.ID, errors='coerce').fillna(0).astype(np.int64) print (df) ID 0 4806105017087 1 4806105017087 2 0 EDITAR: si usa pandas 0.25+, entonces es posible usar integer_na :
df.ID = pd.to_numeric(df.ID, errors='coerce').astype('Int64') print (df) ID 0 4806105017087 1 4806105017087 2 NaN