Estoy aprendiendo pandas de Python. Veo un tutorial que muestra dos formas de guardar un marco de datos de pandas.
pd.to_csv('sub.csv') y para abrir pd.read_csv('sub.csv')
pd.to_pickle('sub.pkl') y para abrir pd.read_pickle('sub.pkl')
El tutorial dice que to_pickle es para guardar el marco de datos en el disco. Estoy confundido acerca de esto. Porque cuando uso to_csv , vi que aparece un archivo csv en la carpeta, que supongo que también se guarda en el disco, ¿verdad?
En general, ¿por qué queremos guardar un marco de datos usando to_pickle en lugar de guardarlo en csv o txt u otro formato?
to_parquet , read_parquet )Pickle es una forma serializada de almacenar un marco de datos de Pandas. Básicamente, está escribiendo la representación exacta del marco de datos en el disco. Esto significa que los tipos de las columnas y los índices son los mismos. Si simplemente guarda un archivo como csv , solo lo está almacenando como una lista separada por comas. Dependiendo de su conjunto de datos, parte de la información se perderá cuando vuelva a cargarlo.
Puede leer más sobre la biblioteca pickle en python, aquí .