import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet") [type(val) for val in df["col2"].tolist()]Producción:
[<class 'numpy.ndarray'>, <class 'numpy.ndarray'>, <class 'numpy.ndarray'>] ¿Hay alguna forma en que pueda leer el archivo de parquet y obtener los valores de la lista como listas pitónicas (al igual que en la creación)? Preferiblemente usando pandas pero dispuesto a probar alternativas.
El problema al que me enfrento es que no tengo conocimiento previo de qué columnas contienen listas, por lo que verifico los tipos de manera similar a como lo hago en el código. Suponiendo que no estoy interesado en agregar numpy actualmente como una dependencia, ¿hay alguna forma de verificar si una variable es similar a una matriz sin importar y especificar explícitamente np.ndarray ?
No puede cambiar este comportamiento en la API, ya sea al cargar el archivo de parquet en una tabla de flechas o al convertir la tabla de flechas en pandas .
Pero puede escribir su propia función que vería el esquema de la tabla de flechas y convertiría cada campo de list en una lista de python
import pyarrow as pa import pyarrow.parquet as pq def load_as_list(file): table = pq.read_table(file) df = table.to_pandas() for field in table.schema: if pa.types.is_list(field.type): df[field.name] = df[field.name].apply(list) return df load_as_list("./df_as_pq.parquet")Sí, léalo con engine='fastparquet' :
import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet", engine='fastparquet') [type(val) for val in df["col2"].tolist()] Emitirá [list, list, list]