Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

456
Vistas
Cargando pandas DataFrame desde parquet: las listas se deserializan como ndarrays de numpy
import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet") [type(val) for val in df["col2"].tolist()]

Producción:

 [<class 'numpy.ndarray'>, <class 'numpy.ndarray'>, <class 'numpy.ndarray'>]

¿Hay alguna forma en que pueda leer el archivo de parquet y obtener los valores de la lista como listas pitónicas (al igual que en la creación)? Preferiblemente usando pandas pero dispuesto a probar alternativas.

El problema al que me enfrento es que no tengo conocimiento previo de qué columnas contienen listas, por lo que verifico los tipos de manera similar a como lo hago en el código. Suponiendo que no estoy interesado en agregar numpy actualmente como una dependencia, ¿hay alguna forma de verificar si una variable es similar a una matriz sin importar y especificar explícitamente np.ndarray ?

over 4 years ago · Santiago Trujillo
2 Respuestas
Responde la pregunta

0

No puede cambiar este comportamiento en la API, ya sea al cargar el archivo de parquet en una tabla de flechas o al convertir la tabla de flechas en pandas .

Pero puede escribir su propia función que vería el esquema de la tabla de flechas y convertiría cada campo de list en una lista de python

 import pyarrow as pa import pyarrow.parquet as pq def load_as_list(file): table = pq.read_table(file) df = table.to_pandas() for field in table.schema: if pa.types.is_list(field.type): df[field.name] = df[field.name].apply(list) return df load_as_list("./df_as_pq.parquet")
over 4 years ago · Santiago Trujillo Denunciar

0

Sí, léalo con engine='fastparquet' :

 import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet", engine='fastparquet') [type(val) for val in df["col2"].tolist()]

Emitirá [list, list, list]

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda