Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

468
Views
Cargando pandas DataFrame desde parquet: las listas se deserializan como ndarrays de numpy
import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet") [type(val) for val in df["col2"].tolist()]

Producción:

 [<class 'numpy.ndarray'>, <class 'numpy.ndarray'>, <class 'numpy.ndarray'>]

¿Hay alguna forma en que pueda leer el archivo de parquet y obtener los valores de la lista como listas pitónicas (al igual que en la creación)? Preferiblemente usando pandas pero dispuesto a probar alternativas.

El problema al que me enfrento es que no tengo conocimiento previo de qué columnas contienen listas, por lo que verifico los tipos de manera similar a como lo hago en el código. Suponiendo que no estoy interesado en agregar numpy actualmente como una dependencia, ¿hay alguna forma de verificar si una variable es similar a una matriz sin importar y especificar explícitamente np.ndarray ?

over 4 years ago · Santiago Trujillo
2 answers
Answer question

0

No puede cambiar este comportamiento en la API, ya sea al cargar el archivo de parquet en una tabla de flechas o al convertir la tabla de flechas en pandas .

Pero puede escribir su propia función que vería el esquema de la tabla de flechas y convertiría cada campo de list en una lista de python

 import pyarrow as pa import pyarrow.parquet as pq def load_as_list(file): table = pq.read_table(file) df = table.to_pandas() for field in table.schema: if pa.types.is_list(field.type): df[field.name] = df[field.name].apply(list) return df load_as_list("./df_as_pq.parquet")
over 4 years ago · Santiago Trujillo Report

0

Sí, léalo con engine='fastparquet' :

 import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet", engine='fastparquet') [type(val) for val in df["col2"].tolist()]

Emitirá [list, list, list]

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!