Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

459
Visualizações
Cargando pandas DataFrame desde parquet: las listas se deserializan como ndarrays de numpy
import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet") [type(val) for val in df["col2"].tolist()]

Producción:

 [<class 'numpy.ndarray'>, <class 'numpy.ndarray'>, <class 'numpy.ndarray'>]

¿Hay alguna forma en que pueda leer el archivo de parquet y obtener los valores de la lista como listas pitónicas (al igual que en la creación)? Preferiblemente usando pandas pero dispuesto a probar alternativas.

El problema al que me enfrento es que no tengo conocimiento previo de qué columnas contienen listas, por lo que verifico los tipos de manera similar a como lo hago en el código. Suponiendo que no estoy interesado en agregar numpy actualmente como una dependencia, ¿hay alguna forma de verificar si una variable es similar a una matriz sin importar y especificar explícitamente np.ndarray ?

over 4 years ago · Santiago Trujillo
2 Respostas
Responde à pergunta

0

No puede cambiar este comportamiento en la API, ya sea al cargar el archivo de parquet en una tabla de flechas o al convertir la tabla de flechas en pandas .

Pero puede escribir su propia función que vería el esquema de la tabla de flechas y convertiría cada campo de list en una lista de python

 import pyarrow as pa import pyarrow.parquet as pq def load_as_list(file): table = pq.read_table(file) df = table.to_pandas() for field in table.schema: if pa.types.is_list(field.type): df[field.name] = df[field.name].apply(list) return df load_as_list("./df_as_pq.parquet")
over 4 years ago · Santiago Trujillo Relatório

0

Sí, léalo con engine='fastparquet' :

 import pandas as pd df = pd.DataFrame({ "col1" : ["a", "b", "c"], "col2" : [[1,2,3], [4,5,6,7], [8,9,10,11,12]] }) df.to_parquet("./df_as_pq.parquet") df = pd.read_parquet("./df_as_pq.parquet", engine='fastparquet') [type(val) for val in df["col2"].tolist()]

Emitirá [list, list, list]

over 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda