Tengo un conjunto de datos como el siguiente:
| época_segundos | eq_time |
|---|---|
| 1636663343887 | 2021-11-12 02:12:23 |
Ahora, estoy tratando de convertir eq_time a epoch segundos que deberían coincidir con el valor de la primera columna, pero no puedo hacerlo. A continuación se muestra mi código:
df = spark.sql("select '1636663343887' as epoch_seconds") df1 = df.withColumn("eq_time", from_unixtime(col("epoch_seconds") / 1000)) df2 = df1.withColumn("epoch_sec", unix_timestamp(df1.eq_time)) df2.show(truncate=False)Estoy obteniendo una salida como la siguiente:
| época_segundos | eq_time | época_seg |
|---|---|---|
| 1636663343887 | 2021-11-12 02:12:23 | 1636663343 |
Intenté este enlace también pero no ayudó. Mi resultado expected es que la primera y la tercera columna deben coincidir entre sí.
PD : estoy usando la versión Spark 3.1.1 en local, mientras que Spark 2.4.3 está en producción, y mi objetivo final sería ejecutarlo en producción.
Use to_timestamp en lugar de from_unixtime para conservar la parte de los milisegundos cuando convierte la época en un tipo de marca de tiempo de chispa.
Luego, para volver a la marca de tiempo en milisegundos, puede usar la función unix_timestamp o convertirla en tipo largo y concatenar el resultado con la parte de fracción de segundos de la marca de tiempo que obtiene con date_format de fecha usando el patrón S :
import pyspark.sql.functions as F df = spark.sql("select '1636663343887' as epoch_ms") df2 = df.withColumn( "eq_time", F.to_timestamp(F.col("epoch_ms") / 1000) ).withColumn( "epoch_milli", F.concat(F.unix_timestamp("eq_time"), F.date_format("eq_time", "S")) ) df2.show(truncate=False) #+-------------+-----------------------+-------------+ #|epoch_ms |eq_time |epoch_milli | #+-------------+-----------------------+-------------+ #|1636663343887|2021-11-11 21:42:23.887|1636663343887| #+-------------+-----------------------+-------------+Para convertir entre formatos de hora en Python, son útiles datetime.datetime.strptime() y .strftime() .
Para leer la cadena de eq_time y procesarla en un objeto de fecha y hora de Python:
import datetime t = datetime.datetime.strptime('2021-11-12 02:12:23', '%Y-%m-%d %H:%M:%S')Para imprimir t en formato epoch_seconds :
print(t.strftime('%s')Pandas tiene funciones de procesamiento de fechas que funcionan de manera similar: Aplicar la función strptime a la serie pandas
Puede ejecutar esto en la columna eq_time , inmediatamente después de extraer los datos, para asegurarse de que su DataFrame contenga la fecha en el formato correcto.
Prefiero hacer la conversión de marca de tiempo solo con cast .
from pyspark.sql.functions import col df = spark.sql("select '1636663343887' as epoch_seconds") df = df.withColumn("eq_time", (col("epoch_seconds") / 1000).cast("timestamp")) df = df.withColumn("epoch_sec", (col("eq_time").cast("double") * 1000).cast("long")) df.show(truncate=False)Si lo hace de esta manera, debe pensar en segundos, entonces funcionará perfectamente.