Creé una tabla Delta en ADLS Gen 1 con el siguiente código en Databricks:
df.write.format("delta").mode("overwrite").saveAsTable("db.my_tbl", path ='adl://organisation.azuredatalakestore.net/folder_name/my_data') A veces, vuelvo a ejecutar el código anterior para generar una nueva versión de la tabla my_tbl . Como es habitual con las tablas delta, se construye un historial y debe optimizarse y vaciarse regularmente. Ahora, a menudo vuelvo a entrenar un modelo de ML en Azure Machine Learning Studio y me pregunto si es posible registrar una versión específica de la tabla delta.
Actualmente, incluso después de aspirar, todos mis archivos delta (incluidas las versiones anteriores) están registrados en Azure ML Studio al leer los archivos de parquet de la carpeta my_data . Esto se debe a que no puedo reducir el período de retención de la tabla delta por debajo de 168 h, excepto al activar spark.databricks.delta.retentionDurationCheck.enabled . No quiero apagarlo.
Registro mi conjunto de datos a través de la interfaz de ML Studio como un conjunto de datos de archivo (no un conjunto de datos tabular). Este registro se ve así:
En este momento, solo veo la opción para crear una copia de my_data y leerla en su lugar. ¿Hay otra manera? ¿Sabe si puedo especificar algo en la ruta para señalar los archivos .parquet "correctos" (que pertenecen a una versión específica de la tabla delta)?