Estoy tratando de entender cuál es la diferencia entre el servicio AWS Athena y la selección de S3 recién lanzada (todavía en versión preliminar).
¿En qué se diferencian los casos de uso de ambos? Parece que ambos ayudan a seleccionar datos parciales de S3.
También parece que nos falta una cosa importante:
S3 Select opera solo en un objeto, mientras que Athena ejecuta consultas en múltiples rutas, lo que incluirá todos los archivos dentro de esa ruta.
Puede pensar en AWS S3 Select como una optimización de almacenamiento rentable que permite recuperar datos que coinciden con el predicado en S3 y el filtrado de empuje hacia abajo del glaciar.
AWS Athena es un servicio analítico completamente administrado que permite ejecutar consultas arbitrarias compatibles con ANSI SQL: agrupar por, tener, funciones de ventana y geo, SQL DDL y DML.
Athena está (por lo poco que la he usado) más pensada como una herramienta de informes o análisis de negocios respaldada por S3.
S3 select parece usar el mismo tipo de tecnología, pero supongo que está más dirigido al uso directo de las aplicaciones para filtrar o fragmentar sus conjuntos de datos.