Soy nuevo en Redshift y tengo algunas aclaraciones sobre cómo funciona Redshift:
¿Amazon Redshift tiene su propia plataforma de almacenamiento de back-end o depende de S3 para almacenar los datos como objetos y Redshift se usa solo para consultar, procesar y transformar y tiene almacenamiento temporal para recoger el segmento específico de S3 y procesarlo?
En cierto sentido, ¿tiene redshift su propio espacio en la nube como Oracle o Microsoft SQL con su propio servidor físico en el que se almacenan los datos?
Porque, si estoy migrando de un sistema RDBMS convencional a Redshift debido a un mayor volumen, si opto por Redshift solo, debería optar por una combinación de Redshift y S3.
Esta pregunta parece ser básica, pero no puedo encontrar la respuesta en los sitios web de Amazon ni en ninguno de los blogs relacionados con Redshift.
Sí, Amazon Redshift utiliza su propio almacenamiento.
El principal caso de uso de Amazon Redshift es ejecutar consultas complejas en grandes cantidades de datos. Este es el propósito de un "almacén de datos".
Mientras que las bases de datos normales comienzan a perder rendimiento cuando hay más de 1 millón de filas, Amazon Redshift puede manejar miles de millones de filas . Esto se debe a que los datos se distribuyen en varios nodos y se almacenan en formato de columnas , lo que los hace adecuados para manejar tablas "anchas" (que son típicas en los almacenes de datos). Esto es lo que le da a Redshift su velocidad. De hecho, es el almacenamiento dedicado y la forma en que se almacenan los datos lo que le da a Redshift su asombrosa velocidad.
Sin embargo, la contrapartida significa que, si bien Redshift es sorprendente para consultas de grandes cantidades de datos, no está diseñado para actualizar datos con frecuencia . Por lo tanto, no debe sustituirse por una base de datos normal que está siendo utilizada por una aplicación para transacciones. Más bien, Redshift se usa a menudo para tomar esos datos transaccionales, combinarlos con otra información (clientes, pedidos, transacciones, tickets de soporte, datos de sensores, clics en sitios web, información de seguimiento, etc.) y luego ejecutar consultas complejas que combinan todos esos datos.
Amazon Redshift también puede usar Amazon Redshift Spectrum , que es muy similar a Amazon Athena. Ambos servicios pueden leer datos directamente desde Amazon S3. Dicho acceso no es tan eficiente como el uso de datos almacenados directamente en Redshift, pero se puede mejorar mediante el uso de formatos de almacenamiento en columnas (por ejemplo, ORC y Parquet) y mediante la partición de archivos. Esto, por supuesto, solo es bueno para consultar datos, no para realizar transacciones (actualizaciones) contra los datos.
Los nodos más nuevos de Amazon Redshift RA3 también tienen la capacidad de descargar datos menos utilizados a Amazon S3 y utilizan el almacenamiento en caché para ejecutar consultas rápidas. El beneficio es que separa el almacenamiento de la computación.
Sumario rápido:
mirando su pregunta, puede beneficiarse de la ayuda profesional con su arquitectura.
Sin embargo, para empezar, Redshift::