Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

268
Vistas
Diferencias prácticas entre los tipos de instancias de Amazon RDS (PostgreSQL)

Soy relativamente nuevo en la configuración de bases de datos PostgreSQL en general y AWS.

Estoy tratando de averiguar cuáles son las diferencias prácticas entre los tipos de instancias de Amazon RDS . Un poco de contexto sobre mi organización y casos de uso:

  • Somos principalmente un equipo pequeño (menos de 5 usuarios) de analistas de datos/científicos de datos
  • No necesitamos un tiempo de actividad del 100 %. Probablemente encienda la base de datos durante el horario comercial normal y la apague después. Nuestro caso de uso es principalmente para fines de análisis/ciencia de datos, no habrá aplicaciones en vivo ejecutándose encima.
  • Necesitaremos 1 base de datos por ahora.
  • La base de datos contendrá alrededor de 300 - 500 GB de datos. La mayoría de las tablas son pequeñas (menos de 1 GB). Sin embargo, hay algunas mesas que son bastante grandes. La tabla más grande tendrá unos 80 GB y se consultará con frecuencia. Hay algunas otras tablas que rondan los 10 GB.

Empecé con la capa gratuita por ahora db.t2.micro solo para ganar algo de experiencia, desarrollar y probar lo que necesito. Sin embargo, es difícil para mí entender cómo se compara esto con otros casos. Nuestro equipo también es muy consciente del presupuesto en este momento, así que estoy tratando de analizar esto antes de recomendar una actualización.

Operaciones de ejemplo que estoy tratando de hacer

  1. Cargar una tabla desde CSV: tenemos muchos CSV en el disco que cargaré en la base de datos de PostgreSQL. Acabo de probar uno en este momento, creando una tabla y cargando el CSV en la tabla (usando \copy ) de un archivo de 11 GB (35,401,551 filas y 40 columnas) tomó alrededor de 27 minutos. ¿Actualizar la instancia ayudaría con eso? Si es así, no estoy seguro de a qué me gustaría actualizar.
  2. Un select count(*) de esa tabla tomó alrededor de 15 minutos (en la primera ejecución; en la segunda ejecución tomó alrededor de 3 minutos, ¿probablemente porque está almacenando en caché las estadísticas? 3 minutos todavía me parecen lentos). Nuevamente, ¿no está seguro de si actualizar la instancia ayudaría con eso? También debo señalar que no tengo claves primarias o índices agregados. Entonces, ¿podría haber otras formas de optimizar el rendimiento sin actualizar la instancia? Por ejemplo, es posible que la partición sea útil: https://www.postgresql.org/docs/10/ddl-partitioning.html . La tabla tiene una columna de state que suele ser uno de los primeros filtros que usan los usuarios, ya que a menudo los usuarios solo quieren ver uno o un conjunto de estados particulares.
    1. Un grupo simple por consulta: select ColA, count(*) group by ColA tomó alrededor de 2.5 minutos

EDITAR Solo notando algunos otros recursos útiles que he encontrado:

  1. https://www.apptio.com/blog/ec2-m5-vs-t3/ sobre cómo elegir entre m5 y t3
over 4 years ago · Santiago Trujillo
1 Respuestas
Responde la pregunta

0

Principalmente con los tipos de instancia dentro de RDS, las diferencias clave son las siguientes:

  • Memoria disponible
  • CPU disponible
  • Rendimiento máximo de la red
  • Ampliable frente a no ampliable (la familia de instancias T usa créditos ampliables, una vez que se agota, su CPU está limitada).

Como está utilizando un T2.micro , solo tiene una CPU disponible. Una vez que se agoten los créditos, solo tendrá un límite del 20% de la CPU máxima, lo que limitará lo que puede hacer.

También me gustaría señalar que si puede invertir más en la plataforma de AWS, hay una solución de almacenamiento de datos dedicada para análisis que es Redshift , es probable que funcione mejor pero costará más, también está bifurcado de Postgres.

Si lo que busca es apegarse a Postgres en RDS, también debe considerar Aurora Postgres , que generalmente proporciona 2 o 3 veces el rendimiento de Postgres normal en RDS.

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda