Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

442
Views
Diferencias prácticas entre los tipos de instancias de Amazon RDS (PostgreSQL)

Soy relativamente nuevo en la configuración de bases de datos PostgreSQL en general y AWS.

Estoy tratando de averiguar cuáles son las diferencias prácticas entre los tipos de instancias de Amazon RDS . Un poco de contexto sobre mi organización y casos de uso:

  • Somos principalmente un equipo pequeño (menos de 5 usuarios) de analistas de datos/científicos de datos
  • No necesitamos un tiempo de actividad del 100 %. Probablemente encienda la base de datos durante el horario comercial normal y la apague después. Nuestro caso de uso es principalmente para fines de análisis/ciencia de datos, no habrá aplicaciones en vivo ejecutándose encima.
  • Necesitaremos 1 base de datos por ahora.
  • La base de datos contendrá alrededor de 300 - 500 GB de datos. La mayoría de las tablas son pequeñas (menos de 1 GB). Sin embargo, hay algunas mesas que son bastante grandes. La tabla más grande tendrá unos 80 GB y se consultará con frecuencia. Hay algunas otras tablas que rondan los 10 GB.

Empecé con la capa gratuita por ahora db.t2.micro solo para ganar algo de experiencia, desarrollar y probar lo que necesito. Sin embargo, es difícil para mí entender cómo se compara esto con otros casos. Nuestro equipo también es muy consciente del presupuesto en este momento, así que estoy tratando de analizar esto antes de recomendar una actualización.

Operaciones de ejemplo que estoy tratando de hacer

  1. Cargar una tabla desde CSV: tenemos muchos CSV en el disco que cargaré en la base de datos de PostgreSQL. Acabo de probar uno en este momento, creando una tabla y cargando el CSV en la tabla (usando \copy ) de un archivo de 11 GB (35,401,551 filas y 40 columnas) tomó alrededor de 27 minutos. ¿Actualizar la instancia ayudaría con eso? Si es así, no estoy seguro de a qué me gustaría actualizar.
  2. Un select count(*) de esa tabla tomó alrededor de 15 minutos (en la primera ejecución, en la segunda ejecución tomó alrededor de 3 minutos, ¿probablemente porque está almacenando en caché las estadísticas? 3 minutos todavía me parecen lentos). Nuevamente, ¿no está seguro de si actualizar la instancia ayudaría con eso? También debo señalar que no tengo claves primarias o índices agregados. Entonces, ¿podría haber otras formas de optimizar el rendimiento sin actualizar la instancia? Por ejemplo, es posible que la partición sea útil: https://www.postgresql.org/docs/10/ddl-partitioning.html . La tabla tiene una columna de state que suele ser uno de los primeros filtros que usan los usuarios, ya que a menudo los usuarios solo quieren ver uno o un conjunto de estados particulares.
    1. Un grupo simple por consulta: select ColA, count(*) group by ColA tomó alrededor de 2.5 minutos

EDITAR Solo notando algunos otros recursos útiles que he encontrado:

  1. https://www.apptio.com/blog/ec2-m5-vs-t3/ sobre cómo elegir entre m5 y t3
over 4 years ago · Santiago Trujillo
1 answers
Answer question

0

Principalmente con los tipos de instancia dentro de RDS, las diferencias clave son las siguientes:

  • Memoria disponible
  • CPU disponible
  • Rendimiento máximo de la red
  • Ampliable frente a no ampliable (la familia de instancias T usa créditos ampliables, una vez que se agota, su CPU está limitada).

Como está utilizando un T2.micro , solo tiene una CPU disponible. Una vez que se agoten los créditos, solo tendrá un límite del 20% de la CPU máxima, lo que limitará lo que puede hacer.

También me gustaría señalar que si puede invertir más en la plataforma AWS, hay una solución de almacenamiento de datos dedicada para análisis que es Redshift , es probable que tenga un mejor rendimiento pero costará más, también está bifurcado de Postgres.

Si lo que busca es apegarse a Postgres en RDS, también debe considerar Aurora Postgres , que generalmente proporciona 2 o 3 veces el rendimiento de Postgres normal en RDS.

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!