Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

264
Vistas
¿Cómo minimizar una gran colección finita de cadenas?

Estoy creando un Trie en la memoria. Cada nodo contiene una palabra. Es extremadamente bueno en cuanto a rendimiento. Pero el problema es el consumo de memoria.

¡Tiene 6 GB de tamaño! Lo serialicé con protobuf y lo escribí en un archivo que resultó ser de 150 MB.

JSON es de 250 MB. ¿Esperaba si hay una manera de minimizar las cuerdas? Por ejemplo:

ingrese la descripción de la imagen aquí

Como puede ver, hay duplicados en la primera columna. Además, debe ser reversible.

Todas las propiedades/columnas son cadenas.

Así que digamos que la tabla se convierte en:

ingrese la descripción de la imagen aquí

Creo que eso ahorraría mucho espacio. Por supuesto que puedo hacer esto insertando primero cada celda en un diccionario y luego asignándole un número entero, pero no quiero reinventar la rueda a menos que tenga que hacerlo.

over 4 years ago · Santiago Trujillo
1 Respuestas
Responde la pregunta

0

La idea que desea hacer es crear un diccionario primero con todos y luego cambiar los valores reales a la clave del diccionario (que será más pequeña).

Este enfoque se utiliza en Zip y otros algoritmos de compresión.

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda