Sigo subiendo textos (diariamente) de unas 30 páginas de media (~100.000 caracteres). Como necesito hacer coincidir el texto con textos futuros, pero no quiero cargar todo el contenido del documento en una base de datos (que también sería demasiado grande), intenté dividirlo en una cadena de 256 caracteres.
El objetivo es hacer coincidir el texto con los textos futuros de coincidencia y generar la coincidencia en %. Para que sea más fácil de verificar, sería mejor para mí si pudiera almacenar una cadena larga de 256 caracteres en la base de datos y generar textos futuros también en una cadena larga de 256 caracteres, y luego comparar estas cadenas entre sí y devolver el porcentaje de coincidencia. (Similar a este sitio web )
Aquí leí que no tiene sentido convertirlos en hashes, ya que requiere demasiada potencia de procesamiento. ¿Hay otras posibilidades? ¿O qué tendría sentido para mi situación?