Tengo una colección que contiene alrededor de 10,2 millones de registros. Mi consulta agregada tarda alrededor de 6 segundos en enviar un registro. ¿Cómo optimizo mi consulta agregada? Los índices se definen en los campos token0address,token1address y timestamp.
Abajo está mi consulta
{ $match: { $or: [ { token0Address: quoteCurrency, }, { token1Address: quoteCurrency, }, ], timestamp: { $gte: Number(historyDTO.from), $lte: Number(historyDTO.to), }, }, }, { $group: { _id: idObj, transactionDate: { $first: '$transactionDate' }, timestamp: { $first: '$timestamp' }, minimum_price: { $min: '$priceInToken0' }, maximum_price: { $max: '$priceInToken0' }, median_price: { $avg: '$priceInToken0' }, open_price: { $first: '$priceInToken0' }, close_price: { $last: '$priceInToken0' }, volume: { $sum: '$priceInToken0' }, }, }, { $sort: { timestamp: -1 } }, { $skip: 0 }, { $limit: Number(historyDTO.countback) },idObj se ve así. También contiene otras combinaciones
if (last === 'H') { idObj = { day: { $dayOfYear: '$transactionDate' }, hour: { $subtract: [ { $hour: '$transactionDate' }, { $mod: [{ $hour: '$transactionDate' }, parseInt(exceptLast)] }, ], }, };}
Mencionaré algunos cambios que creo que podrían mejorar el rendimiento, sin embargo, en general diré que esto está bastante optimizado y personalmente no pasaría más tiempo optimizándolo a menos que sea una parte integral de muchos procesos y cada milisegundo de tiempo de ejecución sea importante.
Cree índices compuestos para ambos campos token0Address y token1Address . En este momento, Mongo está usando estos índices, sin embargo, luego necesita buscar y hacer coincidir los documentos según la timestamp de tiempo. Si pudiera crear ambos índices como {token0Address: 1, timestamp: 1} compuestos, entonces Mongo podría terminar la etapa $match un poco más rápido. (dependiendo obviamente del rango dado y la escala de los documentos coincidentes).
alterando el idObj si es posible, mencionó que idObj tiene diferentes estructuras, tal vez algunas de ellas tengan redundancias que podrían eliminarse, aquí realmente no podemos hacer nada debido al uso dinámico del operador $mod , otra posibilidad sería preprocesar el campos requeridos (por ejemplo, en este caso para guardar el resultado $hour para que dejemos de usar esta operación).
la última opción es más un truco, pero si conoce la heurística sobre la distribución de datos y las consultas, es posible que pueda agregar límites anteriores y procesar menos datos. por lo general, esta no es una opción realista, especialmente con la escala algo baja de sus datos.