Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

272
Vistas
¿Cuál debo usar para las tareas de referencia en el tiempo de usuario + sys de Hadoop o el tiempo total de CPU empleado en el contador de trabajos de Hadoop?

En esta declaración en una respuesta escrita que "el mismo trabajo se ejecuta con los mismos datos pero en un clúster de 20 nodos, luego en un clúster de 200 nodos. En general, se usará la misma cantidad de tiempo de CPU en ambos clústeres" ¿Alguien puede explicar esto?

He usado el comando de time para medir el tiempo real. A veces tengo más tiempo de CPU (contador de hadoop) que el tiempo real real o viceversa. Sé que el tiempo real mide el tiempo real del reloj transcurrido y puede ser mayor o menor que user+sys .

Todavía no entiendo lo que mide el tiempo total de CPU en Hadoop. Con respecto al comando de tiempo, esta respuesta escrita es buena para ir con user+sys para los puntos de referencia.

  1. Como total cpu time taken by process = user+sys , entonces debería ser el mismo que el tiempo total de CPU del contador de trabajos de Hadoop. Pero estoy obteniendo resultados diferentes.
  2. ¿A qué hora debo considerar si estoy realizando algún tipo de tareas de referencia en hadoop user+sys o el tiempo total de CPU empleado (contador de hadoop)?

nota: en apache hive benchmark han considerado el tiempo real pero también puede verse afectado por otros procesos. Así que no puedo considerar el tiempo real.

over 4 years ago · Santiago Trujillo
1 Respuestas
Responde la pregunta

0

same job running over the same data but on one 20 node cluster, then a 200 node cluster.Overall, the same amount of CPU time will be used on both clusters

Esto significa que si un trabajo lleva N horas en un clúster de 20 nodos y M horas en un clúster de 200 nodos, 20 * N debería ser igual a M * 200

El tiempo real debe ser su elección, pero como dijo anteriormente, este valor puede cambiar en consecuencia, por lo que debe intentarlo al menos 3 veces y calcular el promedio como resultado final.

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda