Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

267
Views
¿Cuál debo usar para las tareas de referencia en el tiempo de usuario + sys de Hadoop o el tiempo total de CPU empleado en el contador de trabajos de Hadoop?

En esta declaración en una respuesta escrita que "el mismo trabajo se ejecuta con los mismos datos pero en un clúster de 20 nodos, luego en un clúster de 200 nodos. En general, se usará la misma cantidad de tiempo de CPU en ambos clústeres" ¿Alguien puede explicar esto?

He usado el comando de time para medir el tiempo real. A veces tengo más tiempo de CPU (contador de hadoop) que el tiempo real real o viceversa. Sé que el tiempo real mide el tiempo real del reloj transcurrido y puede ser mayor o menor que user+sys .

Todavía no entiendo lo que mide el tiempo total de CPU en Hadoop. Con respecto al comando de tiempo, esta respuesta escrita es buena para ir con user+sys para los puntos de referencia.

  1. Como total cpu time taken by process = user+sys , entonces debería ser el mismo que el tiempo total de CPU del contador de trabajos de Hadoop. Pero estoy obteniendo resultados diferentes.
  2. ¿A qué hora debo considerar si estoy realizando algún tipo de tareas de referencia en hadoop user+sys o el tiempo total de CPU empleado (contador de hadoop)?

nota: en apache hive benchmark han considerado el tiempo real pero también puede verse afectado por otros procesos. Así que no puedo considerar el tiempo real.

over 4 years ago · Santiago Trujillo
1 answers
Answer question

0

same job running over the same data but on one 20 node cluster, then a 200 node cluster.Overall, the same amount of CPU time will be used on both clusters

Esto significa que si un trabajo lleva N horas en un clúster de 20 nodos y M horas en un clúster de 200 nodos, 20 * N debería ser igual a M * 200

El tiempo real debe ser su elección, pero como dijo anteriormente, este valor puede cambiar en consecuencia, por lo que debe intentarlo al menos 3 veces y calcular el promedio como resultado final.

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!