He leído esta publicación que responde con 4 reproductores comerciales que implementan la búsqueda precisa de fotogramas y los investigaré, pero estamos tratando de crear una herramienta para etiquetar objetos en un video y necesitamos saber con precisión el fotograma que han etiquetado. un observador posterior puede validar su etiqueta.
Pedimos a los usuarios que miren hasta que vean nuestro objeto deseado. Luego pause el video y navegue hasta el "Mejor marco". Les damos botones para retroceder y avanzar (1 segundo/FPS promedio) para moverse un cuadro a la vez (a menos que nuestro video tenga cuadros perdidos, entonces deben presionar esos botones una vez por cada cuadro perdido).
[Pregunta adicional: ¿podemos saber si nos dio un nuevo cuadro o solo el mismo cuadro con un tiempo en video actualizado? Si obtuviéramos el mismo cuadro, podríamos repetir hasta el primer cuadro nuevo para que el usuario no tenga que seguir presionando la tecla.]
Cuando llegan al mejor cuadro, podemos registrar el tiempo de ese cuadro, pero estamos descubriendo que el tiempo a menudo regresa con diferentes milisegundos cada vez que alguien etiqueta exactamente el mismo cuadro. Por lo tanto, no podemos hacer que un usuario posterior busque exactamente el mismo marco para validar la etiqueta del primer observador. Estamos utilizando Canvas para permitir que el primer usuario dibuje un cuadro delimitador alrededor de nuestro objeto de interés. Sin embargo, no podemos volver a dibujar de manera confiable el cuadro delimitador si está en el marco incorrecto ya que nuestros objetos se mueven rápidamente.
Idealmente, si no puede ser un número de cuadro secuencial, ¿puede ser un código PTS? ¿Hay alguna otra forma en que podamos determinar el marco preciso cada vez? Estamos construyendo esto para una audiencia controlada que podemos entrenar, por lo que las soluciones creativas son aceptables.
Estamos abiertos a un "trampa" porque controlamos cada video en nuestro flujo de trabajo. Si podemos escribir "algo" en el archivo que puede ser leído por HTML-Video, podríamos buscar el tiempo aproximado menos 0,5 segundos y luego leer los cuadros subsiguientes para "algo" que pueda decirnos que tenemos una coincidencia exacta.