Estoy tratando de desarrollar una función de front-end donde el usuario puede arrastrar y soltar partes de una imagen (textos detectados a través de Google Vision API para OCR) a diferentes <div> s para categorizar los textos detectados en la imagen. Por ejemplo, en la imagen de abajo, quiero que 'Moreno', 'Kaffeepads', '40 pads', etc. permitan arrastrar y soltar estos textos en la imagen original como imágenes separadas a otros divs.
Sin embargo, no estoy completamente seguro de cómo implementar dicha función. Estoy implementando el backend con Django. Cualquier sugerencia sería apreciada.