Unet es una arquitectura de red bastante popular, utilizada en varias tareas de visión artificial. Por lo general, el codificador Unet tiene capas de reducción de resolución que reducen la resolución en 2, lo que significa que la zancada de la capa de conv utilizada será 2 y los tamaños de filtro >3. Para un problema que estoy intentando, quiero realizar una reducción de muestreo 8 veces (2 veces cada vez). En lugar de tener 8 capas en el codificador, pensé que podía tener 4 capas que reducen la muestra en 4 cada una. Para esto, no creo que los tamaños de filtro como 3 o 5 tengan mucho sentido: durante el deslizamiento, el filtro terminará sin cubrir ciertos píxeles. Me gustaría obtener algunos consejos sobre cómo necesito modificar el tamaño del filtro a medida que modifico la zancada y viceversa. Además, ¿también tendría sentido reducir la cantidad de filtros si aumento el tamaño del filtro?
Un indicador para los lectores de esta P: busqué en Internet trabajos anteriores que usen Stride 4 y encontré AlexNet. Su primera capa de conversión tiene filtros 11x11x96 y stride 4 . Por lo tanto, me animan a aumentar el tamaño de mi filtro. :)
No estoy seguro de si esto se ajusta a su problema. Pero si desea reducir la resolución 8 veces y evitar el problema de los pasos, puede establecer el relleno en "igual" en las capas Conv2D. Aplicará la zancada y el relleno con ceros uniformemente a la izquierda/derecha o arriba/abajo de la entrada, de modo que la salida tenga la misma dimensión de alto/ancho que la entrada.