Mis problemas son los mismos que, Cómo agrupar por registros continuos en SQL , solo que necesito una solución en Pandas.
Dado un df como
ID Colour ------------ 1 Red 2 Red 3 Red 4 Red 5 Red 6 Green 7 Green 8 Green 9 Green 10 Red 11 Red 12 Red 13 Red 14 Green 15 Green 16 Green 17 Blue 18 Blue 19 Red 20 Bluelo quiero agrupado en
color minId ------------ Red 1 Green 6 Red 10 Green 14 Blue 17 Red 19 Blue 20 Está bien cambiar el nombre de los colores (por ejemplo, Green1 )
La solución debe generalizarse en otras agregaciones que no sean solo min
Puede agrupar por valores consecutivos por serie auxiliar creada por valores desplazados comparados y cumsum y luego agregar first y min :
g = df['Colour'].ne(df['Colour'].shift()).cumsum() df = df.groupby(g).agg(color=('Colour','first'), minId=('ID','min')).reset_index(drop=True) print (df) color minId 0 Red 1 1 Green 6 2 Red 10 3 Green 14 4 Blue 17 5 Red 19 6 Blue 20