Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

131
Visualizações
Eliminar signos y repetir números

Quiero eliminar todos los signos de mi dataframe de datos para dejarlo en cualquiera de los dos formatos: 100-200 o 200

Por lo tanto, los salarios deben tener un solo guión entre ellos si se da un rango de salarios, de lo contrario, un solo número limpio.

tengo los siguientes datos:

 import pandas as pd import re df = {'salary':['£26,768 - £30,136/annum Attractive benefits package', '£26,000 - £28,000/annum plus bonus', '£21,000/annum', '£26,768 - £30,136/annum Attractive benefits package', '£33/hour', '£18,500 - £20,500/annum Inc Bonus - Study Support + Bens', '£27,500 - £30,000/annum £27,500 to £30,000 + Study', '£35,000 - £40,000/annum', '£24,000 - £27,000/annum Study Support (ACCA / CIMA)', '£19,000 - £24,000/annum Study Support', '£30,000 - £35,000/annum', '£44,000 - £66,000/annum + 15% Bonus + Excellent Benefits. L', '£75 - £90/day £75-£90 Per Day']} data = pd.DataFrame(df)

Esto es lo que he intentado eliminar algunos de los signos:

 salary = [] for i in data.salary: space = re.sub(" ",'',i) lower = re.sub("[az]",'',space) upper = re.sub("[AZ]",'',lower) bracket = re.sub("/",'',upper) comma = re.sub(",", '', bracket) plus = re.sub("\+",'',comma) percentage = re.sub("\%",'', plus) dot = re.sub("\.",'', percentage) bracket1 = re.sub("\(",'',dot) bracket2 = re.sub("\)",'',bracket1) salary.append(bracket2)

Lo que me da:

 '£26768-£30136', '£26000-£28000', '£21000', '£26768-£30136', '£33', '£18500-£20500-', '£27500-£30000£27500£30000', '£35000-£40000', '£24000-£27000', '£19000-£24000', '£30000-£35000', '£44000-£6600015', '£75-£90£75-£90'

Sin embargo, tengo algunos números que se repiten, esencialmente quiero cualquier cosa después de eliminar el primer rango de valores, y cualquier signo además del guión entre los dos números.

Rendimiento esperado:

 '26768-30136', '26000-28000', '21000', '26768-30136', '33', '18500-20500', '27500-30000', '35000-40000', '24000-27000', '19000-24000', '30000-35000', '44000-66000', '75-90
over 4 years ago · Santiago Trujillo
3 Respostas
Responde à pergunta

0

Otra forma de usar pandas.Series.str.partition con replace :

 data["salary"].str.partition("/")[0].str.replace("[^\d-]+", "", regex=True)

Producción:

 0 26768-30136 1 26000-28000 2 21000 3 26768-30136 4 33 5 18500-20500 6 27500-30000 7 35000-40000 8 24000-27000 9 19000-24000 10 30000-35000 11 44000-66000 12 75-90 Name: 0, dtype: object

Explique:

Asume que solo está interesado en las partes hasta / ; extrae todo hasta / , que elimina todo menos dígitos y guión

over 4 years ago · Santiago Trujillo Relatório

0

Puedes usar

 data['salary'].str.split('/', n=1).str[0].replace('[^\d-]+','', regex=True) # 0 26768-30136 # 1 26000-28000 # 2 21000 # 3 26768-30136 # 4 33 # 5 18500-20500 # 6 27500-30000 # 7 35000-40000 # 8 24000-27000 # 9 19000-24000 # 10 30000-35000 # 11 44000-66000 # 12 75-90

Aquí,

  • .str.split('/', n=1) - se divide en dos partes con el primer / char
  • .str[0] - obtiene el primer elemento
  • .replace('[^\d-]+','', regex=True) - elimina todos los caracteres que no sean dígitos y guiones.

Una solución más precisa es extraer el £num(-£num)? patrón y elimine todos los que no sean dígitos/guiones:

 data['salary'].str.extract(r'£(\d+(?:,\d+)*(?:\.\d+)?(?:\s*-\s*£\d+(?:,\d+)*(?:\.\d+)?)?)')[0].str.replace(r'[^\d-]+', '', regex=True)

Detalles :

  • £ - un carácter literal
  • \d+(?:,\d+)*(?:\.\d+)? - uno o más dígitos, seguidos de cero o más ocurrencias de una coma y uno o más dígitos y luego una secuencia opcional de un punto y uno o más dígitos
  • (?:\s*-\s*£\d+(?:,\d+)*(?:\.\d+)?)? - una ocurrencia opcional de un guión encerrado con cero o más espacios en blanco ( \s*-\s* ), luego un carácter £ y un patrón numérico descrito anteriormente.
over 4 years ago · Santiago Trujillo Relatório

0

Puede hacerlo en solo dos pases de expresiones regulares. Primero extraiga los montos monetarios con una expresión regular, luego elimine los separadores de miles, finalmente, una la salida por grupo manteniendo solo las dos primeras apariciones por fila original.

La ventaja de esta solución es que en realidad solo extrae dígitos monetarios, no otros números posibles que estarían allí si la entrada no está limpia.

 (data['salary'].str.extractall(r'£([,\d]+)')[0] # extract £123,456 digits .str.replace(r'\D', '', regex=True) # remove separator .groupby(level=0).apply(lambda x: '-'.join(x[:2])) # join first two occurrences )

producción:

 0 26768-30136 1 26000-28000 2 21000 3 26768-30136 4 33 5 18500-20500 6 27500-30000 7 35000-40000 8 24000-27000 9 19000-24000 10 30000-35000 11 44000-66000 12 75-90
over 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda