Python 3.5, preprocesamiento de sklearn
df = quandl.get('WIKI/GOOGL') X = np.array(df) X = preprocessing.scale(X)El algoritmo preprocessing.scale() pone sus datos en una escala. Esto es útil con conjuntos de datos en gran medida dispersos. En palabras simples, sus datos están muy dispersos. Por ejemplo, los valores de X pueden ser así:
X = [1, 4, 400, 10000, 100000]
El problema con la escasez es que está muy sesgada o, en términos estadísticos, sesgada. Entonces, por lo tanto, escalar los datos trae todos sus valores a una escala eliminando la escasez. En cuanto a saber cómo funciona en detalle matemático, esto sigue el mismo concepto de Normalización y Estandarización. Puede investigar sobre ellos para descubrir cómo funciona en detalle. ¡Pero para simplificar la vida, el algoritmo sklearn lo hace todo por usted!
Escalar los datos trae todos sus valores a una escala eliminando la escasez y sigue el mismo concepto de Normalización y Estandarización. Para ver el efecto, puede llamar a describe en el marco de datos antes y después del procesamiento:
df.describe() #with X is already pre-proccessed df2 = pandas.DataFrame(X) df2.describe()Verá que df2 tiene una media de 0 y la variación estándar de 1 en cada campo.
El método preprocessing.scale() es útil en la estandarización de puntos de datos. Se dividiría por la desviación estándar y se restaría la media de cada punto de datos.