Los documentos dicen:
Matriz de datos utilizada en XGBoost. DMatrix es una estructura de datos interna que utiliza XGBoost, que está optimizada tanto para la eficiencia de la memoria como para la velocidad de entrenamiento. Puede construir DMatrix a partir de múltiples fuentes de datos diferentes.
Entiendo esto, pero ¿cuál es la diferencia/uso de DMatrix en lugar de Pandas Dataframe?
Al usar el paquete XGBoost Python , puede elegir entre dos API diferentes para entrenar su modelo. La propia API de aprendizaje de XGB y la API Scikit-Learn .
Cuando se usa la API de Scikit-Learn, los datos se pasan al modelo como marcos de datos pandas o arreglos numpy. Cuando se utiliza la API de aprendizaje, los datos se transmiten mediante DMatrix.
Eche un vistazo a los ejemplos de python para ver cómo se usan ambas API.
Básicamente, ya encontró el "uso de DMatrix en lugar de Pandas Dataframe" en los documentos : es una estructura de datos que los desarrolladores de XGBoost crearon para "eficiencia de memoria y velocidad de entrenamiento" con su biblioteca de aprendizaje automático.