Estoy tratando de averiguar por qué un tipo de datos char de 8 bits puede contener todos estos caracteres extraños, ya que no forman parte de la primera tabla de 256 caracteres.
#include <iostream> int main() { char chars[] = "😎 🥸 🤩 🥳 必 西 ♠ ♬ ♭ ♮ ♯"; std::cout << "sizeof(char): " << sizeof(char) << " byte" << std::endl; std::cout << chars << std::endl; return 0; }Un char de 8 bits solo puede contener 256 valores como máximo. Pero Unicode tiene cientos de miles de caracteres. Obviamente, no pueden caber en un solo char . Por lo tanto, deben codificarse de tal manera que puedan caber en múltiples char .
Es probable que su editor/compilador esté almacenando su cadena de ejemplo en codificación UTF-8 . Los caracteres que no son ASCII en UTF-8 ocupan más de 1 char .
En su ejemplo, en UTF-8, sizeof(chars) tendría un tamaño de 55+1=56 char (+1 para el terminador nulo), aunque solo ve 29 "caracteres" (si cuenta los espacios), donde:
= 0x20 (18x)
😎 = 0xF0 0x9F 0x98 0x8E
🥸 = 0xF0 0x9F 0xA5 0xB8
🤩 = 0xF0 0x9F 0xA4 0xA9
🥳 = 0xF0 0x9F 0xA5 0xB3必= 0xE5 0xBF 0x85西= 0xE8 0xA5 0xBF
♠ = 0xE2 0x99 0xA0
♬ = 0xE2 0x99 0xAC
♭ = 0xE2 0x99 0xAD
♮ = 0xE2 0x99 0xAE
♯ = 0xE2 0x99 0xAF