Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

265
Visualizações
¿Cómo decide Chrome qué resaltar cuando haces doble clic en texto en japonés?

Si hace doble clic en el texto en inglés en Chrome, se resalta la palabra delimitada por espacios en blanco en la que hizo clic. Esto no es sorprendente. Sin embargo, el otro día estaba haciendo clic mientras leía un texto en japonés y noté que algunas palabras estaban resaltadas en los límites de las palabras, aunque el japonés no tiene espacios. Aquí hay un texto de ejemplo:

どこ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ 何 何 何 何 何 何 何 何 何 何 何 何 何 何

Por ejemplo, si hace clic en 薄暗い, Chrome lo resaltará correctamente como una sola palabra, aunque no sea una sola clase de carácter (es una mezcla de kanji e hiragana). No todos los resaltados son correctos, pero no parecen aleatorios.

¿Cómo decide Chrome qué resaltar aquí? Intenté buscar "palabra japonesa" en la fuente de Chrome, pero solo encontré pruebas para un módulo experimental que no parece estar activo en mi versión de Chrome.

over 4 years ago · Santiago Trujillo
2 Respostas
Responde à pergunta

0

Entonces resulta que v8 tiene un segmentador de palabras multilingüe no estándar y maneja japonés.

 function tokenizeJA(text) { var it = Intl.v8BreakIterator(['ja-JP'], {type:'word'}) it.adoptText(text) var words = [] var cur = 0, prev = 0 while (cur < text.length) { prev = cur cur = it.next() words.push(text.substring(prev, cur)) } return words } console.log(tokenizeJA('どこで生れたかとんと見当がつかぬ。何でも薄暗いじめじめした所でニャーニャー泣いていた事だけは記憶している。')) // ["どこ", "で", "生れ", "たか", "とんと", "見当", "が", "つ", "か", "ぬ", "。", "何でも", "薄暗い", "じめじめ", "した", "所", "で", "ニャーニャー", "泣", "い", "て", "いた事", "だけ", "は", "記憶", "し", "て", "いる", "。"]

También hice un jsfiddle que muestra esto.

La calidad no es sorprendente, pero me sorprende que esto sea compatible.

over 4 years ago · Santiago Trujillo Relatório

0

Según los enlaces publicados por JonathonW , la respuesta básicamente se reduce a: "Hay una gran lista de palabras japonesas y Chrome verifica si hizo doble clic en una palabra".

Específicamente, v8 usa ICU para hacer un montón de cosas de procesamiento de texto relacionadas con Unicode, incluida la división del texto en palabras . El código de detección de límites de ICU incluye un "Iterador de ruptura basado en diccionario" para idiomas que no tienen espacios, incluidos japonés, chino, tailandés, etc.

Y para su ejemplo específico de "薄暗い", puede encontrar esa palabra en el diccionario chino-japonés combinado enviado por ICU (línea 255431). Actualmente hay 315.671 palabras en chino/japonés en total en la lista. Presumiblemente, si encuentra una palabra que Chrome no divide correctamente, puede enviar un parche a ICU para agregar esa palabra.

over 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda