Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

211
Views
¿Cómo decide Chrome qué resaltar cuando haces doble clic en texto en japonés?

Si hace doble clic en el texto en inglés en Chrome, se resalta la palabra delimitada por espacios en blanco en la que hizo clic. Esto no es sorprendente. Sin embargo, el otro día estaba haciendo clic mientras leía un texto en japonés y noté que algunas palabras estaban resaltadas en los límites de las palabras, aunque el japonés no tiene espacios. Aquí hay un texto de ejemplo:

どこ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ ニャ 何 何 何 何 何 何 何 何 何 何 何 何 何 何

Por ejemplo, si hace clic en 薄暗い, Chrome lo resaltará correctamente como una sola palabra, aunque no sea una sola clase de carácter (es una mezcla de kanji e hiragana). No todos los resaltados son correctos, pero no parecen aleatorios.

¿Cómo decide Chrome qué resaltar aquí? Intenté buscar "palabra japonesa" en la fuente de Chrome, pero solo encontré pruebas para un módulo experimental que no parece estar activo en mi versión de Chrome.

over 4 years ago · Santiago Trujillo
2 answers
Answer question

0

Entonces resulta que v8 tiene un segmentador de palabras multilingüe no estándar y maneja japonés.

 function tokenizeJA(text) { var it = Intl.v8BreakIterator(['ja-JP'], {type:'word'}) it.adoptText(text) var words = [] var cur = 0, prev = 0 while (cur < text.length) { prev = cur cur = it.next() words.push(text.substring(prev, cur)) } return words } console.log(tokenizeJA('どこで生れたかとんと見当がつかぬ。何でも薄暗いじめじめした所でニャーニャー泣いていた事だけは記憶している。')) // ["どこ", "で", "生れ", "たか", "とんと", "見当", "が", "つ", "か", "ぬ", "。", "何でも", "薄暗い", "じめじめ", "した", "所", "で", "ニャーニャー", "泣", "い", "て", "いた事", "だけ", "は", "記憶", "し", "て", "いる", "。"]

También hice un jsfiddle que muestra esto.

La calidad no es sorprendente, pero me sorprende que esto sea compatible.

over 4 years ago · Santiago Trujillo Report

0

Según los enlaces publicados por JonathonW , la respuesta básicamente se reduce a: "Hay una gran lista de palabras japonesas y Chrome verifica si hizo doble clic en una palabra".

Específicamente, v8 usa ICU para hacer un montón de cosas de procesamiento de texto relacionadas con Unicode, incluida la división del texto en palabras . El código de detección de límites de ICU incluye un "Iterador de ruptura basado en diccionario" para idiomas que no tienen espacios, incluidos japonés, chino, tailandés, etc.

Y para su ejemplo específico de "薄暗い", puede encontrar esa palabra en el diccionario chino-japonés combinado enviado por ICU (línea 255431). Actualmente hay 315.671 palabras en chino/japonés en total en la lista. Presumiblemente, si encuentra una palabra que Chrome no divide correctamente, puede enviar un parche a ICU para agregar esa palabra.

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!