Wie kann man einen String umkehren, der komplizierte Emojis enthält?

Question 1

Eingang:

Hello world👩‍🦰👩‍👩‍👦‍👦

Gewünschte Ausgabe:

👩‍👩‍👦‍👦👩‍🦰dlrow olleH

Ich habe verschiedene Ansätze ausprobiert, aber keiner hat mir die richtige Antwort gegeben.

Dies schlug kläglich fehl:

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';

const reversed = text.split('').reverse().join('');

console.log(reversed);

Erweitern Sie das Snippet

Das funktioniert irgendwie, aber es zerfällt 👩‍👩‍👦‍👦in 4 verschiedene Emojis:

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';

const reversed = [...text].reverse().join('');

console.log(reversed);

Erweitern Sie das Snippet

Ich habe auch jede Antwort in dieser Frage ausprobiert , aber keine davon funktioniert.

Gibt es eine Möglichkeit, die gewünschte Ausgabe zu erhalten?

Question 2

Wenn Sie dazu in der Lage sind, verwenden Sie die _.split()von lodash bereitgestellte Funktion . Ab Version 4.0 ab, _.split()ist die Aufspaltung Unicode Emojis fähig.

Die Verwendung des Native .reverse().join('')zum Umkehren der 'Zeichen' sollte mit Emojis mit Joinern mit der Breite Null problemlos funktionieren

function reverse(txt) { return _.split(txt, '').reverse().join(''); }

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';
console.log(reverse(text));

<script src="https://cdnjs.cloudflare.com/ajax/libs/lodash.js/4.17.20/lodash.min.js" integrity="sha512-90vH1Z83AJY9DmlWa8WkjkV79yfS2n2Oxhsi2dZbIv0nC4E6m5AbH8Nh156kkM7JePmqD6tcZsfad1ueoaovww==" crossorigin="anonymous"></script>

Erweitern Sie das Snippet

Question 3

Ich nahm die Idee von TKoL, das \u200dZeichen zu verwenden, und versuchte damit, ein kleineres Skript zu erstellen.

Hinweis: Nicht alle Kompositionen verwenden einen Joiner mit einer Breite von Null, sodass er mit anderen Kompositionszeichen fehlerhaft ist.

Es verwendet die traditionelle forSchleife, da wir einige Iterationen überspringen, falls wir kombinierte Emoticons finden. Innerhalb der forSchleife gibt es eine whileSchleife, um zu überprüfen, ob ein folgendes \u200dZeichen vorhanden ist. Solange es eines gibt, fügen wir auch die nächsten 2 Zeichen hinzu und leiten die forSchleife mit 2 Iterationen weiter, damit kombinierte Emoticons nicht umgekehrt werden.

Um es einfach für jede Zeichenfolge zu verwenden, habe ich es als neue Prototypfunktion für das Zeichenfolgenobjekt erstellt.

String.prototype.reverse = function() {
  let textArray = [...this];
  let reverseString = "";

  for (let i = 0; i < textArray.length; i++) {
    let char = textArray[i];
    while (textArray[i + 1] === '\u200d') {
      char += textArray[i + 1] + textArray[i + 2];
      i = i + 2;
    }
    reverseString = char + reverseString;
  }
  return reverseString;
}

const text = "Hello world👩‍🦰👩‍👩‍👦‍👦";

console.log(text.reverse());

//Fun fact, you can chain them to double reverse :)
//console.log(text.reverse().reverse());

Erweitern Sie das Snippet

Question 4

Das Umkehren von Unicode-Text ist aus vielen Gründen schwierig.

Erstens werden Zeichenfolgen je nach Programmiersprache auf unterschiedliche Weise dargestellt, entweder als Liste von Bytes, als Liste von UTF-16-Codeeinheiten (16 Bit breit, in der API häufig als "Zeichen" bezeichnet) oder als ucs4-Codepunkte (4 Bytes breit).

Zweitens spiegeln verschiedene APIs diese innere Repräsentation in unterschiedlichem Maße wider. Einige arbeiten an der Abstraktion von Bytes, andere an UTF-16-Zeichen, andere an Codepunkten. Wenn die Darstellung Bytes oder UTF-16-Zeichen verwendet, gibt es normalerweise Teile der API, die Ihnen Zugriff auf die Elemente dieser Darstellung gewähren, sowie Teile, die die erforderliche Logik ausführen, um von Bytes (über UTF-8) oder von zu erhalten UTF-16-Zeichen zu den tatsächlichen Codepunkten.

Oft wurden die Teile der API, die diese Logik ausführen und Ihnen so Zugriff auf die Codepunkte gewähren, später hinzugefügt, da zuerst 7-Bit-ASCII vorhanden waren, dann etwas später alle dachten, 8-Bit wären ausreichend, wobei verschiedene Codeseiten verwendet wurden, und sogar später reichten 16 Bit für Unicode. Der Begriff der Codepunkte als Ganzzahlen ohne feste Obergrenze wurde historisch als vierte gemeinsame Zeichenlänge für die logische Codierung von Text hinzugefügt.

Die Verwendung einer API, mit der Sie auf die tatsächlichen Codepunkte zugreifen können, scheint das Richtige zu sein. Aber...

Drittens gibt es viele Modifikatorcodepunkte, die den nächsten Codepunkt oder die folgenden Codepunkte beeinflussen. Zum Beispiel gibt es einen diakritischen Modifikator, der aus einem folgenden a ein ä, e nach ë usw. macht. Drehen Sie die Codepunkte um und aë wird zu eä, bestehend aus verschiedenen Buchstaben. Es gibt eine direkte Darstellung von zB ä als eigenen Codepunkt, aber die Verwendung des Modifikators ist genauso gültig.

Viertens ist alles in ständigem Fluss. Es gibt auch viele Modifikatoren unter den Emoji, wie im Beispiel verwendet, und jedes Jahr werden weitere hinzugefügt. Wenn Sie über eine API auf die Informationen zugreifen können, ob ein Codepunkt ein Modifikator ist, bestimmt die Version der API, ob sie bereits einen bestimmten neuen Modifikator kennt.

Unicode bietet jedoch einen hackigen Trick, wenn es nur um das visuelle Erscheinungsbild geht:

Es gibt Modifikatoren für die Schreibrichtung. Im Beispiel wird die Schreibrichtung von links nach rechts verwendet. Fügen Sie am Anfang des Textes einfach einen Modifikator für die Schreibrichtung von rechts nach links hinzu. Abhängig von der Version der API / des Browsers sieht dieser korrekt umgekehrt aus 😎

'\ u202e' heißt Override von rechts nach links, es ist die stärkste Version der Markierung von rechts nach links.

Siehe diese Erklärung von w3.org

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦'
console.log('\u202e' + text)

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦'
let original = document.getElementById('original')
original.appendChild(document.createTextNode(text))
let result = document.getElementById('result')
result.appendChild(document.createTextNode('\u202e' + text))

body {
  font-family: sans-serif
}

<p id="original"></p>
<p id="result"></p>

Erweitern Sie das Snippet

Question 5

Ich kenne! Ich werde RegExp verwenden. Was könnte schiefgehen? (Antwort links als Übung für den Leser.)

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';

const reversed = text.match(/.(\u200d.)*/gu).reverse().join('');

console.log(reversed);

Erweitern Sie das Snippet

Question 6

Eine alternative Lösung wäre die Verwendung einer runeskleinen, aber effektiven Bibliothek:

https://github.com/dotcypress/runes

const runes = require('runes')

// String.substring
'👨‍👨‍👧‍👧a'.substring(1) => '�‍👨‍👧‍👧a'

// Runes
runes.substr('👨‍👨‍👧‍👧a', 1) => 'a'

runes('12👩‍👩‍👦‍👦3🍕✓').reverse().join(); 
// results in: "✓🍕3👩‍👩‍👦‍👦21"

Question 7

Sie haben nicht nur Probleme mit Emoji, sondern auch mit anderen kombinierenden Charakteren. Diese Dinge, die sich wie einzelne Buchstaben anfühlen, aber tatsächlich ein oder mehrere Unicode-Zeichen sind, werden als "erweiterte Graphemcluster" bezeichnet.

Das Aufteilen einer Zeichenfolge in diese Cluster ist schwierig (siehe beispielsweise diese Unicode-Dokumente ). Ich würde mich nicht darauf verlassen, es selbst zu implementieren, sondern eine vorhandene Bibliothek verwenden. Google hat mich auf die Graphem-Splitter- Bibliothek hingewiesen . Die Dokumente für diese Bibliothek enthalten einige nette Beispiele , die die meisten Implementierungen auslösen werden:

Damit sollten Sie schreiben können:

var splitter = new GraphemeSplitter();
var graphemes = splitter.splitGraphemes(string);
var reversed = graphemes.reverse().join('');

ASIDE: Für Besucher aus der Zukunft oder diejenigen, die bereit sind, auf dem neuesten Stand zu leben:

Es wird vorgeschlagen , dem Javascript-Standard einen Graphemsegmentierer hinzuzufügen. (Es bietet auch andere Segmentierungsoptionen). Es befindet sich derzeit in Phase 3 und wird derzeit in JSC und V8 implementiert (siehe https://github.com/tc39/proposal-intl-segmenter/issues/114 ).

Mit diesem würde der Code wie folgt aussehen:

var segmenter = new Intl.Segmenter("en", {granularity: "grapheme"})
var segment_iterator = segmenter.segment(string)
var graphemes = []
for (let {segment} of segment_iterator) {
    graphemes.push(segment)
}
var reversed = graphemes.reverse().join('');

Sie können dies wahrscheinlich ordentlicher machen, wenn Sie moderneres Javascript kennen als ich ...

Hier gibt es eine Implementierung - aber ich weiß nicht, was es erfordert.

Hinweis: Dies weist auf ein unterhaltsames Problem hin, das andere Antworten noch nicht angesprochen haben. Die Segmentierung kann vom verwendeten Gebietsschema abhängen - nicht nur von den Zeichen in der Zeichenfolge.

Question 8

Ich habe mich nur zum Spaß dafür entschieden, war eine gute Herausforderung. Nicht sicher, ob es in allen Fällen korrekt ist. Verwenden Sie es daher auf eigenes Risiko. Hier ist es jedoch:

function run() {
    const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';
    const newText = reverseText(text);
    console.log(newText);
}

function reverseText(text) {
    // first, create an array of characters
    let textArray = [...text];
    let lastCharConnector = false;
    textArray = textArray.reduce((acc, char, index) => {
        if (char.charCodeAt(0) === 8205) {
            const lastChar = acc[acc.length-1];
            if (Array.isArray(lastChar)) {
                lastChar.push(char);
            } else {
                acc[acc.length-1] = [lastChar, char];
            }
            lastCharConnector = true;
        } else if (lastCharConnector) {
            acc[acc.length-1].push(char);
            lastCharConnector = false;
        } else {
            acc.push(char);
            lastCharConnector = false;
        }
        return acc;
    }, []);
    
    console.log('initial text array', textArray);
    textArray = textArray.reverse();
    console.log('reversed text array', textArray);

    textArray = textArray.map((item) => {
        if (Array.isArray(item)) {
            return item.join('');
        } else {
            return item;
        }
    });

    return textArray.join('');
}

run();

Erweitern Sie das Snippet

Question 9

Sie können verwenden:

yourstring.split('').reverse().join('')

Es sollte Ihre Zeichenfolge in eine Liste verwandeln, sie umkehren und dann wieder zu einer Zeichenfolge machen.

Question 10

const text = 'Hallo Welt👩‍🦰👩‍👩‍👦‍👦';

const reverse = text.split (''). reverse (). join ('');

console.log (umgekehrt);

Answer 1

193

Eingang:

Hello world👩‍🦰👩‍👩‍👦‍👦

Gewünschte Ausgabe:

👩‍👩‍👦‍👦👩‍🦰dlrow olleH

Ich habe verschiedene Ansätze ausprobiert, aber keiner hat mir die richtige Antwort gegeben.

Dies schlug kläglich fehl:

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';

const reversed = text.split('').reverse().join('');

console.log(reversed);

Erweitern Sie das Snippet

Das funktioniert irgendwie, aber es zerfällt 👩‍👩‍👦‍👦in 4 verschiedene Emojis:

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';

const reversed = [...text].reverse().join('');

console.log(reversed);

Erweitern Sie das Snippet

Ich habe auch jede Antwort in dieser Frage ausprobiert , aber keine davon funktioniert.

Gibt es eine Möglichkeit, die gewünschte Ausgabe zu erhalten?

javascript string emoji Hao Wu
quelle

26

Ich kann das Problem mit der zweiten Lösung nicht sehen. Was vermisse ich?

Pedro Lima

13

Diese Emojis sind also irgendwie kombinatorische Emojis, das ist ziemlich interessant. Zuerst haben Sie das Frauengesichts-Emoji, das selbst durch zwei Ihrer �Charaktere dargestellt wird, und dann gibt es ein zusätzliches Verbindungszeichen, den Charcode 8205, und dann gibt es zwei weitere , die "rotes Haar" darstellen, und diese 5 Zeichen zusammen meine "Frauengesicht mit roten Haaren"

TKoL

11

Eine Saite mit kombinierten Emojis richtig umzukehren, wäre ziemlich kompliziert, denke ich. Sie müssten überprüfen, ob auf jedes Emoji der Zeichencode 8205 folgt, und wenn ja, müssten Sie es mit dem vorherigen Emoji kombinieren, anstatt es als eigenen Charakter zu behandeln. Ziemlich kompliziert ...

TKoL

18

Javascript verwirrt mich. Es ist die seltsamste Mischung aus Sprachkonzepten auf niedriger und hoher Ebene. Es ist insofern eben, als es den Speicher vollständig abstrahiert (keine Zeiger, manuelle Speicherverwaltung), aber so niedrig, dass Zeichenfolgen eher als dumme Codepunkte als als erweiterte Graphemcluster behandelt werden. Es ist wirklich verwirrend und lässt mich nie wissen, was mich bei der Arbeit mit diesem Ding erwartet.

Alexander - Monica

12

@ Alexander-ReinstateMonica Gibt es eine Sprache, die standardmäßig nach Graphem aufteilt? JS stellt nur in UTF-16 codierte Standardzeichenfolgen bereit.

Lichter0123

Answer 2

26

Ich kann das Problem mit der zweiten Lösung nicht sehen. Was vermisse ich?

Pedro Lima

Answer 3

13

Diese Emojis sind also irgendwie kombinatorische Emojis, das ist ziemlich interessant. Zuerst haben Sie das Frauengesichts-Emoji, das selbst durch zwei Ihrer �Charaktere dargestellt wird, und dann gibt es ein zusätzliches Verbindungszeichen, den Charcode 8205, und dann gibt es zwei weitere , die "rotes Haar" darstellen, und diese 5 Zeichen zusammen meine "Frauengesicht mit roten Haaren"

TKoL

Answer 4

11

Eine Saite mit kombinierten Emojis richtig umzukehren, wäre ziemlich kompliziert, denke ich. Sie müssten überprüfen, ob auf jedes Emoji der Zeichencode 8205 folgt, und wenn ja, müssten Sie es mit dem vorherigen Emoji kombinieren, anstatt es als eigenen Charakter zu behandeln. Ziemlich kompliziert ...

TKoL

Answer 5

18

Javascript verwirrt mich. Es ist die seltsamste Mischung aus Sprachkonzepten auf niedriger und hoher Ebene. Es ist insofern eben, als es den Speicher vollständig abstrahiert (keine Zeiger, manuelle Speicherverwaltung), aber so niedrig, dass Zeichenfolgen eher als dumme Codepunkte als als erweiterte Graphemcluster behandelt werden. Es ist wirklich verwirrend und lässt mich nie wissen, was mich bei der Arbeit mit diesem Ding erwartet.

Alexander - Monica

Answer 6

12

@ Alexander-ReinstateMonica Gibt es eine Sprache, die standardmäßig nach Graphem aufteilt? JS stellt nur in UTF-16 codierte Standardzeichenfolgen bereit.

Lichter0123

Answer 7

91

Wenn Sie dazu in der Lage sind, verwenden Sie die _.split()von lodash bereitgestellte Funktion . Ab Version 4.0 ab, _.split()ist die Aufspaltung Unicode Emojis fähig.

Die Verwendung des Native .reverse().join('')zum Umkehren der 'Zeichen' sollte mit Emojis mit Joinern mit der Breite Null problemlos funktionieren

function reverse(txt) { return _.split(txt, '').reverse().join(''); }

const text = 'Hello world👩‍🦰👩‍👩‍👦‍👦';
console.log(reverse(text));

<script src="https://cdnjs.cloudflare.com/ajax/libs/lodash.js/4.17.20/lodash.min.js" integrity="sha512-90vH1Z83AJY9DmlWa8WkjkV79yfS2n2Oxhsi2dZbIv0nC4E6m5AbH8Nh156kkM7JePmqD6tcZsfad1ueoaovww==" crossorigin="anonymous"></script>

Erweitern Sie das Snippet

0stone0
quelle

3

Die Änderungsprotokolle, auf die Sie verweisen, erwähnen "v4.9.0 - Sichergestellt, dass _.split mit Emojis funktioniert". Ich denke, 4.0 ist möglicherweise zu früh. Die Kommentare im Code, der zum Teilen der Zeichenfolgen verwendet wird ( github.com/lodash/lodash/blob/4.17.15/lodash.js#L261 ), beziehen sich auf mathiasbynens.be/notes/javascript-unicode aus dem Jahr 2013. Es Es sieht so aus, als ob es sich seitdem weiterentwickelt hat, aber es verwendet eine ziemlich schwer zu entschlüsselnde Menge von Unicode-Regexen. Ich kann auch keine Tests in ihrer Codebasis für die Unicode-Aufteilung sehen. All dies würde mich vorsichtig machen, es in der Produktion zu verwenden.

Michael Anderson

5

Es dauerte nur ein wenig, bis reverse("뎌쉐") festgestellt wurde , dass dies fehlschlägt (2 koreanische Grapheme), was "ᅰ셔 ᄃ" (3 Grapheme) ergibt.

Michael Anderson

2

Es scheint, dass es keine einfache native Lösung für dieses Problem gibt. Ich würde es nicht vorziehen, eine Bibliothek nur zu importieren, um dies zu lösen, aber es ist in der Tat die zuverlässigste / konsistenteste Methode, dies zu diesem Zeitpunkt zu tun.

Hao Wu

1

Ein großes Lob dafür, dass dies richtig funktioniert 😎 Das Umkehren der Schreibrichtung in Firefox unter Windows 10 ist immer noch ein bisschen unangenehm (die Kinder landen hinten), also schlägt lodash Windows 10, was wahrscheinlich ein etwas geringeres Budget bedeutet 😅

yeoman

Answer 8

3

Die Änderungsprotokolle, auf die Sie verweisen, erwähnen "v4.9.0 - Sichergestellt, dass _.split mit Emojis funktioniert". Ich denke, 4.0 ist möglicherweise zu früh. Die Kommentare im Code, der zum Teilen der Zeichenfolgen verwendet wird ( github.com/lodash/lodash/blob/4.17.15/lodash.js#L261 ), beziehen sich auf mathiasbynens.be/notes/javascript-unicode aus dem Jahr 2013. Es Es sieht so aus, als ob es sich seitdem weiterentwickelt hat, aber es verwendet eine ziemlich schwer zu entschlüsselnde Menge von Unicode-Regexen. Ich kann auch keine Tests in ihrer Codebasis für die Unicode-Aufteilung sehen. All dies würde mich vorsichtig machen, es in der Produktion zu verwenden.

Michael Anderson

Answer 9

5

Es dauerte nur ein wenig, bis reverse("뎌쉐") festgestellt wurde , dass dies fehlschlägt (2 koreanische Grapheme), was "ᅰ셔 ᄃ" (3 Grapheme) ergibt.

Michael Anderson

Answer 10

2

Es scheint, dass es keine einfache native Lösung für dieses Problem gibt. Ich würde es nicht vorziehen, eine Bibliothek nur zu importieren, um dies zu lösen, aber es ist in der Tat die zuverlässigste / konsistenteste Methode, dies zu diesem Zeitpunkt zu tun.

Hao Wu

Answer 11

1

Ein großes Lob dafür, dass dies richtig funktioniert 😎 Das Umkehren der Schreibrichtung in Firefox unter Windows 10 ist immer noch ein bisschen unangenehm (die Kinder landen hinten), also schlägt lodash Windows 10, was wahrscheinlich ein etwas geringeres Budget bedeutet 😅

yeoman

Answer 12

52

Ich nahm die Idee von TKoL, das \u200dZeichen zu verwenden, und versuchte damit, ein kleineres Skript zu erstellen.

Hinweis: Nicht alle Kompositionen verwenden einen Joiner mit einer Breite von Null, sodass er mit anderen Kompositionszeichen fehlerhaft ist.

Es verwendet die traditionelle forSchleife, da wir einige Iterationen überspringen, falls wir kombinierte Emoticons finden. Innerhalb der forSchleife gibt es eine whileSchleife, um zu überprüfen, ob ein folgendes \u200dZeichen vorhanden ist. Solange es eines gibt, fügen wir auch die nächsten 2 Zeichen hinzu und leiten die forSchleife mit 2 Iterationen weiter, damit kombinierte Emoticons nicht umgekehrt werden.

Um es einfach für jede Zeichenfolge zu verwenden, habe ich es als neue Prototypfunktion für das Zeichenfolgenobjekt erstellt.

String.prototype.reverse = function() {
  let textArray = [...this];
  let reverseString = "";

  for (let i = 0; i < textArray.length; i++) {
    let char = textArray[i];
    while (textArray[i + 1] === '\u200d') {
      char += textArray[i + 1] + textArray[i + 2];
      i = i + 2;
    }
    reverseString = char + reverseString;
  }
  return reverseString;
}

const text = "Hello world👩‍🦰👩‍👩‍👦‍👦";

console.log(text.reverse());

//Fun fact, you can chain them to double reverse :)
//console.log(text.reverse().reverse());

Erweitern Sie das Snippet

Mark Baijens
quelle

5

Ich dachte, wenn Sie den Text in Browsern ziehen und auswählen, 👩‍👩‍👦‍👦kann er nur als Ganzes ausgewählt werden. Woher wissen Browser, dass es sich um ein Zeichen handelt? Gibt es eine eingebaute Möglichkeit, dies zu tun?

Hao Wu

10

@HaoWu Dies ist die sogenannte "Unicode-Segmentierung" in "Grapheme-Clustern". Ihr Browser (der möglicherweise den von Ihrem Betriebssystem bereitgestellten verwendet) wird die Auswahl pro Graphemcluster rendern und zulassen. : Sie können die spec hier lesen unicode.org/reports/tr29/#Grapheme_Cluster_Boundaries

lights0123

7

@HaoWu: "Woher wissen Browser, dass es sich um ein Zeichen handelt?" - Es ist nicht "ein Charakter". Es sind mehrere Zeichen, die sich zu einem einzigen Graphemcluster verbinden , der als einzelne Glyphe gerendert wird .

Jörg W Mittag

6

Gleich wie hier ; Nicht alle Kompositionen verwenden einen Joiner mit der Breite Null.

Holger

6

Dies kehrt nichts anderes als mit ZWJ zusammengesetzte Zeichen korrekt um. Bitte verwenden Sie nicht nur hier, sondern in der Regel externe Bibliotheken, die von Personen geschrieben wurden, die wissen, was sie tun, anstatt maßgeschneiderte Lösungen zu hacken, die zufällig für einen Testfall funktionieren. Die Runen- und Lodash- Bibliotheken wurden in anderen Antworten empfohlen (ich kann auch nicht dafür bürgen).

Benrg

Answer 13

5

Ich dachte, wenn Sie den Text in Browsern ziehen und auswählen, 👩‍👩‍👦‍👦kann er nur als Ganzes ausgewählt werden. Woher wissen Browser, dass es sich um ein Zeichen handelt? Gibt es eine eingebaute Möglichkeit, dies zu tun?

Hao Wu

Answer 14

10

@HaoWu Dies ist die sogenannte "Unicode-Segmentierung" in "Grapheme-Clustern". Ihr Browser (der möglicherweise den von Ihrem Betriebssystem bereitgestellten verwendet) wird die Auswahl pro Graphemcluster rendern und zulassen. : Sie können die spec hier lesen unicode.org/reports/tr29/#Grapheme_Cluster_Boundaries

lights0123

Answer 15

7

@HaoWu: "Woher wissen Browser, dass es sich um ein Zeichen handelt?" - Es ist nicht "ein Charakter". Es sind mehrere Zeichen, die sich zu einem einzigen Graphemcluster verbinden , der als einzelne Glyphe gerendert wird .

Jörg W Mittag

Answer 16

6

Gleich wie hier ; Nicht alle Kompositionen verwenden einen Joiner mit der Breite Null.

Holger

Answer 17

6

Dies kehrt nichts anderes als mit ZWJ zusammengesetzte Zeichen korrekt um. Bitte verwenden Sie nicht nur hier, sondern in der Regel externe Bibliotheken, die von Personen geschrieben wurden, die wissen, was sie tun, anstatt maßgeschneiderte Lösungen zu hacken, die zufällig für einen Testfall funktionieren. Die Runen- und Lodash- Bibliotheken wurden in anderen Antworten empfohlen (ich kann auch nicht dafür bürgen).

Benrg

Answer 18