我在寻找解决方案时遇到了麻烦,但是到目前为止,我已经尝试了一些方法:

尝试的解决方案1-播放长度和...运算符
我了解到,表情符号占据一个以上的字节,有些甚至占据4个字节,甚至更多……我们可以通过字符串的length属性进行测量:

console.log("🍎".length); // 2
console.log("🛡️".length); // 3
console.log("⛹🏿‍♂️".length); // 6
然后,我发现...运算符考虑了这一点,并正确分离了数组中的表情符号-然后,我可以看到结果数组的length属性,并检测它们是否不同。
str = "⛹🏿‍♂️";
if (str.length !== [...str].length) {
  // is emoji?
} else {
  // is not emoji
}
但是,这不会检查其他多字节字符,例如长度为2的𝕡。再加上一些表情符号仍然很奇怪。

尝试的解决方案2-正则表达式,正则表达式
当然,正则表达式是一个值得研究的问题,但我尚未找到可行的解决方案。
This answer的正则表达式\u00a9|\u00ae|[\u2000-\u3300]|\ud83c[\ud000-\udfff]|\ud83d[\ud000-\udfff]|\ud83e[\ud000-\udfff]可以很好地检测字符串是否包含表情符号,但是将其应用于我的情况会产生很多问题。这是我的测试:
A部分-不包含字符串正则表达式的开头/结尾(^$)
  • 2A.1 str.match(regex)非常不一致,它分解了一些表情符号和其他一些无法使用的表情符号。我没有找到一种方法来找出它是否甚至包含非表情符号字符或是否包含多个表情符号:

  • let regex = /(\u00a9|\u00ae|[\u2000-\u3300]|\ud83c[\ud000-\udfff]|\ud83d[\ud000-\udfff]|\ud83e[\ud000-\udfff])/;
    
    console.log("5️⃣".match(regex)); // [ '⃣', '⃣', index: 2, input: '5️⃣' ]
    console.log("💡".match(regex)); // [ '💡', '💡', index: 0, input: '💡' ]
    console.log("🌡️🌡️".match(regex)); // [ '🌡', '🌡', index: 0, input: '🌡️🌡️' ]
    console.log("a⛅".match(regex)); // [ '⛅', '⛅', index: 1, input: 'a⛅' ]
    
  • 2A.2只要字符串中包含表情符号, regex.test(str)就会返回true,这不是我想要的行为:

  • let regex = /(\u00a9|\u00ae|[\u2000-\u3300]|\ud83c[\ud000-\udfff]|\ud83d[\ud000-\udfff]|\ud83e[\ud000-\udfff])/;
    
    console.log(regex.test("5️⃣")); // true - correct
    console.log(regex.test("a")); // false - correct
    console.log(regex.test("🌡️🌡️")); // true - should be false
    console.log(regex.test("hello ⛅!")); // true - should be false
    
    B部分-以字符串正则表达式的开头/结尾(^$)
  • 2B.1 str.match(regex)由于某些原因在某些表情符号上返回null。我不知道为什么,但我假设它与str.match(regex)为什么会分解A部分中的这些表情符号有一定关系:

  • let regex = /^(\u00a9|\u00ae|[\u2000-\u3300]|\ud83c[\ud000-\udfff]|\ud83d[\ud000-\udfff]|\ud83e[\ud000-\udfff])$/;
    
    console.log("5️⃣".match(regex)); // null
    console.log("💡".match(regex)); // [ '💡', '💡', index: 0, input: '💡' ]
    console.log("🌡️".match(regex)); // null
    console.log("⛅".match(regex)); // [ '⛅', '⛅', index: 1, input: 'a⛅' ]
    console.log("🍌🍀".match(regex)); // null
    
  • 2B.2 regex.test(str)将在与将false上的null返回的相同表情符号上返回str.match(regex):

  • let regex = /^(\u00a9|\u00ae|[\u2000-\u3300]|\ud83c[\ud000-\udfff]|\ud83d[\ud000-\udfff]|\ud83e[\ud000-\udfff])$/;
    
    console.log(regex.test("5️⃣")); // false - should be true
    console.log(regex.test("💡")); // true - correct
    console.log(regex.test("🌡️")); // false - should be true
    console.log(regex.test("⛅")); // true - correct
    console.log(regex.test("🍌🍀")); // false - correct
    
    C部分-其他正则表达式
  • 我找到了this one,但它给出了相似的不一致之处,尽管/(?:[\u2700-\u27bf]|(?:\ud83c[\udde6-\uddff]){2}|[\ud800-\udbff][\udc00-\udfff]|[\u0023-\u0039]\ufe0f?\u20e3|\u3299|\u3297|\u303d|\u3030|\u24c2|\ud83c[\udd70-\udd71]|\ud83c[\udd7e-\udd7f]|\ud83c\udd8e|\ud83c[\udd91-\udd9a]|\ud83c[\udde6-\uddff]|[\ud83c[\ude01\uddff]|\ud83c[\ude01-\ude02]|\ud83c\ude1a|\ud83c\ude2f|[\ud83c[\ude32\ude02]|\ud83c\ude1a|\ud83c\ude2f|\ud83c[\ude32-\ude3a]|[\ud83c[\ude50\ude3a]|\ud83c[\ude50-\ude51]|\u203c|\u2049|[\u25aa-\u25ab]|\u25b6|\u25c0|[\u25fb-\u25fe]|\u00a9|\u00ae|\u2122|\u2139|\ud83c\udc04|[\u2600-\u26FF]|\u2b05|\u2b06|\u2b07|\u2b1b|\u2b1c|\u2b50|\u2b55|\u231a|\u231b|\u2328|\u23cf|[\u23e9-\u23f3]|[\u23f8-\u23fa]|\ud83c\udccf|\u2934|\u2935|[\u2190-\u21ff])/g不相同:

  • let regex = /^(?:[\u2700-\u27bf]|(?:\ud83c[\udde6-\uddff]){2}|[\ud800-\udbff][\udc00-\udfff]|[\u0023-\u0039]\ufe0f?\u20e3|\u3299|\u3297|\u303d|\u3030|\u24c2|\ud83c[\udd70-\udd71]|\ud83c[\udd7e-\udd7f]|\ud83c\udd8e|\ud83c[\udd91-\udd9a]|\ud83c[\udde6-\uddff]|[\ud83c[\ude01\uddff]|\ud83c[\ude01-\ude02]|\ud83c\ude1a|\ud83c\ude2f|[\ud83c[\ude32\ude02]|\ud83c\ude1a|\ud83c\ude2f|\ud83c[\ude32-\ude3a]|[\ud83c[\ude50\ude3a]|\ud83c[\ude50-\ude51]|\u203c|\u2049|[\u25aa-\u25ab]|\u25b6|\u25c0|[\u25fb-\u25fe]|\u00a9|\u00ae|\u2122|\u2139|\ud83c\udc04|[\u2600-\u26FF]|\u2b05|\u2b06|\u2b07|\u2b1b|\u2b1c|\u2b50|\u2b55|\u231a|\u231b|\u2328|\u23cf|[\u23e9-\u23f3]|[\u23f8-\u23fa]|\ud83c\udccf|\u2934|\u2935|[\u2190-\u21ff])$/g
    
    console.log(regex.test("5️⃣")); // true - correct
    console.log(regex.test("💡")); // false - should be true
    console.log(regex.test("🌡️")); // false - should be true
    console.log(regex.test("⛅")); // true - correct
    console.log(regex.test("🍌🍀")); // false - correct
    
  • 这也令人难以置信(基于第一次测试的第二次测试更改?)

  • let regex = /^(?:[\u2700-\u27bf]|(?:\ud83c[\udde6-\uddff]){2}|[\ud800-\udbff][\udc00-\udfff]|[\u0023-\u0039]\ufe0f?\u20e3|\u3299|\u3297|\u303d|\u3030|\u24c2|\ud83c[\udd70-\udd71]|\ud83c[\udd7e-\udd7f]|\ud83c\udd8e|\ud83c[\udd91-\udd9a]|\ud83c[\udde6-\uddff]|[\ud83c[\ude01\uddff]|\ud83c[\ude01-\ude02]|\ud83c\ude1a|\ud83c\ude2f|[\ud83c[\ude32\ude02]|\ud83c\ude1a|\ud83c\ude2f|\ud83c[\ude32-\ude3a]|[\ud83c[\ude50\ude3a]|\ud83c[\ude50-\ude51]|\u203c|\u2049|[\u25aa-\u25ab]|\u25b6|\u25c0|[\u25fb-\u25fe]|\u00a9|\u00ae|\u2122|\u2139|\ud83c\udc04|[\u2600-\u26FF]|\u2b05|\u2b06|\u2b07|\u2b1b|\u2b1c|\u2b50|\u2b55|\u231a|\u231b|\u2328|\u23cf|[\u23e9-\u23f3]|[\u23f8-\u23fa]|\ud83c\udccf|\u2934|\u2935|[\u2190-\u21ff])$/g
    
    console.log(regex.test("⛹🏿‍♂️")); // false
    console.log(regex.test("⛅")); // true
    
    let regex = /^(?:[\u2700-\u27bf]|(?:\ud83c[\udde6-\uddff]){2}|[\ud800-\udbff][\udc00-\udfff]|[\u0023-\u0039]\ufe0f?\u20e3|\u3299|\u3297|\u303d|\u3030|\u24c2|\ud83c[\udd70-\udd71]|\ud83c[\udd7e-\udd7f]|\ud83c\udd8e|\ud83c[\udd91-\udd9a]|\ud83c[\udde6-\uddff]|[\ud83c[\ude01\uddff]|\ud83c[\ude01-\ude02]|\ud83c\ude1a|\ud83c\ude2f|[\ud83c[\ude32\ude02]|\ud83c\ude1a|\ud83c\ude2f|\ud83c[\ude32-\ude3a]|[\ud83c[\ude50\ude3a]|\ud83c[\ude50-\ude51]|\u203c|\u2049|[\u25aa-\u25ab]|\u25b6|\u25c0|[\u25fb-\u25fe]|\u00a9|\u00ae|\u2122|\u2139|\ud83c\udc04|[\u2600-\u26FF]|\u2b05|\u2b06|\u2b07|\u2b1b|\u2b1c|\u2b50|\u2b55|\u231a|\u231b|\u2328|\u23cf|[\u23e9-\u23f3]|[\u23f8-\u23fa]|\ud83c\udccf|\u2934|\u2935|[\u2190-\u21ff])$/g;
    
    console.log(regex.test("⛹")); // true
    console.log(regex.test("⛅")); // false
    

    有没有办法解决所有这些表情符号/ unicode / regex困惑?库/ api是唯一的方法吗?他们是如何做到的呢?

    最佳答案

    使用此库:https://github.com/foliojs/grapheme-breaker尝试以下操作:

    var str = "⛹🏿‍♂️";
    var Grapheme = require('grapheme-splitter');
    var splitter = new Grapheme();
    console.log(splitter.splitGraphemes(str).length);
    

    长度应返回1。

    07-24 14:46