{
  "name": "TXT Metrics Unicode counting corpus",
  "version": 1,
  "updated": "2026-08-22",
  "license": "CC0-1.0",
  "notes": "Graphemes are user-perceived characters segmented with Intl.Segmenter. Word boundaries use Intl.Segmenter with the listed locale and isWordLike.",
  "characterCases": [
    {
      "id": "ascii-letter",
      "text": "A",
      "expected": { "graphemes": 1, "codePoints": 1, "utf16Units": 1, "utf8Bytes": 1 }
    },
    {
      "id": "combining-acute-accent",
      "text": "é",
      "expected": { "graphemes": 1, "codePoints": 2, "utf16Units": 2, "utf8Bytes": 3 }
    },
    {
      "id": "emoji-with-skin-tone",
      "text": "👍🏽",
      "expected": { "graphemes": 1, "codePoints": 2, "utf16Units": 4, "utf8Bytes": 8 }
    },
    {
      "id": "family-emoji-with-joiners",
      "text": "👨‍👩‍👧‍👦",
      "expected": { "graphemes": 1, "codePoints": 7, "utf16Units": 11, "utf8Bytes": 25 }
    },
    {
      "id": "flag-regional-indicators",
      "text": "🇩🇪",
      "expected": { "graphemes": 1, "codePoints": 2, "utf16Units": 4, "utf8Bytes": 8 }
    },
    {
      "id": "devanagari-conjunct",
      "text": "क्ष",
      "expected": { "graphemes": 1, "codePoints": 3, "utf16Units": 3, "utf8Bytes": 9 }
    }
  ],
  "wordCases": [
    { "id": "english-spaces", "locale": "en", "text": "Hello world!", "expectedWords": 2 },
    { "id": "japanese-no-spaces", "locale": "ja", "text": "これはテストです。単語を数えます。", "expectedWords": 9 },
    { "id": "emoji-is-not-a-word", "locale": "en", "text": "👍🏽", "expectedWords": 0 }
  ]
}
