Tokenization Disparities as Infrastructure Bias: How Subword Systems Create Inequities in LLM Access and Efficiency
Tokenization disparities represent a critical barrier to equitable artificial intelligence access across linguistically diverse populations. This study presents a comprehensive cross-linguistic evaluation of tokenization efficiency across 200+ languages to quantify computational inequities in large language models. Using a standardized experimental framework, we implemented systematic preprocessing and normalization protocols, followed by uniform tokenization via tiktoken across all language samples. Our methodology incorporated comprehensive tokenization statistics extraction through established evaluation metrics, including Tokens Per Sentence (TPS) measurements and Relative Tokenization Cost (RTC) calculations benchmarked against English baselines. Cross-linguistic efficiency analysis reveals significant systematic disparities. Latin-script languages consistently demonstrate superior tokenization efficiency compared to non-Latin scripts, with variations directly attributable to morphological complexity, orthographic density, and vocabulary structural properties. Aggregate efficiency comparison through RTC metrics demonstrates token inflation ratios reaching 3-5x for morphologically rich and non-Latin script languages, resulting in substantially increased computational demands and reduced effective context utilization. These findings underscore critical inequities in current AI systems, where speakers of underrepresented languages face disproportionate computational barriers. Current research directions emphasize developing language-aware tokenization strategies and adaptive vocabulary construction methods to address these disparities. Future investigations should prioritize multilingual tokenizer architectures incorporating linguistic typology considerations and efficiency-preserving subword segmentation algorithms to ensure more inclusive and computationally equitable AI system deployment across diverse linguistic communities globally.
Paper
References (26)
Scroll for more · 14 remaining