वर्तमान पीढ़ी
लगभग 200,000 मर्ज, और हर मौजूदा OpenAI मॉडल के पीछे यही एनकोडिंग है — GPT-5 परिवार, GPT-4.1 और GPT-4o सहित। इसकी बड़ी शब्दावली गैर-अंग्रेज़ी टेक्स्ट को अपने पूर्ववर्ती से कहीं बेहतर संपीड़ित करती है: हिन्दी, चीनी और जापानी में cl100k_base के मुक़ाबले लगभग आधे टोकन लगते हैं। रजिस्ट्री की सबसे नई प्रविष्टि o200k_harmony इन्हीं रैंक्स को दोहराती है और केवल कंट्रोल टोकन जोड़ती है, इसलिए सादे टेक्स्ट की गिनती एक समान रहती है।