मुख्य सामग्री पर जाएँ

बुनियादी बातें

टेम्परेचर और Top-p क्या नियंत्रित करते हैं?

टेम्परेचर और Top-p तय करते हैं मॉडल अपना अगला टोकन कैसे चुनता है, यह नहीं कि वह क्या जानता है। हर सेटिंग असल में क्या बदलती है, कम मान अपने आप बेहतर क्यों नहीं है, और टेम्परेचर शून्य भी पूरी तरह दोहराने-योग्य क्यों नहीं है।

सभी लेख · आख़िरी समीक्षा:

ये एक चुनाव को नया आकार देती हैं, मॉडल के ज्ञान को नहीं

टेम्परेचर या Top-p लागू होने तक, मॉडल मौजूदा संदर्भ के आधार पर हर संभावित अगले टोकन के लिए पहले ही एक संभावना निकाल चुका होता है। इनमें से कोई भी सेटिंग यह नहीं बदलती कि वे संभावनाएँ कहाँ से आईं — मॉडल के सीखे हुए पैरामीटर और उसे दिया गया संदर्भ। ये सिर्फ बदलती हैं कि मॉडल द्वारा पहले से बनाए गए वितरण में से एक टोकन कैसे चुना जाता है।

टेम्परेचर तय करता है वह वितरण कितना तीखा या सपाट है

कम टेम्परेचर सबसे ज़्यादा संभावना वाले टोकनों को चुने जाने की और भी ज़्यादा संभावना देता है, इसलिए आउटपुट अकेली सबसे संभावित निरंतरता की ओर झुकता है और अलग-अलग रन में ज़्यादा दोहराता है। ज़्यादा टेम्परेचर वितरण को सपाट कर देता है, कम संभावना वाले टोकनों को चुने जाने का ज़्यादा असली मौका देता है, जिससे ज़्यादा विविध शब्द-रचना मिलती है — और किसी असंभावित, कभी-कभी अजीब टोकन के फिसल जाने की ज़्यादा जगह।

टेम्परेचर वह जानकारी नहीं जोड़ता जो मॉडल के पास नहीं है। यह ग़लत अंदाज़े को सही में नहीं बदल सकता; यह सिर्फ बदलता है कि मॉडल जिस अंदाज़े को पहले से पसंद करता है उस पर कितनी मज़बूती से टिकता है।

Top-p सीमित करता है कि कौन से टोकन विचार में भी आते हैं

Top-p, जिसे न्यूक्लियस सैंपलिंग (nucleus sampling) भी कहते हैं, टेम्परेचर से अलग तरह काम करता है: हर संभावना को नया आकार देने के बजाय, यह पहले क्षेत्र को उन सबसे ऊपरी टोकनों के सबसे छोटे समूह तक सीमित करता है जिनकी संभावनाएँ जोड़ने पर चुनी गई सीमा तक पहुँचती हैं, फिर सिर्फ उसी समूह से सैंपल लेता है। कम Top-p सिर्फ उन गिनती के टोकनों को रखता है जिन पर मॉडल को सबसे ज़्यादा भरोसा है; ज़्यादा Top-p प्रशंसनीय विकल्पों की व्यापक रेंज को अंदर आने देता है। टेम्परेचर और Top-p आमतौर पर एक-दूसरे की जगह नहीं, बल्कि एक के बाद एक साथ लागू होते हैं।

टेम्परेचर शून्य लगभग डिटर्मिनिस्टिक है, बिल्कुल नहीं

टेम्परेचर शून्य, या "हमेशा सबसे संभावित टोकन चुनें" जैसी बराबर सेटिंग, सैंपलिंग चरण हटा देती है और सिद्धांततः समान इनपुट के लिए आउटपुट को दोहराने-योग्य बना देनी चाहिए। व्यवहार में, GPU पर फ़्लोटिंग-पॉइंट गणित सख़्ती से क्रम-निरपेक्ष नहीं है, और प्रोवाइडर का इंफ्रास्ट्रक्चर रिक्वेस्ट के बीच गणना को बैच या पुनर्व्यवस्थित कर सकता है। नतीजा यह है कि सबसे डिटर्मिनिस्टिक सेटिंग पर दो बार भेजा गया वही प्रॉम्प्ट कभी-कभी फिर भी अलग लौट सकता है, ख़ासकर जब दो उम्मीदवार टोकन लगभग बराबर हों।

कम सेटिंग अपने आप बेहतर नहीं होती

रैंडमनेस घटाने से आउटपुट ज़्यादा दोहराने-योग्य बनता है, ज़्यादा सही नहीं। भरोसे से ग़लत निरंतरता कम टेम्परेचर पर भी भरोसे से ग़लत रहती है, और बहुत कम सेटिंग्स लंबे आउटपुट में भी काफ़ी दोहरावदार या बनावटी वाक्य-रचना बना सकती हैं, क्योंकि मॉडल बार-बार वही सुरक्षित, ज़्यादा-संभावना वाले टोकन दोबारा चुनता रहता है।

सही सेटिंग इस पर निर्भर करती है कि आउटपुट किसलिए है

ऐसे काम जिनका मूल रूप से एक ही सही जवाब है — कोई मान निकालना, सख़्त फ़ॉर्मैट का पालन करना, ऐसा कोड लिखना जिसे कंपाइल होना ही है — आमतौर पर कम रैंडमनेस से फ़ायदा उठाते हैं, क्योंकि विविधता से ज़्यादा स्थिरता मायने रखती है। ऐसे काम जहाँ कई अलग-अलग जवाब सब अच्छे हो सकते हैं — ब्रेनस्टॉर्मिंग, वैकल्पिक शब्द-रचनाओं का मसौदा बनाना, खुली लेखनी — ज़्यादा रैंडमनेस से फ़ायदा उठाते हैं, क्योंकि वहाँ विविधता ही मक़सद है। कोई भी सेटिंग मॉडल को बेहतर संदर्भ देने की जगह नहीं लेती, और न ही किसी वाक़ई मायने रखने वाले जवाब की जाँच की जगह लेती है।

अक्सर पूछे जाने वाले सवाल

क्या टेम्परेचर शून्य आउटपुट को डिटर्मिनिस्टिक बना देता है?
लगभग, पर गारंटी नहीं। यह सैंपलिंग की जान-बूझकर की गई रैंडमनेस हटा देता है, पर फ़्लोटिंग-पॉइंट गणना और प्रोवाइडर की तरफ़ की बैचिंग किसी बिल्कुल बराबरी या बहुत क़रीबी फ़ैसले पर कभी-कभी फिर भी अलग टोकन दे सकती है, इसलिए एक जैसी रिक्वेस्ट आमतौर पर — हमेशा नहीं — एक जैसी होती हैं।
टेम्परेचर और Top-p में क्या फ़र्क़ है?
टेम्परेचर हर संभावित अगले टोकन की संभावना को नया आकार देता है। Top-p पहले क्षेत्र को उन सबसे ऊपरी उम्मीदवारों के सबसे छोटे समूह तक सीमित करता है जिनकी संभावनाएँ एक सीमा पार करती हैं, फिर सिर्फ उसी समूह से सैंपल लेता है। दोनों एक ही वितरण पर अलग-अलग तरीक़ों से काम करते हैं और अक्सर साथ जोड़े जाते हैं।
क्या ज़्यादा टेम्परेचर मॉडल को ज़्यादा क्रिएटिव या ज़्यादा जानकार बना देता है?
यह शब्द-रचना की विविधता बदलता है, ज्ञान या तर्क नहीं। ज़्यादा टेम्परेचर ज़्यादा विविध शब्द-रचना बना सकता है, पर यह फिर भी उन्हीं सीखे हुए पैरामीटर से आता है, और उतनी ही आसानी से कम संभावित, कम गुणवत्ता वाली निरंतरता सामने ला सकता है।
क्या तथ्यात्मक कामों के लिए मुझे हमेशा सबसे कम सेटिंग इस्तेमाल करनी चाहिए?
कम सेटिंग आउटपुट को ज़्यादा स्थिर बनाती है, जो तब मदद करता है जब स्थिरता ही मक़सद हो, पर यह किसी अंतर्निहित ग़लत जवाब को ठीक नहीं करती — कम टेम्परेचर वाला आउटपुट भरोसे से और दोहराने-योग्य तरीक़े से ग़लत हो सकता है। किसी तथ्यात्मक दावे की पुष्टि के लिए अब भी एक स्वतंत्र स्रोत या जाँच चाहिए।

पढ़ने से बेहतर, आज़माकर देखें

ClawAI हर बातचीत के लिए एक टेम्परेचर सेटिंग देता है, जो रिक्वेस्ट संभालने वाले प्रोवाइडर पर लागू होती है; यह Top-p को सेटिंग के तौर पर नहीं देता, इसलिए न्यूक्लियस सैंपलिंग हर प्रोवाइडर के अपने डिफ़ॉल्ट मान पर रहती है।