बुनियादी बातें
गुमराह हुए बिना AI बेंचमार्क कैसे पढ़ें
बेंचमार्क नंबर सटीक लगता है, जिससे उस पर ज़रूरत से ज़्यादा भरोसा करना आसान हो जाता है। MMLU या HumanEval जैसा स्कोर असल में क्या मापता है, बेंचमार्क नंबर गुमराह करने के आम तरीक़े, और किसी को अपने इस्तेमाल के लिए सार्थक मानने से पहले क्या जाँचना चाहिए।
सभी लेख · आख़िरी समीक्षा:
बेंचमार्क एक तय टेस्ट है, क्षमता का सामान्य पैमाना नहीं
MMLU (बहुविकल्पीय सामान्य ज्ञान), HumanEval (छोटी कोडिंग समस्याएँ), या GSM8K (प्राइमरी स्तर के गणित के शब्द-प्रश्न) जैसे जाने-पहचाने बेंचमार्क हर एक एक संकीर्ण, तय कौशल को एक तय फ़ॉर्मैट में जाँचते हैं। कोई मॉडल एक में अच्छा स्कोर कर सकता है और किसी ऐसे काम में ख़राब जो इंसान को एक जैसा लगे पर बनावट में अलग हो — जैसे छोटे अलग-अलग फ़ंक्शन के बजाय लंबी कोडिंग, या बहुविकल्पीय याद के बजाय खुला लेखन।
बेंचमार्क के सवाल ट्रेनिंग डेटा में लीक हो सकते हैं
लोकप्रिय बेंचमार्क सार्वजनिक होते हैं, और उनके सवाल वेब पर, रिसर्च पेपरों में और फ़ोरम चर्चाओं में व्यापक रूप से घूमते हैं — बिल्कुल वही तरह का टेक्स्ट जिस पर बड़े मॉडल ट्रेन होते हैं। जब मॉडल असल में पहले ही जवाब देख चुका होता है, उसका स्कोर उस ख़ास टेस्ट पर याददाश्त को दिखाता है, न कि उस सामान्य क्षमता को जिसे बेंचमार्क दर्शाने वाला था। इसे कंटैमिनेशन कहते हैं, और बाहर से सिर्फ़ स्कोर देखकर इसे पकड़ना मुश्किल है।
बताया गया स्कोर मॉडल से पूछने के तरीक़े पर बहुत निर्भर हो सकता है
एक ही मॉडल प्रॉम्प्ट के फ़ॉर्मैट, असली सवाल से पहले दिखाए गए हल किए उदाहरणों की संख्या, और उसे जवाब देने से पहले क़दम-दर-क़दम तर्क करने की इजाज़त थी या नहीं, इस पर निर्भर करके बहुत अलग स्कोर कर सकता है। जो कंपनी उदार शर्तों में अपना सबसे अच्छा नतीजा बताती है वह झूठ नहीं बोल रही, पर वह नंबर शायद वैसा न दिखे जैसा आपको एक सीधे, रोज़मर्रा के प्रॉम्प्ट से मिलेगा।
बेंचमार्क संतृप्त हो जाते हैं — और ज़्यादातर मॉडलों के पास हो जाने पर बेकार हो जाते हैं
जब ज़्यादातर अग्रणी मॉडल किसी बेंचमार्क में अधिकतम के क़रीब स्कोर कर लेते हैं, तो वह उन्हें सार्थक ढंग से अलग करना बंद कर देता है, भले ही पुराना नंबर अक्सर फिर भी उद्धृत किया जाता रहे। संतृप्त बेंचमार्क पर लगभग-पूर्ण स्कोर पहले जितना नहीं बताता; नए, कठिन बेंचमार्क आमतौर पर उसकी जगह ले लेते हैं, और एक पुराने, संतृप्त नंबर पर टिकी मार्केटिंग तुलना दोबारा जाँच के लायक़ है।
एक अकेला औसत ठीक वहीं छिपा देता है जहाँ मॉडल असल में लड़खड़ाता है
कुल बेंचमार्क स्कोर अलग-अलग कठिनाई और तरह के कई सवालों का औसत है। कोई मॉडल औसत में अच्छा कर सकता है जबकि किसी ऐसी ख़ास उप-श्रेणी में अविश्वसनीय हो जो आपके लिए मायने रखती है — किसी ख़ास तरह का तर्क, कोई ख़ास क्षेत्र, काम की कोई ख़ास लंबाई। औसत एक सारांश है, और सारांश ठीक वही विवरण छोड़ देते हैं जो असल फ़ैसले के लिए आमतौर पर सबसे ज़्यादा मायने रखता है।
बेंचमार्क को शुरुआती बिंदु मानें, अंतिम फ़ैसला नहीं
बेंचमार्क स्कोर एक मोटे-मोटे शुरुआती फ़िल्टर के तौर पर सबसे उपयोगी है — किसी मॉडल को साफ़ तौर पर अनुपयुक्त मानकर हटाना, या आगे जाँच के लायक़ कुछ को छाँटकर छोटी सूची बनाना — न कि किस मॉडल का इस्तेमाल करना है इसका अंतिम शब्द। देखें AI मॉडल कैसे परखें यह जानने के लिए कि छोटी सूची बनाने के बाद असल में क्या फ़िट का अंदाज़ा देता है: अपने ही प्रतिनिधि कामों पर परखना, जिसकी जगह कोई प्रकाशित बेंचमार्क नहीं ले सकता।
अक्सर पूछे जाने वाले सवाल
- MMLU या HumanEval जैसा बेंचमार्क असल में क्या जाँचता है?
- एक तय फ़ॉर्मैट में सवालों का एक तय, ख़ास सेट — MMLU बहुविकल्पीय सामान्य ज्ञान है, HumanEval छोटी कोडिंग समस्याएँ हैं। हर एक एक संकीर्ण कौशल मापता है, हर काम में सामान्य बुद्धि या क्षमता नहीं।
- अलग-अलग कंपनियों के बेंचमार्क स्कोर कभी-कभी असंगत क्यों लगते हैं?
- स्कोर प्रॉम्प्ट के फ़ॉर्मैट, असली सवाल से पहले दिखाए गए उदाहरणों की संख्या, और क़दम-दर-क़दम तर्क की इजाज़त थी या नहीं, इस पर निर्भर कर सकते हैं। रिपोर्टिंग की अलग शर्तें एक ही अंतर्निहित मॉडल के लिए अलग नंबर पैदा करती हैं।
- बेंचमार्क कंटैमिनेशन क्या है?
- जब किसी बेंचमार्क के सार्वजनिक सवाल किसी मॉडल के ट्रेनिंग डेटा में पहुँच जाते हैं, तो मॉडल टेस्ट होने से पहले ही असल में जवाब देख चुका होता है। नतीजे में मिला स्कोर याददाश्त को दिखाता है, न कि उस क्षमता को जिसे मापने के लिए बेंचमार्क बनाया गया था।
- क्या मुझे बेंचमार्क स्कोर को पूरी तरह नज़रअंदाज़ कर देना चाहिए?
- नहीं — साफ़ तौर पर अनुपयुक्त मॉडलों को हटाने या छोटी सूची बनाने के लिए ये एक ठीक-ठाक शुरुआती फ़िल्टर हैं। बस अंतिम नंबर को फ़ैसला न मानें; तय करने से पहले छोटी सूची को अपने ही प्रतिनिधि कामों पर परखें।
पढ़ने से बेहतर, आज़माकर देखें
ClawAI अपना कोई बेंचमार्क लीडरबोर्ड प्रकाशित नहीं करता और न ही किसी मॉडल के लिए मालिकाना स्कोर का दावा करता है — इसके बजाय, इसका रूटिंग-ट्रांसपेरेंसी पैनल किसी ख़ास जवाब के पीछे की असली कॉस्ट क्लास, लेटेंसी क्लास और रूटिंग कॉन्फ़िडेंस दिखाता है, ताकि आप जवाब को अपने ही अनुरोध के सामने परख सकें, न कि किसी प्रकाशित टेस्ट सेट के सामने जिसे आप जाँच नहीं सकते।