मुख्य सामग्री पर जाएँ

ऑर्केस्ट्रेशन

AI जज क्या है?

AI जज एक मॉडल है जो दूसरे मॉडलों के जवाबों को स्कोर करता है। इसका इस्तेमाल कैसे होता है, यह कौन-से पूर्वाग्रह रखता है, और यह असली जाँच का विकल्प क्यों नहीं है।

सभी लेख · आख़िरी समीक्षा:

जज क्या करता है

जज को मूल सवाल और दो या ज़्यादा जवाब मिलते हैं, और वह रैंकिंग या स्कोर देता है, आमतौर पर किसी वजह के साथ। यह बेस्ट-ऑफ़-N का चुनाव क़दम है और जब मॉडल असहमत हों तो पंचायती क़दम है।

इसकी अपील साफ़ है: यह उस तरह स्केल करता है जैसे इंसानी समीक्षा नहीं कर सकती, और उस इंसान से बहुत सस्ता है जिसकी जगह यह लेता है।

पूर्वाग्रह, जो लगातार बने रहते हैं

जज लंबे जवाबों को छोटों पर तरजीह देते हैं, तब भी जब छोटा जवाब पूरा हो। वे भरोसे भरे शब्दों को झिझक भरे शब्दों पर तरजीह देते हैं, चाहे वह भरोसा जायज़ हो या न हो। वे उम्मीदवारों के पेश किए जाने के क्रम के प्रति संवेदनशील होते हैं। और अपने ही आउटपुट को आँकने के लिए कहा गया मॉडल उसे तरजीह देने की तरफ़ झुकता है।

इनमें से कोई भी सूक्ष्म नहीं है, और सब क़ाबू में लाए जा सकते हैं — क्रम बदल दें, जज और लेखक अलग-अलग मॉडल रखें, सामान्य पसंद के बजाय ख़ास मापदंड माँगें। लेकिन इन्हें जानबूझकर संभालना पड़ता है, क्योंकि डिफ़ॉल्ट सेटअप चारों दिखाता है।

जज वेरिफ़ायर नहीं है

जज जवाबों की एक-दूसरे से तुलना करता है। वह उनकी हक़ीक़त से तुलना नहीं करता। तीन ग़लत जवाबों के सामने वह भरोसे से उन्हें रैंक करेगा, और विजेता फिर भी ग़लत रहेगा।

जहाँ बाहरी जाँच मौजूद हो — टेस्ट, कोई स्कीमा, कोई खोज — वह जाँच जज से बेहतर है, क्योंकि यह उस चीज़ से स्वतंत्र है जिसे आँका जा रहा है। जज वह है जो आप तब इस्तेमाल करते हैं जब ऐसी कोई जाँच मौजूद न हो।

अक्सर पूछे जाने वाले सवाल

क्या जज को सबसे मज़बूत मॉडल होना चाहिए?
आमतौर पर एक मज़बूत मॉडल, और तरजीही तौर पर वह मॉडल नहीं जिसने उम्मीदवार लिखे। ख़ुद को तरजीह देना असली है और सबसे सस्ता इलाज है अलग मॉडल इस्तेमाल करना।
क्या जज एक अकेले जवाब को स्कोर कर सकता है?
कर सकता है, पर तुलनात्मक फ़ैसला पूर्ण स्कोरिंग से ज़्यादा भरोसेमंद है। मॉडल «इनमें कौन-सा बेहतर है» में «यह 7 है या 8» से बेहतर होते हैं।
मुझे कैसे पता चले जज सही है?
अपने ही फ़ैसले के मुक़ाबले किसी सैंपल पर उसे जाँचें। अगर आप कभी न जाँचें, तो आपने भरोसे को कमाया नहीं, बस उसे कहीं और डाल दिया है।

पढ़ने से बेहतर, आज़माकर देखें

ClawAI जजिंग को तुलना के ऊपर अपनी अलग सतह की तरह चलाता है, इसलिए स्कोर किए गए जवाब में उम्मीदवार लिखने वाले मॉडल और उन्हें आँकने वाला मॉडल — दोनों दर्ज होते हैं।