बुनियादी बातें
AI में टूल कॉलिंग असल में कैसे काम करती है?
कोई टूल कॉल करने वाला मॉडल कभी कुछ ख़ुद नहीं चलाता — वह एक नाम और आर्ग्युमेंट सुझाता है, और आपका ऐप तय करता है कि वह कॉल चलानी है या नहीं। रिक्वेस्ट-रिस्पॉन्स लूप कैसे काम करता है, और सुझाव अंदाज़ा क्यों है, गारंटी क्यों नहीं।
सभी लेख · आख़िरी समीक्षा:
मॉडल को मेन्यू दिया जाता है, कीबोर्ड नहीं
रिक्वेस्ट भेजने से पहले, ऐप मॉडल को उपलब्ध टूल बताता है: एक नाम, हर टूल क्या करता है इसका विवरण, और अपेक्षित आर्ग्युमेंट के लिए एक स्कीमा। मॉडल को काम करता कोड या किसी चीज़ से लाइव कनेक्शन नहीं मिलता — उसे एक विवरण मिलता है, बिल्कुल वैसे जैसे कोई व्यक्ति रसोई तक पहुँच के बिना मेन्यू पढ़ता है।
मॉडल कभी कुछ ख़ुद नहीं चलाता
जब मॉडल तय करता है कि कोई टूल मदद करेगा, वह एक स्ट्रक्चर्ड आउटपुट बनाता है — आमतौर पर एक टूल का नाम और आर्ग्युमेंट का सेट — और वहीं रुक जाता है। अभी तक कुछ भी खोजा, कॉल किया, या बदला नहीं गया। रिक्वेस्ट भेजने वाला ऐप उस स्ट्रक्चर्ड आउटपुट को पढ़ता है, तय करता है कि उस पर कार्रवाई करनी है या नहीं, और अगर हाँ तो असली फ़ंक्शन या API कॉल अपने ही इन्फ्रास्ट्रक्चर पर चलाता है।
पूरा आदान-प्रदान एक लूप है, एक ही चरण नहीं
सामान्य क्रम यह है: ऐप एक प्रॉम्प्ट और उपलब्ध टूल की सूची भेजता है; मॉडल या तो एक जवाब देता है या एक सुझाई गई टूल कॉल देता है; अगर वह टूल कॉल है, तो ऐप उसे चलाता है और नतीजा बातचीत के हिस्से के तौर पर वापस भेजता है; मॉडल फिर आगे बढ़ता है, अक्सर एक अंतिम जवाब देता है जो उस नतीजे का इस्तेमाल करता है। कई-चरणों वाले काम इस लूप को कई बार दोहरा सकते हैं इससे पहले कि कोई जवाब उपयोगकर्ता तक पहुँचे।
सुझाई गई कॉल एक संभावित अंदाज़ा है, सही होने की गारंटी नहीं
मॉडल ग़लत टूल सुझा सकता है, ऐसा आर्ग्युमेंट गढ़ सकता है जो स्कीमा में कभी था ही नहीं, या ऐसा टूल कॉल कर सकता है जब कॉल करने के लिए कुछ था ही नहीं — वही प्रोबेबिलिस्टिक जेनरेशन जो कोई भी दूसरा आउटपुट बनाता है, टूल कॉल भी बनाता है। इस तंत्र में कुछ भी सुझाई गई कॉल को अपने आप चलाने के लिए सुरक्षित नहीं बनाता। कोई ऐप जो आर्ग्युमेंट को स्कीमा के ख़िलाफ़ जाँचे बिना, और यह अधिकृत किए बिना कि कॉल असल में क्या छू सकती है, चला देता है, वह एक अंदाज़े को असली एक्सेस सौंप रहा है।
स्कीमा वह इकलौता इंटरफ़ेस है जो मॉडल असल में देखता है
किसी टूल का नाम, विवरण और आर्ग्युमेंट स्कीमा पूरी स्पेसिफ़िकेशन है जिससे मॉडल को काम करना है — उसके पास यह जानने का कोई और तरीक़ा नहीं कि टूल क्या करता है या उसके पैरामीटर सही तरीक़े से कैसे भरे जाएँ। साफ़ और सटीक तरीक़े से बताया गया वही अंतर्निहित फ़ंक्शन, अस्पष्ट रूप से बताए गए या असंबंधित विकल्पों के साथ बंडल किए गए फ़ंक्शन से कहीं ज़्यादा बार सही तरीक़े से कॉल होता है, क्योंकि मॉडल सिर्फ़ उसी विवरण से आर्ग्युमेंट चुनता और भरता है।
यह मॉडल से कोड लिखवाने से अलग क्यों है
किसी मॉडल से काम करता स्क्रिप्ट बनवाना और उससे पहले से तय टूल कॉल करवाना एक ही रिक्वेस्ट नहीं है। एक टूल कॉल उस नाम और आर्ग्युमेंट तक सीमित है जिन्हें आपका ऐप पहले से सुरक्षित तरीक़े से संभालना जानता है; खुले तौर पर जेनरेट किया कोड वह कुछ भी करने की कोशिश कर सकता है जो उसे चलाने वाला वातावरण अनुमति दे, जो कहीं ज़्यादा बड़ी और अलग तरह की सुरक्षा समस्या है। टूल कॉलिंग यह सीमित कर देती है कि मॉडल क्या माँग सकता है — विकल्पों के एक तय, जाँचे जा सकने वाले सेट तक।
अक्सर पूछे जाने वाले सवाल
- क्या मॉडल टूल ख़ुद चलाता है?
- नहीं। मॉडल एक स्ट्रक्चर्ड रिक्वेस्ट देता है जो किसी टूल और उसके आर्ग्युमेंट का नाम लेती है। रिक्वेस्ट भेजने वाला ऐप तय करता है कि उसे चलाना है या नहीं, और असली फ़ंक्शन या API कॉल ऐप के अपने इन्फ्रास्ट्रक्चर पर चलती है, मॉडल के अंदर नहीं।
- क्या मॉडल गढ़े हुए आर्ग्युमेंट के साथ कोई टूल कॉल कर सकता है?
- हाँ। मॉडल ऐसा मान दे सकता है जो स्कीमा का हिस्सा कभी था ही नहीं, या जो उस टूल के लिए कोई मतलब नहीं रखता, क्योंकि कॉल वैसे ही जेनरेट होती है जैसे कोई भी दूसरा आउटपुट। असली कुछ भी चलाने से पहले आर्ग्युमेंट जाँचना ऐप की ज़िम्मेदारी है, कोई ऐसी चीज़ नहीं जिसकी मॉडल गारंटी देता हो।
- अगर मॉडल ग़लत टूल कॉल कर दे तो क्या होता है?
- यह पूरी तरह इस पर निर्भर करता है कि ऐप कैसे बनाया गया है। अच्छी तरह बना ऐप कॉल चलाने से पहले जाँचता है कि वह समझ में आती है या नहीं, और बेमेल रिक्वेस्ट पर कार्रवाई करने के बजाय मॉडल को एरर या साफ़ करने वाला नतीजा लौटा सकता है; ख़राब तरीक़े से बना ऐप जो भी मिले उसे चला देता है।
- क्या टूल कॉलिंग वही है जो AI एजेंट है?
- नहीं, पर एजेंट आमतौर पर इसी के ऊपर बनते हैं। टूल कॉलिंग अंतर्निहित रिक्वेस्ट-रिस्पॉन्स तंत्र है; एक एजेंट आमतौर पर उस लूप को कई बार दोहराता है, हर नतीजे के आधार पर आगे क्या आज़माना है यह तय करने वाले अतिरिक्त लॉजिक के साथ।
पढ़ने से बेहतर, आज़माकर देखें
ClawAI चैट रिक्वेस्ट के दौरान वर्कस्पेस कनेक्टर और दूसरी कार्रवाइयों को मॉडलों के लिए कॉल करने योग्य टूल के तौर पर पेश करता है; ClawAI आपकी ओर से किसी असली कनेक्टर के ख़िलाफ़ कुछ भी चलाने से पहले सुझाई गई कॉल को उसकी स्कीमा के ख़िलाफ़ जाँचता है।