मुख्य सामग्री पर जाएँ

बुनियादी बातें

प्रॉम्प्ट इंजेक्शन क्या है?

AI मॉडल भरोसे के साथ यह फ़र्क़ नहीं कर सकता कि आपके निर्देश कौन-से हैं और उस कंटेंट में छिपे निर्देश कौन-से हैं जिसे वह पढ़ रहा है — कोई वेब पेज, कोई डॉक्यूमेंट, किसी टूल का नतीजा। प्रॉम्प्ट इंजेक्शन असल में क्या है, ज़्यादा स्मार्ट मॉडल इसे पूरी तरह क्यों नहीं सुलझा सकता, और होने पर क्या चीज़ नुक़सान को सीमित करती है।

सभी लेख · आख़िरी समीक्षा:

दो रूप: डायरेक्ट और इनडायरेक्ट

डायरेक्ट इंजेक्शन का मतलब है कोई सीधे चैट में निर्देश टाइप करके सिस्टम के मक़सद वाले व्यवहार को बदलने की कोशिश करे — मॉडल से उसके निर्देश नज़रअंदाज़ करने, छिपी हुई कॉन्फ़िगरेशन उजागर करने, या अपने तय दायरे से बाहर काम करने के लिए कहे। इनडायरेक्ट इंजेक्शन ज़्यादा नतीजों वाला रूप है: ऐसे कंटेंट में बोए गए निर्देश जिसे मॉडल आपकी ओर से पढ़ता है — वेब पेज, ईमेल, फ़ाइल, API का जवाब — जिन्हें मॉडल के लिए कभी कमांड नहीं माना जाना था, पर मॉडल के पास इन्हें कमांड से अलग पहचानने का कोई भरोसेमंद तरीक़ा नहीं है।

ज़्यादा स्मार्ट मॉडल अकेले यह क्यों नहीं सुलझाता

दिक़्क़त यह नहीं कि मॉडल पर्याप्त बुद्धिमान नहीं हैं — यह ढाँचागत है। मॉडल जो कुछ भी देखता है, चाहे वह आपका अनुरोध हो या किसी अविश्वसनीय स्रोत से लाया गया टेक्स्ट, कॉन्टेक्स्ट विंडो में आते ही एक ही तरह का टोकन क्रम बन जाता है। "भरोसेमंद निर्देशों" बनाम "पढ़े जाने वाले कंटेंट" के लिए कोई अलग, छेड़छाड़-रोधी चैनल नहीं है। ज़्यादा सक्षम मॉडल आम इंजेक्शन वाक्य-रचनाओं को पहचानने में बेहतर हो सकता है, पर पर्याप्त छिपाया गया निर्देश — टेक्स्ट में बँटा हुआ, इनडायरेक्ट ढंग से लिखा गया, फ़ॉर्मैटिंग में छिपाया गया — फिर भी निकल सकता है, क्योंकि आधारभूत आर्किटेक्चर के पास लागू करने के लिए कोई सख़्त सीमा नहीं है।

जैसे ही मॉडल टूल फ़राबुला सके, ख़तरा तेज़ी से बढ़ जाता है

सिर्फ़ टेक्स्ट बनाने वाला चैटबॉट इंजेक्शन को ख़राब या गुमराह करने वाले आउटपुट तक सीमित रखता है — तंग करने वाला, पर सीमित। जैसे ही मॉडल टूल फ़राबुला सकता है (देखें AI टूल कॉलिंग कैसे काम करता है) — ईमेल भेजना, कमांड चलाना, फ़ाइल बदलना — एक सफल इंजेक्शन एक अनचाही असली दुनिया की कार्रवाई बन सकता है, सिर्फ़ एक बुरा वाक्य नहीं। यही वजह है कि जो सिस्टम वेब ब्राउज़िंग या डॉक्यूमेंट पढ़ने को टूल एक्सेस के साथ मिलाते हैं, वे साधारण चैटबॉट से काफ़ी ज़्यादा इंजेक्शन ख़तरा उठाते हैं।

फ़िल्टरिंग और दायरा सीमित करना ख़तरा घटाते हैं; कोई भी इसे मिटाता नहीं

लाए गए कंटेंट को जाने-पहचाने इंजेक्शन पैटर्न के लिए स्कैन करना कुछ कोशिशें पकड़ लेता है, पर किसी भी तय पैटर्न सूची को निर्देश अलग तरह से लिखकर चकमा दिया जा सकता है — यह एक फ़िल्टर है, गारंटी नहीं। असली नुक़सान को ज़्यादा भरोसे से घटाने वाली चीज़ यह है कि मॉडल को जो बताया गया उससे परे, उसे क्या करने की इजाज़त है यह सीमित करना: टूल एक्सेस को तंग रखना, किसी विनाशकारी या बाहर की ओर जाने वाली कार्रवाई से पहले मंज़ूरी माँगना, और मॉडल को कभी उसके सामने के ख़ास काम से ज़्यादा चौड़ी स्थायी अनुमतियाँ न देना।

मॉडल जो कंटेंट पढ़ता है वह अविश्वसनीय इनपुट है, कोई निष्पक्ष तथ्य-स्रोत नहीं

कोई भी सिस्टम जो मॉडल को बाहरी कंटेंट पढ़ने देता है — सर्च नतीजा, स्क्रेप की गई कोई पेज, किसी यूज़र का अपलोड किया डॉक्यूमेंट — उसे ऐसे निर्देशों के सामने लाता है जो किसी ने नहीं माँगे। व्यावहारिक असर यह है कि उस कंटेंट को वैसे ही समझें जैसे आप किसी और सॉफ़्टवेयर में बिना जाँचे यूज़र इनपुट को समझते हैं: मान लें कि इसमें कुछ शत्रुतापूर्ण हो सकता है, और आस-पास के सिस्टम को इस तरह डिज़ाइन करें कि एक सफल इंजेक्शन की पहुँच सीमित हो, यह मानने के बजाय कि इंजेक्शन होगा ही नहीं।

अक्सर पूछे जाने वाले सवाल

क्या प्रॉम्प्ट इंजेक्शन को पूरी तरह रोका जा सकता है?
नहीं, मौजूदा मॉडल आर्किटेक्चर के साथ नहीं। यूज़र के निर्देशों और मॉडल कहीं और से जो टेक्स्ट पढ़ता है उसके बीच कोई अंतर्निहित, छेड़छाड़-रोधी बँटवारा नहीं है, इसलिए फ़िल्टरिंग और दायरा सीमित करना ख़तरा घटाते और नुक़सान सीमित करते हैं पर रोकथाम की गारंटी नहीं दे सकते।
क्या प्रॉम्प्ट इंजेक्शन वही है जो जेलब्रेकिंग है?
इनमें ओवरलैप है पर ये एक जैसे नहीं हैं। जेलब्रेकिंग का मतलब आमतौर पर होता है कोई यूज़र सीधे मॉडल को उसके अपने दिशानिर्देश तोड़ने पर मजबूर करने की कोशिश करे। प्रॉम्प्ट इंजेक्शन अक्सर उस कंटेंट में छिपे निर्देशों को कहते हैं जिसे मॉडल यूज़र की जानकारी के बिना, उसकी ओर से पढ़ता है।
क्या टूल इस्तेमाल न कर सकने वाले चैटबॉट के लिए प्रॉम्प्ट इंजेक्शन मायने रखता है?
ख़तरा छोटा है — एक सफल इंजेक्शन गुमराह करने वाला या छेड़छाड़ किया गया जवाब पैदा कर सकता है, पर यह टेक्स्ट बनाने से परे कोई कार्रवाई नहीं कर सकता। जैसे ही मॉडल ऐसे टूल फ़राबुला सकता है जो बातचीत से बाहर कुछ करते हैं, ख़तरा काफ़ी बढ़ जाता है।
क्या इंजेक्शन पैटर्न के लिए कंटेंट स्कैन करना काफ़ी सुरक्षा है?
यह जाने-पहचाने, पहचाने जा सकने वाले प्रयास पकड़ लेता है, पर किसी भी तय पैटर्न सूची को दोबारा लिखकर चकमा दिया जा सकता है। असली सुरक्षा मॉडल को जो करने की इजाज़त है उसे सीमित करने से भी आती है — तंग टूल दायरा और नतीजों वाली कार्रवाइयों के लिए ज़रूरी मंज़ूरी — सिर्फ़ पहचान से नहीं।

पढ़ने से बेहतर, आज़माकर देखें

ClawAI की रिसर्च सर्विस लाए गए वेब कंटेंट को जाने-पहचाने प्रॉम्प्ट-इंजेक्शन पैटर्न के लिए स्कैन करती है और उस कंटेंट के मॉडल तक पहुँचने से पहले रहस्य जैसे दिखने वाले टोकन को छिपा देती है — जो पकड़ती है उसे लॉग करती है बजाय चुपचाप ब्लॉक करने के, क्योंकि कोई भी तय पैटर्न सूची हर कोशिश नहीं पकड़ सकती। यह पहचान परत उस बचाव का बस एक हिस्सा है जो इस पर भी निर्भर करता है कि मॉडल शुरुआत में कौन-से टूल फ़राबुला सकता है।