मुख्य सामग्री पर जाएँ

बुनियादी बातें

एम्बेडिंग क्या है?

एम्बेडिंग टेक्स्ट को संख्याओं के एक वेक्टर में बदल देता है जो उसका अर्थ दर्शाता है, और यही चीज़ सटीक शब्दों के बजाय अर्थ के आधार पर खोज को संभव बनाती है। समानता कैसे मापी जाती है, और अलग-अलग मॉडलों की एम्बेडिंग क्यों नहीं मिलतीं।

सभी लेख · आख़िरी समीक्षा:

अर्थ की जगह लेती संख्याओं की एक सूची

एक एम्बेडिंग मॉडल टेक्स्ट का एक टुकड़ा पढ़ता है — एक शब्द, एक वाक्य, एक पैराग्राफ़, कभी-कभी पूरा दस्तावेज़ — और तय लंबाई का एक वेक्टर देता है: संख्याओं की एक क्रमबद्ध सूची, जो आमतौर पर सैकड़ों या हज़ारों तत्वों की होती है। वह वेक्टर किसी इंसान के पढ़ने लायक़ सारांश नहीं है; यह एक गणितीय स्पेस में एक स्थिति है जिसे मॉडल ने प्रशिक्षण के दौरान सीखा, इस तरह व्यवस्थित कि जुड़े हुए अर्थ वाले टेक्स्ट पास-पास रहें।

पास वही आता है जो अर्थ में मिलता-जुलता हो, वर्तनी में नहीं

दो वाक्य जिनमें लगभग कोई शब्द साझा नहीं है पर जिनका मतलब लगभग एक जैसा है, वे पास-पास के वेक्टर बना सकते हैं, क्योंकि एम्बेडिंग मॉडल ने प्रशिक्षण के दौरान अवधारणाओं के बीच संबंध सीखे, न कि सिर्फ़ यह कि कौन से अक्षर आते हैं। इसके उलट, बहुत सारे शब्द साझा करने वाले पर अलग मतलब रखने वाले दो वाक्य बहुत दूर जा सकते हैं। यही एम्बेडिंग-आधारित खोज और सटीक कीवर्ड मिलान के बीच का मुख्य फ़र्क़ है।

नज़दीकी नापी जाती है, अंदाज़े से नहीं तय होती

जब टेक्स्ट वेक्टर के रूप में दर्शाया जाता है, तो अर्थ की तुलना एक ज्यामितीय समस्या बन जाती है: दो वेक्टरों के बीच निकाला गया एक समानता स्कोर, अक्सर इस आधार पर कि वे कितनी एक जैसी दिशा में इशारा करते हैं। किसी बड़े संग्रह में खोजने का मतलब है क्वेरी वेक्टर और हर संग्रहीत वेक्टर के बीच वह स्कोर निकालना, फिर सबसे क़रीबी मिलान लौटाना — चाहे संग्रह में सौ प्रविष्टियाँ हों या दस करोड़, ऑपरेशन वही रहता है।

अलग-अलग मॉडलों की एम्बेडिंग नहीं मिलतीं

जैसे किसी टोकनाइज़र की शब्दावली, एक एम्बेडिंग मॉडल का वेक्टर स्पेस उसी मॉडल और उसके प्रशिक्षण तरीक़े के लिए ख़ास होता है। एक एम्बेडिंग मॉडल द्वारा बनाया गया वेक्टर किसी दूसरे मॉडल द्वारा बनाए गए वेक्टर से सार्थक ढंग से तुलनीय नहीं है, भले ही दोनों वेक्टरों के आयामों की संख्या बराबर हो। एम्बेडिंग मॉडल बदलने का मतलब है जो कुछ पहले से संग्रहीत है उसे फिर से एम्बेड करना, न कि सिर्फ़ आगे की नई सामग्री को।

एम्बेडिंग मॉडल का काम भाषा मॉडल के काम से अलग है

एक भाषा मॉडल किसी प्रॉम्प्ट से टेक्स्ट, टोकन दर टोकन, तैयार करता है। एक एम्बेडिंग मॉडल कुछ भी तैयार नहीं करता — यह टेक्स्ट को एक वेक्टर में बदलता है और वहीं रुक जाता है। कुछ सिस्टम दोनों काम के लिए एक ही आधार मॉडल इस्तेमाल करते हैं, और कुछ पूरी तरह अलग दो मॉडल; किसी भी सूरत में, एम्बेडिंग चरण से निकला वेक्टर ख़ुद कोई जवाब नहीं है, बस वह चीज़ है जिसे खोज या मिलान का चरण तुलना के लिए इस्तेमाल कर सकता है।

व्यवहार में यह कहाँ दिखता है

एम्बेडिंग ही रिट्रीवल-ऑगमेंटेड जनरेशन को संभव बनाते हैं — रिट्रीवल भाषा मॉडल के साथ कैसे जुड़ता है, यह जानने के लिए RAG क्या है? देखें — पर वही तकनीक सपोर्ट टिकट या दस्तावेज़ों में सिमेंटिक खोज, मिलती-जुलती पुरानी बातचीत के मिलान, लगभग एक जैसी सामग्री हटाने, और किसी के हाथ से श्रेणी लगाए बिना जुड़ी हुई चीज़ों को समूहबद्ध करने के पीछे भी है।

अक्सर पूछे जाने वाले सवाल

क्या एम्बेडिंग वही है जो टोकन है?
नहीं। टोकन टेक्स्ट की एक अलग इकाई है जिसे भाषा मॉडल एक-एक करके पढ़ता या लिखता है। एम्बेडिंग एक सतत वेक्टर है जो टेक्स्ट के बड़े हिस्से का अर्थ दर्शाता है, जिसे एक अलग चरण तैयार करता है जो कुछ नहीं बनाता।
क्या मैं दो अलग-अलग मॉडलों की एम्बेडिंग की तुलना कर सकता हूँ?
सार्थक ढंग से नहीं। हर एम्बेडिंग मॉडल प्रशिक्षण के दौरान अपना ख़ुद का वेक्टर स्पेस तय करता है, इसलिए एक मॉडल के स्पेस में जो दूरी "बहुत मिलती-जुलती" का मतलब रखती है, वह किसी दूसरे मॉडल के स्पेस में कोई तय मतलब नहीं रखती, भले ही वेक्टर की लंबाई बराबर हो।
क्या बड़ा एम्बेडिंग वेक्टर बेहतर खोज का मतलब है?
अकेले नहीं। ज़्यादा आयाम ज़्यादा बारीक़ी पकड़ सकते हैं, पर गुणवत्ता इस पर निर्भर करती है कि मॉडल किस पर प्रशिक्षित हुआ और वह आपकी सामग्री से कितना मेल खाता है, सिर्फ़ आयामों की गिनती पर नहीं।
क्या कोई एम्बेडिंग से मूल टेक्स्ट वापस निकाल सकता है?
सटीक तरीक़े से वापस निकालना आमतौर पर अव्यावहारिक है, पर एम्बेडिंग फिर भी सीधे आपकी सामग्री से बनती है और कुछ हमलों में उसके बारे में सार्थक जानकारी लीक कर सकती है। संवेदनशील टेक्स्ट की संग्रहीत एम्बेडिंग को उतनी ही सावधानी से संभालें जितनी ख़ुद टेक्स्ट को, यह मानकर नहीं कि वे पहले से गुमनाम हैं।

पढ़ने से बेहतर, आज़माकर देखें

ClawAI की मेमोरी और कॉन्टेक्स्ट-पैक सुविधाएँ Ollama के ज़रिए एम्बेडिंग स्थानीय रूप से बनाती हैं और समानता खोज के लिए उन्हें एक वेक्टर डेटाबेस में रखती हैं, बजाय इसके कि इस काम के लिए आपकी सामग्री किसी अलग क्लाउड एम्बेडिंग एपीआई को भेजी जाए।