फ़ीचर
ClawAI में मल्टीमॉडल AI: आवाज़, वीडियो और विज़न
ClawAI वॉइस नोट्स, वीडियो नोट्स और तस्वीरों को कैसे संभालता है: ट्रांसक्रिप्शन, वीडियो से चुने गए फ़्रेम, सिर्फ़ टेक्स्ट वाले मॉडलों के लिए विज़न हेल्पर, और अटैचमेंट के प्रकार के हिसाब से रूटिंग।
सभी फ़ीचर · अंतिम समीक्षा:
कंपोज़र से वॉइस और वीडियो नोट्स
कंपोज़र में वॉइस और वीडियो नोट्स के लिए एक रिकॉर्ड बटन है। यह पहले अनुमति माँगता है, रिकॉर्ड करते समय लाइव वेवफ़ॉर्म दिखाता है, और एक रिकॉर्डिंग को अधिकतम पाँच मिनट तक सीमित रखता है। रिकॉर्डिंग का ट्रांसक्रिप्शन होता है — पहले Gemini आज़माया जाता है और OpenAI Whisper फ़ॉलबैक है — और जवाब देने वाले मॉडल को बताया जाता है कि मैसेज वॉइस नोट के रूप में आया है, ताकि वह किसी फ़ाइल को नहीं, बल्कि आपकी कही बात का जवाब दे।
आपके पास पहले से मौजूद ऑडियो भी इसी तरह काम करता है: WebM, OGG, MP3, MP4 और M4A, WAV, FLAC और AAC अपलोड मॉडल तक पहुँचने से पहले ट्रांसक्राइब कर दिए जाते हैं।
ऐसा वीडियो जिसे मॉडल सच में समझ सके
अपलोड किए गए वीडियो का टाइमस्टैम्प के साथ ट्रांसक्रिप्शन होता है, और हर वीडियो से अधिकतम छह फ़्रेम चुनकर ट्रांसक्रिप्ट के साथ मॉडल को दिखाए जाते हैं, ताकि वह यह भी बता सके कि स्क्रीन पर क्या हो रहा है और यह भी कि क्या कहा जा रहा है। बिना आवाज़ वाले वीडियो के लिए खाली ट्रांसक्रिप्ट बनाने के बजाय बताया जाता है कि उसमें कोई बोली नहीं है, और लंबे वीडियो की प्रोसेसिंग आप किसी भी समय रोक सकते हैं।
हर प्लान की एक वीडियो-लंबाई सीमा होती है जिसे ऑपरेटर तय करता है; प्लान चाहे जो हो, कोई भी वीडियो तीस मिनट या 4K रेज़ोल्यूशन से ज़्यादा नहीं हो सकता। समर्थित कंटेनर हैं MP4, MOV, WebM, AVI और MPEG।
एक विज़न हेल्पर, और अटैचमेंट के प्रकार के हिसाब से रूटिंग
हर मॉडल देख नहीं सकता। जब किसी मैसेज का जवाब देने वाला मॉडल सिर्फ़ टेक्स्ट समझता है, तो एक दूसरा मॉडल उसके लिए अधिकतम चार तस्वीरों का वर्णन कर सकता है, उनमें लिखे टेक्स्ट सहित, और जवाब देने वाले मॉडल को बताया जाता है कि वह एक वर्णन के आधार पर काम कर रहा है। केवल-स्थानीय (Local-Only) और प्राइवेसी-फ़र्स्ट बातचीत में सिर्फ़ Ollama या llama.cpp से चलने वाले लोकल हेल्पर ही इस्तेमाल होते हैं।
Auto मोड में राउटर उम्मीदवार मॉडलों को इस आधार पर भी रैंक करता है कि वे मैसेज में मौजूद अटैचमेंट के प्रकार को कितनी अच्छी तरह संभालते हैं, ताकि कोई तस्वीर, PDF या वीडियो हेल्पर पर निर्भर रहने के बजाय आमतौर पर ऐसे मॉडल तक पहुँचे जो उसे सीधे स्वीकार करता हो।
लोग जो सवाल पूछते हैं
- वॉइस या वीडियो नोट कितना लंबा हो सकता है?
- कंपोज़र में बनाई गई एक रिकॉर्डिंग अधिकतम पाँच मिनट की हो सकती है। अपलोड किए गए वीडियो आपके प्लान की वीडियो-लंबाई सीमा से बँधे हैं, और किसी भी प्लान पर तीस मिनट या 4K रेज़ोल्यूशन से आगे कभी नहीं।
- अगर मैं ऐसे मॉडल को तस्वीर भेजूँ जो तस्वीरें नहीं देख सकता, तो क्या होता है?
- अगर आपके प्लान पर विज़न हेल्पर चालू है, तो देख सकने वाला एक मॉडल तस्वीर का वर्णन करता है और उसका टेक्स्ट लिख देता है, और जवाब देने वाला मॉडल उसी वर्णन से काम करता है — यह जानते हुए कि यह वर्णन है, खुद तस्वीर नहीं।
- क्या ClawAI मेरे अटैचमेंट की वजह से कोई दूसरा मॉडल चुनता है?
- Auto मोड में, हाँ: राउटर उम्मीदवारों को इस आधार पर रैंक करता है कि वे उस अटैचमेंट प्रकार को कितनी अच्छी तरह संभालते हैं। अगर आप खुद कोई मॉडल पिन करते हैं, तो आपकी पसंद बनी रहती है और जहाँ विज़न हेल्पर चालू है वहाँ वह कमी पूरी करता है।
हमारी बात मानने के बजाय खुद आज़माएँ
वॉइस और वीडियो नोट्स, ट्रांसक्रिप्शन और अटैचमेंट-प्रकार के हिसाब से रूटिंग लॉन्च हो चुके हैं; विज़न हेल्पर एक प्लान फ़ीचर है जिसे ऑपरेटर एक हेल्पर मॉडल असाइन करके चालू करता है।