به محتوای اصلی بروید

قابلیت

هوش مصنوعی چندوجهی در ClawAI: صدا، ویدیو و بینایی

ClawAI چگونه با یادداشت‌های صوتی، یادداشت‌های ویدیویی و تصاویر کار می‌کند: رونویسی، نمونه‌برداری از فریم‌های ویدیو، دستیار بینایی برای مدل‌های متنی و مسیریابی بر اساس نوع پیوست.

همه امکانات · آخرین بازبینی:

یادداشت صوتی و تصویری از همان کادر نوشتن

کادر نوشتن یک دکمهٔ ضبط برای یادداشت‌های صوتی و تصویری دارد. ابتدا اجازه می‌گیرد، هنگام ضبط شکل موج زنده نشان می‌دهد و هر ضبط را به پنج دقیقه محدود می‌کند. ضبط رونویسی می‌شود — ابتدا Gemini امتحان می‌شود و OpenAI Whisper جایگزین است — و به مدل پاسخ‌دهنده گفته می‌شود که پیام به‌صورت یادداشت صوتی رسیده است، تا به آنچه گفته‌اید پاسخ دهد، نه به یک فایل.

صداهایی که از قبل دارید هم همین‌طور کار می‌کنند: فایل‌های بارگذاری‌شدهٔ WebM، OGG، MP3، MP4 و M4A، WAV، FLAC و AAC پیش از رسیدن به مدل رونویسی می‌شوند.

ویدیویی که مدل واقعاً می‌تواند دنبالش کند

ویدیوی بارگذاری‌شده همراه با برچسب‌های زمانی رونویسی می‌شود و از هر ویدیو حداکثر شش فریم نمونه‌برداری و در کنار متن رونویسی به مدل نشان داده می‌شود، تا بتواند هم دربارهٔ آنچه روی صفحه رخ می‌دهد و هم دربارهٔ آنچه گفته می‌شود پاسخ دهد. ویدیوی بی‌صدا به‌عنوان ویدیوی بدون گفتار گزارش می‌شود، نه با یک رونویسی خالی، و هر لحظه می‌توانید پردازش یک ویدیوی طولانی را متوقف کنید.

هر پلن سهمیه‌ای برای طول ویدیو دارد که اپراتور تعیین می‌کند؛ مستقل از پلن، هیچ ویدیویی نمی‌تواند از سی دقیقه یا وضوح 4K فراتر برود. قالب‌های پشتیبانی‌شده MP4، MOV، WebM، AVI و MPEG هستند.

دستیار بینایی، و مسیریابی بر اساس نوع پیوست

همهٔ مدل‌ها نمی‌توانند ببینند. وقتی مدلی که به پیام پاسخ می‌دهد فقط متنی است، مدل دومی می‌تواند حداکثر چهار تصویر را برایش توصیف کند، از جمله هر متنی که در آن‌هاست، و به مدل پاسخ‌دهنده گفته می‌شود که از روی یک توصیف کار می‌کند. در گفت‌وگوهای Local-Only و Privacy-First فقط از دستیارهای محلی که از طریق Ollama یا llama.cpp ارائه می‌شوند استفاده می‌شود.

در حالت Auto، مسیریاب مدل‌های نامزد را بر اساس اینکه چقدر خوب با نوع پیوست پیام کنار می‌آیند نیز رتبه‌بندی می‌کند، تا یک تصویر، PDF یا ویدیو معمولاً به مدلی برسد که آن را به‌طور بومی می‌پذیرد، نه اینکه به دستیار تکیه کند.

پرسش‌های پرتکرار

یک یادداشت صوتی یا تصویری چقدر می‌تواند طول بکشد؟
هر ضبط در کادر نوشتن حداکثر پنج دقیقه طول می‌کشد. ویدیوهای بارگذاری‌شده به سهمیهٔ طول ویدیوی پلن شما محدودند و در هیچ پلنی از سی دقیقه یا وضوح 4K فراتر نمی‌روند.
اگر تصویری را برای مدلی بفرستم که نمی‌تواند تصویر ببیند چه می‌شود؟
اگر دستیار بینایی در پلن شما فعال باشد، مدلی با قابلیت دید تصویر را توصیف و متن آن را رونویسی می‌کند، و مدل پاسخ‌دهنده از روی آن توصیف کار می‌کند و می‌داند که با یک توصیف سروکار دارد، نه خودِ تصویر.
آیا ClawAI به خاطر پیوست من مدل دیگری انتخاب می‌کند؟
در حالت Auto، بله: مسیریاب نامزدها را بر اساس توانایی‌شان در کار با نوع پیوست رتبه‌بندی می‌کند. اگر خودتان مدلی را ثابت کنید، انتخاب شما حفظ می‌شود و هر جا دستیار بینایی فعال باشد، کمبود را جبران می‌کند.

به‌جای باور حرف ما، خودتان امتحان کنید

یادداشت‌های صوتی و تصویری، رونویسی و مسیریابی آگاه از نوع ورودی عرضه شده‌اند؛ دستیار بینایی یک ویژگی پلن است که اپراتور با اختصاص دادن یک مدل دستیار آن را روشن می‌کند.