قابلیت
هوش مصنوعی چندوجهی در ClawAI: صدا، ویدیو و بینایی
ClawAI چگونه با یادداشتهای صوتی، یادداشتهای ویدیویی و تصاویر کار میکند: رونویسی، نمونهبرداری از فریمهای ویدیو، دستیار بینایی برای مدلهای متنی و مسیریابی بر اساس نوع پیوست.
همه امکانات · آخرین بازبینی:
یادداشت صوتی و تصویری از همان کادر نوشتن
کادر نوشتن یک دکمهٔ ضبط برای یادداشتهای صوتی و تصویری دارد. ابتدا اجازه میگیرد، هنگام ضبط شکل موج زنده نشان میدهد و هر ضبط را به پنج دقیقه محدود میکند. ضبط رونویسی میشود — ابتدا Gemini امتحان میشود و OpenAI Whisper جایگزین است — و به مدل پاسخدهنده گفته میشود که پیام بهصورت یادداشت صوتی رسیده است، تا به آنچه گفتهاید پاسخ دهد، نه به یک فایل.
صداهایی که از قبل دارید هم همینطور کار میکنند: فایلهای بارگذاریشدهٔ WebM، OGG، MP3، MP4 و M4A، WAV، FLAC و AAC پیش از رسیدن به مدل رونویسی میشوند.
ویدیویی که مدل واقعاً میتواند دنبالش کند
ویدیوی بارگذاریشده همراه با برچسبهای زمانی رونویسی میشود و از هر ویدیو حداکثر شش فریم نمونهبرداری و در کنار متن رونویسی به مدل نشان داده میشود، تا بتواند هم دربارهٔ آنچه روی صفحه رخ میدهد و هم دربارهٔ آنچه گفته میشود پاسخ دهد. ویدیوی بیصدا بهعنوان ویدیوی بدون گفتار گزارش میشود، نه با یک رونویسی خالی، و هر لحظه میتوانید پردازش یک ویدیوی طولانی را متوقف کنید.
هر پلن سهمیهای برای طول ویدیو دارد که اپراتور تعیین میکند؛ مستقل از پلن، هیچ ویدیویی نمیتواند از سی دقیقه یا وضوح 4K فراتر برود. قالبهای پشتیبانیشده MP4، MOV، WebM، AVI و MPEG هستند.
دستیار بینایی، و مسیریابی بر اساس نوع پیوست
همهٔ مدلها نمیتوانند ببینند. وقتی مدلی که به پیام پاسخ میدهد فقط متنی است، مدل دومی میتواند حداکثر چهار تصویر را برایش توصیف کند، از جمله هر متنی که در آنهاست، و به مدل پاسخدهنده گفته میشود که از روی یک توصیف کار میکند. در گفتوگوهای Local-Only و Privacy-First فقط از دستیارهای محلی که از طریق Ollama یا llama.cpp ارائه میشوند استفاده میشود.
در حالت Auto، مسیریاب مدلهای نامزد را بر اساس اینکه چقدر خوب با نوع پیوست پیام کنار میآیند نیز رتبهبندی میکند، تا یک تصویر، PDF یا ویدیو معمولاً به مدلی برسد که آن را بهطور بومی میپذیرد، نه اینکه به دستیار تکیه کند.
پرسشهای پرتکرار
- یک یادداشت صوتی یا تصویری چقدر میتواند طول بکشد؟
- هر ضبط در کادر نوشتن حداکثر پنج دقیقه طول میکشد. ویدیوهای بارگذاریشده به سهمیهٔ طول ویدیوی پلن شما محدودند و در هیچ پلنی از سی دقیقه یا وضوح 4K فراتر نمیروند.
- اگر تصویری را برای مدلی بفرستم که نمیتواند تصویر ببیند چه میشود؟
- اگر دستیار بینایی در پلن شما فعال باشد، مدلی با قابلیت دید تصویر را توصیف و متن آن را رونویسی میکند، و مدل پاسخدهنده از روی آن توصیف کار میکند و میداند که با یک توصیف سروکار دارد، نه خودِ تصویر.
- آیا ClawAI به خاطر پیوست من مدل دیگری انتخاب میکند؟
- در حالت Auto، بله: مسیریاب نامزدها را بر اساس تواناییشان در کار با نوع پیوست رتبهبندی میکند. اگر خودتان مدلی را ثابت کنید، انتخاب شما حفظ میشود و هر جا دستیار بینایی فعال باشد، کمبود را جبران میکند.
بهجای باور حرف ما، خودتان امتحان کنید
یادداشتهای صوتی و تصویری، رونویسی و مسیریابی آگاه از نوع ورودی عرضه شدهاند؛ دستیار بینایی یک ویژگی پلن است که اپراتور با اختصاص دادن یک مدل دستیار آن را روشن میکند.