ฟีเจอร์
AI หลายรูปแบบใน ClawAI: เสียง วิดีโอ และการมองเห็น
ClawAI จัดการบันทึกเสียง บันทึกวิดีโอ และรูปภาพอย่างไร: การถอดเสียง การสุ่มเฟรมวิดีโอ ตัวช่วยด้านการมองเห็นสำหรับโมเดลที่รับได้แค่ข้อความ และการกำหนดเส้นทางตามประเภทไฟล์แนบ
ฟีเจอร์ทั้งหมด · ตรวจสอบล่าสุด:
บันทึกเสียงและวิดีโอจากช่องเขียนข้อความ
ช่องเขียนข้อความมีปุ่มบันทึกสำหรับบันทึกเสียงและวิดีโอ ระบบจะขออนุญาตก่อน แสดงรูปคลื่นเสียงแบบสดระหว่างบันทึก และจำกัดการบันทึกแต่ละครั้งไว้ที่ห้านาที จากนั้นจะถอดเสียง — ลองใช้ Gemini ก่อน และใช้ OpenAI Whisper เป็นตัวสำรอง — และโมเดลที่ตอบจะได้รับแจ้งว่าข้อความนี้มาในรูปแบบบันทึกเสียง จึงตอบสิ่งที่คุณพูด ไม่ใช่ตอบตัวไฟล์
ไฟล์เสียงที่คุณมีอยู่แล้วก็ทำงานแบบเดียวกัน: ไฟล์ WebM, OGG, MP3, MP4 และ M4A, WAV, FLAC และ AAC ที่อัปโหลดจะถูกถอดเสียงก่อนส่งถึงโมเดล
วิดีโอที่โมเดลติดตามได้จริง
วิดีโอที่อัปโหลดจะถูกถอดเสียงพร้อมเวลากำกับ และสุ่มเฟรมได้สูงสุดหกเฟรมต่อวิดีโอเพื่อแสดงให้โมเดลเห็นควบคู่กับคำถอดเสียง โมเดลจึงตอบคำถามได้ทั้งเรื่องสิ่งที่เกิดขึ้นบนหน้าจอและสิ่งที่พูด วิดีโอที่ไม่มีเสียงจะถูกรายงานว่าไม่มีเสียงพูด แทนที่จะได้คำถอดเสียงว่างเปล่า และคุณหยุดการประมวลผลวิดีโอยาวได้ทุกเมื่อ
ทุกแผนมีโควตาความยาววิดีโอที่ผู้ดูแลระบบกำหนด ไม่ว่าจะเป็นแผนใด วิดีโอหนึ่งรายการต้องไม่เกินสามสิบนาทีหรือความละเอียด 4K รูปแบบไฟล์ที่รองรับคือ MP4, MOV, WebM, AVI และ MPEG
ตัวช่วยด้านการมองเห็น และการกำหนดเส้นทางตามประเภทไฟล์แนบ
ไม่ใช่ทุกโมเดลที่มองเห็นภาพได้ เมื่อโมเดลที่ตอบข้อความรับได้แค่ข้อความ โมเดลตัวที่สองสามารถอธิบายรูปภาพให้ได้สูงสุดสี่ภาพ รวมถึงข้อความที่อยู่ในภาพ และโมเดลที่ตอบจะได้รับแจ้งว่ากำลังทำงานจากคำอธิบาย ในบทสนทนาแบบ Local-Only และแบบเน้นความเป็นส่วนตัว จะใช้เฉพาะตัวช่วยในเครื่องที่ให้บริการผ่าน Ollama หรือ llama.cpp เท่านั้น
ในโหมด Auto ตัวกำหนดเส้นทางยังจัดอันดับโมเดลผู้สมัครตามความสามารถในการรับมือกับประเภทไฟล์แนบในข้อความ รูปภาพ PDF หรือวิดีโอจึงมักไปถึงโมเดลที่รับไฟล์นั้นได้โดยตรง แทนที่จะต้องพึ่งตัวช่วย
คำถามที่พบบ่อย
- บันทึกเสียงหรือวิดีโอยาวได้แค่ไหน?
- การบันทึกหนึ่งครั้งจากช่องเขียนข้อความยาวได้สูงสุดห้านาที ส่วนวิดีโอที่อัปโหลดจะถูกจำกัดตามโควตาความยาววิดีโอของแผนคุณ และไม่เกินสามสิบนาทีหรือความละเอียด 4K ในทุกแผน
- จะเกิดอะไรขึ้นถ้าฉันส่งรูปภาพให้โมเดลที่มองไม่เห็นภาพ?
- หากแผนของคุณเปิดใช้ตัวช่วยด้านการมองเห็น โมเดลที่มองเห็นได้จะอธิบายรูปภาพและถอดข้อความในภาพ แล้วโมเดลที่ตอบจะทำงานจากคำอธิบายนั้น โดยรู้ว่ามันเป็นคำอธิบาย ไม่ใช่ตัวภาพจริง
- ClawAI เลือกโมเดลต่างออกไปเพราะไฟล์แนบของฉันหรือไม่?
- ในโหมด Auto ใช่: ตัวกำหนดเส้นทางจัดอันดับผู้สมัครตามความสามารถในการรับมือประเภทไฟล์แนบ หากคุณตรึงโมเดลเอง ระบบจะคงตัวเลือกของคุณไว้ และตัวช่วยด้านการมองเห็นจะเติมช่องว่างในกรณีที่เปิดใช้งาน
ลองใช้เองแทนที่จะเชื่อคำพูดของเรา
บันทึกเสียงและวิดีโอ การถอดเสียง และการกำหนดเส้นทางตามรูปแบบข้อมูลเปิดใช้งานแล้ว ส่วนตัวช่วยด้านการมองเห็นเป็นฟีเจอร์ของแผนที่ผู้ดูแลระบบเปิดได้ด้วยการกำหนดโมเดลตัวช่วย