ฟีเจอร์
การค้นคว้าแบบบรรยายขั้นตอนและการไล่เก็บข้อมูลเว็บใน ClawAI
ClawAI ค้นคว้าเว็บอย่างไร: ตัววางแผนที่เลือกว่าจะค้นหาหรือไล่เก็บข้อมูลเว็บไซต์ บันทึกการทำงานแบบบรรยายสด การดึงหน้าเว็บแบบเป็นลำดับขั้นที่เคารพ robots.txt และแหล่งอ้างอิงที่ระบุชัดเจน
ฟีเจอร์ทั้งหมด · ตรวจสอบล่าสุด:
ตัววางแผนเป็นผู้ตัดสิน ไม่ใช่คีย์เวิร์ด
ในโหมดค้นคว้าแบบ Auto โมเดลวางแผนจะอ่านข้อความและเลือกหนึ่งในสี่เส้นทาง: ตอบจากสิ่งที่รู้อยู่แล้ว ค้นหาบนเว็บ ไล่เก็บข้อมูลเว็บไซต์ที่ระบุ หรือไล่เก็บข้อมูลแล้วค้นหาต่อ ลิงก์ที่คุณวางจะถูกเปิดเสมอ หากโมเดลวางแผนส่งผลลัพธ์ที่ใช้ไม่ได้กลับมา ระบบจะลองโมเดลถัดไป แทนที่จะหยุดการค้นคว้าไปเงียบ ๆ
คุณยังเลือกโหมดเองได้ที่ช่องเขียนข้อความ: ปิด, Auto, ค้นหาอย่างเดียว, ค้นหาและดึงหน้าเว็บ หรือค้นหาและสกัดเนื้อหาแบบมีโครงสร้าง
บันทึกการทำงานที่คุณติดตามดูได้
ทุกขั้นตอน — แผน ทุกการค้นหา ทุกหน้าที่ดึงมาหรือข้ามไป — จะถูกสตรีมเข้าสู่บันทึกแบบบรรยายเหนือคำตอบขณะที่เกิดขึ้น และบันทึกไว้พร้อมคำตอบ จึงยังอยู่แม้รีเฟรชหน้า แหล่งที่คำตอบใช้อ้างอิงจะแสดงไว้ด้วย คุณจึงเปิดตรวจสอบเองได้
การดึงหน้าเว็บแบบเป็นลำดับขั้นที่ทำตามกติกา
หน้าเว็บจะถูกดึงจากวิธีที่ประหยัดที่สุดก่อน: API ทางการของเว็บไซต์หากมี ต่อด้วยคำขอ HTTP ธรรมดา แล้วจึงยกระดับไปใช้เบราว์เซอร์แบบไม่มีหน้าจอเฉพาะเมื่อหน้านั้นจำเป็น โดยมีบริการอ่านหน้าเว็บและสแนปช็อตจากคลังเก็บถาวรเป็นตัวสำรองลำดับถัดไป การไล่เก็บข้อมูลหนึ่งครั้งครอบคลุมได้สูงสุดสองร้อยหน้าของเว็บไซต์เดียว
robots.txt ได้รับการเคารพในทุกการดึงภายใต้ user agent ClawAI-ResearchBot และหน้าที่ถูกห้ามจะไม่ถูกลองซ้ำด้วยวิธีอื่น หน้าที่ต้องเข้าสู่ระบบและการปิดกั้นทางกฎหมายจะหยุดการดึง ไม่มีการไข captcha ทุกการเปลี่ยนเส้นทางถูกตรวจสอบกับที่อยู่เครือข่ายส่วนตัว และสำเนาจากคลังเก็บถาวรจะถูกระบุว่าเป็นสำเนาเสมอ
คำถามที่พบบ่อย
- ClawAI เคารพ robots.txt หรือไม่?
- เคารพ ในทุกการดึงหน้าเว็บ ภายใต้ user agent ClawAI-ResearchBot หน้าที่ robots.txt ห้ามไว้จะถูกข้าม และไม่ถูกลองซ้ำผ่านวิธีการดึงแบบอื่น
- ฉันดูได้ไหมว่าการค้นคว้าทำอะไรไปบ้างจริง ๆ?
- ได้ บันทึกการทำงานแบบบรรยายแสดงแผน การค้นหาแต่ละครั้ง และแต่ละหน้าที่ดึงมาหรือข้ามไป โดยบันทึกไว้พร้อมคำตอบและรายการแหล่งที่ใช้
- การค้นคว้าเว็บมีในทุกแผนหรือไม่?
- โหมดการค้นคว้าเป็นฟีเจอร์ของแผน (RESEARCH_MODE, WEB_SEARCH, WEB_FETCH และ WEB_EXTRACT) ซึ่งมีโควตาของตัวเองที่ผู้ดูแลระบบกำหนดตามแผน หน้าราคาแสดงว่าแต่ละแผนมีอะไรบ้าง
ลองใช้เองแทนที่จะเชื่อคำพูดของเรา
วงจรการค้นคว้าทำงานในบริการค้นคว้าของตัวเอง โดยมีลำดับขั้นการดึงที่ผู้ดูแลแก้ไขได้ และคิดการใช้งานบนพื้นผิวของตัวเอง ไม่ใช่นับเป็นโทเค็นแชทปกติ