ข้ามไปที่เนื้อหาหลัก

การจัดการลำดับงาน

ผู้ตัดสิน AI คืออะไร?

ผู้ตัดสิน AI คือโมเดลที่ให้คะแนนคำตอบของโมเดลอื่น มันใช้อย่างไร มีอคติอะไรบ้าง และทำไมมันจึงไม่แทนที่การตรวจสอบจริง

บทความทั้งหมด · ตรวจสอบล่าสุด:

ผู้ตัดสินทำอะไร

ผู้ตัดสินได้รับคำถามเดิมและคำตอบสองอันขึ้นไป แล้วส่งคืนอันดับหรือคะแนน โดยปกติพร้อมเหตุผล มันคือขั้นตอนการเลือกในดีที่สุดจาก N และขั้นตอนการตัดสินเมื่อโมเดลไม่ลงรอยกัน

ความน่าสนใจชัดเจน: มันขยายขนาดได้ในแบบที่การตรวจสอบของมนุษย์ทำไม่ได้ และถูกกว่าคนที่มันเข้าไปแทนที่มาก

อคติ ที่เกิดขึ้นสม่ำเสมอ

ผู้ตัดสินชอบคำตอบยาวมากกว่าสั้น แม้ว่าอันสั้นจะครบถ้วนแล้ว พวกมันชอบถ้อยคำที่มั่นใจมากกว่าถ้อยคำที่ระมัดระวัง ไม่ว่าความมั่นใจนั้นจะมีเหตุผลรองรับหรือไม่ พวกมันไวต่อลำดับที่ผู้สมัครถูกนำเสนอ และโมเดลที่ถูกขอให้ตัดสินผลงานของตัวเองมักจะเอนเอียงไปชอบมัน

ไม่มีอันไหนที่ละเอียดอ่อนเกินไป และทั้งหมดจัดการได้ — สลับลำดับ ใช้โมเดลต่างกันเป็นผู้ตัดสินและผู้เขียน ขอเกณฑ์เฉพาะแทนที่จะเป็นความชอบทั่วไป แต่ต้องจัดการมันโดยตั้งใจ เพราะการตั้งค่าเริ่มต้นแสดงทั้งสี่อย่าง

ผู้ตัดสินไม่ใช่ผู้ตรวจสอบ

ผู้ตัดสินเปรียบเทียบคำตอบกันเอง มันไม่เปรียบเทียบกับความเป็นจริง เมื่อเจอคำตอบผิดสามอัน มันจะจัดอันดับด้วยความมั่นใจ และผู้ชนะก็ยังคงผิดอยู่ดี

ที่ใดมีการตรวจสอบภายนอก — การทดสอบ สคีมา การค้นหา — การตรวจสอบนั้นชนะผู้ตัดสิน เพราะมันเป็นอิสระจากสิ่งที่กำลังถูกตัดสิน ผู้ตัดสินคือสิ่งที่คุณใช้เมื่อไม่มีการตรวจสอบแบบนั้น

คำถามที่พบบ่อย

ผู้ตัดสินควรเป็นโมเดลที่แข็งแกร่งที่สุดไหม?
โดยปกติเป็นโมเดลที่แข็งแกร่ง และควรไม่ใช่ตัวเดียวกับที่เขียนผู้สมัคร การเอนเอียงเข้าข้างตัวเองเป็นเรื่องจริง และวิธีแก้ที่ถูกที่สุดคือใช้โมเดลอื่น
ผู้ตัดสินให้คะแนนคำตอบเดียวได้ไหม?
ได้ แต่การตัดสินเชิงเปรียบเทียบเชื่อถือได้มากกว่าการให้คะแนนแบบสมบูรณ์ โมเดลเก่งกว่าใน «อันไหนดีกว่ากัน» มากกว่า «นี่คือ 7 หรือ 8»
ฉันจะรู้ได้อย่างไรว่าผู้ตัดสินถูกต้อง?
ตรวจสอบมันด้วยตัวอย่างเทียบกับการตัดสินของคุณเอง หากคุณไม่เคยตรวจสอบเลย คุณก็แค่ย้ายความไว้วางใจไป ไม่ได้สร้างมันขึ้นมา

ลองใช้ดีกว่าอ่านเฉยๆ

ClawAI รันการตัดสินเป็นพื้นที่ของตัวเองเหนือการเปรียบเทียบหนึ่งครั้ง คำตอบที่ให้คะแนนแล้วจึงบันทึกทั้งโมเดลที่เขียนผู้สมัครและโมเดลที่ตัดสินพวกมัน