ข้ามไปที่เนื้อหาหลัก

พื้นฐาน

วิธีอ่านเบนช์มาร์ก AI โดยไม่ถูกทำให้เข้าใจผิด

ตัวเลขเบนช์มาร์กดูแม่นยำ ซึ่งทำให้ง่ายที่จะเชื่อมันมากเกินไป คะแนนอย่าง MMLU หรือ HumanEval วัดอะไรจริงๆ วิธีทั่วไปที่ตัวเลขเบนช์มาร์กทำให้เข้าใจผิด และสิ่งที่ควรตรวจสอบก่อนถือว่ามันมีความหมายกับการใช้งานของคุณ

บทความทั้งหมด · ตรวจสอบล่าสุด:

เบนช์มาร์กคือการทดสอบที่คงที่หนึ่งชุด ไม่ใช่มาตรวัดความสามารถทั่วไป

เบนช์มาร์กที่มีชื่อเสียงอย่าง MMLU (ความรู้ทั่วไปแบบเลือกตอบ) HumanEval (โจทย์เขียนโค้ดสั้นๆ) หรือ GSM8K (โจทย์คณิตศาสตร์แบบข้อความระดับประถม) แต่ละอันทดสอบทักษะที่แคบและเฉพาะเจาะจงในรูปแบบที่กำหนด โมเดลอาจได้คะแนนดีในอันหนึ่งและแย่ในงานที่ดูคล้ายกันสำหรับมนุษย์แต่มีโครงสร้างต่างกัน — เช่น การเขียนโค้ดยาวเทียบกับฟังก์ชันสั้นแยกเดี่ยว หรือการเขียนแบบเปิดเทียบกับการจำแบบเลือกตอบ

คำถามเบนช์มาร์กอาจรั่วไหลเข้าไปในข้อมูลฝึก

เบนช์มาร์กยอดนิยมเป็นสาธารณะ และคำถามของมันแพร่หลายอย่างกว้างขวางบนเว็บ ในงานวิจัย และในการสนทนาบนฟอรัม — ซึ่งเป็นข้อความประเภทเดียวกับที่โมเดลขนาดใหญ่ใช้ฝึก เมื่อโมเดลได้เห็นคำตอบมาก่อนแล้วในทางปฏิบัติ คะแนนของมันสะท้อนการจำการทดสอบนั้นๆ ไม่ใช่ความสามารถทั่วไปที่เบนช์มาร์กตั้งใจจะแสดง สิ่งนี้เรียกว่าการปนเปื้อน และผู้อ่านภายนอกยากที่จะตรวจจับได้จากคะแนนเพียงอย่างเดียว

คะแนนที่รายงานอาจขึ้นอยู่อย่างมากกับวิธีที่ถามโมเดล

โมเดลเดียวกันอาจได้คะแนนต่างกันมากขึ้นอยู่กับรูปแบบพรอมป์ต จำนวนตัวอย่างที่แก้แล้วซึ่งแสดงก่อนคำถามจริง และว่าได้รับอนุญาตให้ให้เหตุผลทีละขั้นตอนก่อนตอบหรือไม่ ผู้ให้บริการที่รายงานผลลัพธ์ที่ดีที่สุดภายใต้เงื่อนไขที่เอื้อประโยชน์ไม่ได้โกหก แต่ตัวเลขนั้นอาจไม่เหมือนกับสิ่งที่คุณจะได้จากพรอมป์ตธรรมดาในชีวิตประจำวัน

เบนช์มาร์กอิ่มตัว — และหยุดมีประโยชน์เมื่อโมเดลส่วนใหญ่ผ่านมันได้

เมื่อโมเดลชั้นนำส่วนใหญ่ทำคะแนนใกล้เคียงสูงสุดในเบนช์มาร์กหนึ่ง มันจะหยุดแยกแยะโมเดลเหล่านั้นอย่างมีความหมาย แม้ว่าตัวเลขเก่าจะยังถูกอ้างถึงอยู่บ่อยครั้ง คะแนนที่เกือบสมบูรณ์แบบบนเบนช์มาร์กที่อิ่มตัวบอกอะไรน้อยกว่าที่เคยบอก เบนช์มาร์กใหม่ที่ยากกว่ามักจะเข้ามาแทนที่ และการเปรียบเทียบทางการตลาดที่พึ่งพาตัวเลขเก่าที่อิ่มตัวควรค่าแก่การพิจารณาอีกครั้ง

ค่าเฉลี่ยเดียวซ่อนจุดที่โมเดลลำบากจริงๆ ไว้พอดี

คะแนนเบนช์มาร์กโดยรวมเป็นค่าเฉลี่ยจากคำถามจำนวนมากที่มีความยากและประเภทแตกต่างกัน โมเดลอาจได้ค่าเฉลี่ยดีในขณะที่ไม่น่าเชื่อถือในหมวดหมู่ย่อยเฉพาะที่สำคัญกับคุณ — การให้เหตุผลบางประเภท โดเมนเฉพาะ ความยาวงานบางแบบ ค่าเฉลี่ยคือบทสรุป และบทสรุปทิ้งรายละเอียดที่มักสำคัญที่สุดสำหรับการตัดสินใจจริงไป

มองเบนช์มาร์กเป็นจุดเริ่มต้น ไม่ใช่คำตัดสินสุดท้าย

คะแนนเบนช์มาร์กมีประโยชน์ที่สุดในฐานะตัวกรองเบื้องต้นแบบคร่าวๆ — เพื่อคัดโมเดลที่ไม่เหมาะสมอย่างชัดเจนออก หรือคัดสรรตัวเลือกไม่กี่ตัวที่ควรทดสอบต่อ — มากกว่าที่จะเป็นคำตัดสินสุดท้ายว่าควรใช้โมเดลไหน ดู วิธีประเมินโมเดล AI ว่าอะไรที่ทำนายความเหมาะสมได้จริงเมื่อคุณคัดตัวเลือกให้แคบลงแล้ว นั่นคือการทดสอบบนงานที่เป็นตัวแทนของคุณเอง ซึ่งไม่มีเบนช์มาร์กที่เผยแพร่ตัวใดทดแทนได้

คำถามที่พบบ่อย

เบนช์มาร์กอย่าง MMLU หรือ HumanEval ทดสอบอะไรจริงๆ?
ชุดคำถามที่คงที่และเฉพาะเจาะจงในรูปแบบที่กำหนด — MMLU คือความรู้ทั่วไปแบบเลือกตอบ HumanEval คือโจทย์เขียนโค้ดสั้นๆ แต่ละอันวัดทักษะที่แคบ ไม่ใช่ความฉลาดทั่วไปหรือความสามารถในทุกงาน
ทำไมคะแนนเบนช์มาร์กจากผู้ให้บริการต่างกันบางครั้งดูไม่สอดคล้องกัน?
คะแนนอาจขึ้นอยู่กับรูปแบบพรอมป์ต จำนวนตัวอย่างที่แสดงก่อนคำถามจริง และว่าอนุญาตให้ใช้เหตุผลทีละขั้นตอนหรือไม่ เงื่อนไขการรายงานที่ต่างกันให้ตัวเลขที่ต่างกันสำหรับโมเดลพื้นฐานเดียวกัน
การปนเปื้อนเบนช์มาร์กคืออะไร?
เมื่อคำถามสาธารณะของเบนช์มาร์กไปอยู่ในข้อมูลฝึกของโมเดล ทำให้โมเดลได้เห็นคำตอบมาก่อนแล้วในทางปฏิบัติก่อนถูกทดสอบ คะแนนที่ได้จึงสะท้อนการจำ ไม่ใช่ความสามารถที่เบนช์มาร์กออกแบบมาเพื่อวัด
ฉันควรเพิกเฉยคะแนนเบนช์มาร์กทั้งหมดเลยไหม?
ไม่ควร — มันเป็นตัวกรองเบื้องต้นที่สมเหตุสมผลสำหรับคัดโมเดลที่ไม่เหมาะสมอย่างชัดเจนออกหรือสร้างรายชื่อตัวเลือก เพียงแต่อย่ามองตัวเลขสุดท้ายเป็นคำตัดสิน ทดสอบรายชื่อตัวเลือกบนงานที่เป็นตัวแทนของคุณเองก่อนตัดสินใจ

ลองใช้ดีกว่าอ่านเฉยๆ

ClawAI ไม่เผยแพร่ลีดเดอร์บอร์ดเบนช์มาร์กของตัวเองและไม่อ้างคะแนนเฉพาะของตนสำหรับโมเดลใด — แต่แผงความโปร่งใสด้านการกำหนดเส้นทางแสดงระดับต้นทุน ระดับความหน่วง และความเชื่อมั่นในการกำหนดเส้นทางที่แท้จริงเบื้องหลังคำตอบเฉพาะ เพื่อให้คุณตัดสินคำตอบเทียบกับคำขอของคุณเอง ไม่ใช่ชุดทดสอบที่เผยแพร่ซึ่งคุณตรวจสอบไม่ได้