การเปรียบเทียบ LLM

การเปรียบเทียบ LLM แบบใหม่: นำการตัดสินของมนุษย์กลับคืนมา

หากคุณพิจารณาเฉพาะคะแนนอัตโนมัติ ระบบจัดการเนื้อหาทางกฎหมาย (LLM) ส่วนใหญ่ดูเหมือนจะดีเยี่ยม จนกระทั่งมันเขียนอะไรบางอย่างที่ผิดพลาดเล็กน้อย เสี่ยง หรือไม่เหมาะสม นั่นคือช่องว่างระหว่างสิ่งที่การวัดผลแบบคงที่วัดได้กับสิ่งที่ผู้ใช้ของคุณต้องการจริงๆ ในคู่มือนี้ เราจะแสดงวิธีผสมผสานการตัดสินใจของมนุษย์ (HITL) กับระบบอัตโนมัติ เพื่อให้การวัดผล LLM ของคุณ สะท้อนถึงความถูกต้อง ความปลอดภัย และความเหมาะสมกับโดเมน ไม่ใช่แค่ความถูกต้องในระดับโทเค็นเท่านั้น

การวัดผล LLM Benchmarking จริงๆ คืออะไร

เมตริกและลีดเดอร์บอร์ดอัตโนมัติมีความรวดเร็วและทำซ้ำได้ ความแม่นยำในงานแบบเลือกตอบ BLEU/ROUGE สำหรับความคล้ายคลึงของข้อความ และความสับสนในการสร้างแบบจำลองภาษา ล้วนส่งสัญญาณบอกทิศทาง แต่บ่อยครั้งที่สิ่งเหล่านี้มักพลาดลำดับเหตุผล การหาข้อเท็จจริง และการปฏิบัติตามนโยบาย โดยเฉพาะอย่างยิ่งในบริบทที่มีความเสี่ยงสูง นั่นคือเหตุผลที่โปรแกรมสมัยใหม่จึงเน้นที่การรายงานแบบหลายเมตริก ความโปร่งใส และความสมจริงของสถานการณ์

เมตริกอัตโนมัติและชุดทดสอบแบบคงที่

ลองนึกถึงตัวชี้วัดแบบคลาสสิกอย่างเช่นมาตรวัดความเร็ว — มันยอดเยี่ยมสำหรับการบอกคุณว่าคุณขับเร็วแค่ไหนบนทางหลวงที่ราบเรียบ แต่พวกมันไม่ได้บอกคุณว่าเบรกทำงานได้ดีหรือไม่ในขณะฝนตก BLEU/ROUGE/ความซับซ้อนช่วยในการเปรียบเทียบ แต่ก็สามารถถูกหลอกลวงได้ด้วยการท่องจำหรือการจับคู่แบบผิวเผิน

ที่พวกเขาพลาดไป

ผู้ใช้จริงมักนำความกำกวม ศัพท์เฉพาะทาง เป้าหมายที่ขัดแย้งกัน และกฎระเบียบที่เปลี่ยนแปลงไป ชุดทดสอบแบบคงที่มักไม่สามารถตรวจจับสิ่งเหล่านี้ได้ ส่งผลให้เกณฑ์มาตรฐานอัตโนมัติล้วนๆ ประเมินความพร้อมของแบบจำลองสำหรับงานองค์กรที่ซับซ้อนสูงเกินไป ความพยายามของชุมชนอย่าง HELM/AIR-Bench ช่วยแก้ไขปัญหานี้โดยครอบคลุมมิติต่างๆ มากขึ้น (ความทนทาน ความปลอดภัย การเปิดเผยข้อมูล) และเผยแพร่ชุดทดสอบที่โปร่งใสและพัฒนาขึ้นเรื่อยๆ

กรณีสำหรับการประเมินมนุษย์ในเกณฑ์มาตรฐาน LLM

คุณสมบัติบางอย่างยังคงเป็นเอกลักษณ์ของมนุษย์อย่างเหนียวแน่น ได้แก่ น้ำเสียง ความช่วยเหลือ ความถูกต้องอย่างละเอียดอ่อน ความเหมาะสมทางวัฒนธรรม และความเสี่ยง ผู้ประเมินที่เป็นมนุษย์—ที่ได้รับการฝึกฝนและปรับเทียบอย่างเหมาะสม—คือเครื่องมือที่ดีที่สุดที่เรามีสำหรับสิ่งเหล่านี้ เคล็ดลับคือการใช้พวกเขาอย่างเลือกสรรและเป็นระบบเพื่อให้ต้นทุนยังคงอยู่ในระดับที่จัดการได้ ในขณะที่คุณภาพยังคงสูง

เมื่อใดจึงจะเกี่ยวข้องกับมนุษย์

เมื่อใดจึงจะเกี่ยวข้องกับมนุษย์

  • ความคลุมเครือ: คำแนะนำยอมรับคำตอบที่สมเหตุสมผลหลายข้อ
  • ความเสี่ยงสูง: การดูแลสุขภาพ การเงิน กฎหมาย การสนับสนุนที่สำคัญด้านความปลอดภัย
  • ความแตกต่างของโดเมน: ศัพท์แสงทางอุตสาหกรรม การใช้เหตุผลเฉพาะทาง
  • สัญญาณความขัดแย้ง: คะแนนอัตโนมัติขัดแย้งหรือแตกต่างกันอย่างมาก

การออกแบบเกณฑ์และการสอบเทียบ (ตัวอย่างง่ายๆ)

เริ่มต้นด้วยการให้คะแนน 1-5 สำหรับความถูกต้องความสมเหตุสมผลและความสอดคล้องกับนโยบาย จัดเตรียมตัวอย่างประกอบคำอธิบาย 2-3 ตัวอย่างต่อคะแนน ดำเนินการสอบเทียบ สั้นๆ : ผู้ประเมินให้คะแนนชุดข้อมูลเดียวกัน จากนั้นเปรียบเทียบเหตุผลเพื่อเพิ่มความสอดคล้อง ติดตามความสอดคล้องระหว่างผู้ประเมิน และกำหนดให้มีการตัดสินในกรณีที่คลุมเครือ

วิธีการ: จาก LLM ในฐานะผู้พิพากษา สู่ HITL ที่แท้จริง

การใช้แบบจำลอง LLM เป็นผู้ประเมิน (การใช้แบบจำลองหนึ่งประเมินแบบจำลองอีกแบบหนึ่ง) มีประโยชน์สำหรับการคัดกรองเบื้องต้นเพราะรวดเร็ว ราคาประหยัด และใช้งานได้ดีสำหรับการตรวจสอบที่ไม่ซับซ้อน แต่ก็อาจมีจุดบอดเช่นเดียวกัน เช่น ภาพหลอน ความสัมพันธ์ที่ผิดพลาด หรือ "การให้คะแนนสูงเกินจริง" ควรใช้เพื่อจัดลำดับความสำคัญของกรณีต่างๆ สำหรับการตรวจสอบโดยมนุษย์ ไม่ใช่ใช้แทนการตรวจสอบโดยมนุษย์

ท่อส่งไฮบริดที่ใช้งานได้จริง

ท่อส่งไฮบริดที่ใช้งานได้จริง

  1. การคัดกรองล่วงหน้าอัตโนมัติ: เรียกใช้เมตริกงาน การป้องกันพื้นฐาน และ LLM-as-judge เพื่อกรองการผ่าน/ไม่ผ่านที่ชัดเจน
  2. การเลือกใช้งาน: เลือกตัวอย่างที่มีสัญญาณขัดแย้งหรือความไม่แน่นอนสูงสำหรับการตรวจสอบโดยมนุษย์
  3. คำอธิบายโดยผู้เชี่ยวชาญ: ผู้ให้คะแนนที่ผ่านการฝึกอบรม (หรือผู้เชี่ยวชาญเฉพาะด้าน) ให้คะแนนตามหลักเกณฑ์ที่ชัดเจน ตัดสินข้อขัดแย้ง
  4. การประกันคุณภาพ: ตรวจสอบความน่าเชื่อถือของผู้ประเมินร่วม เก็บรักษาบันทึกการตรวจสอบและเหตุผลประกอบ สมุดบันทึกที่ลงมือปฏิบัติจริง (เช่น เวิร์กโฟลว์ HITL) ช่วยให้สร้างต้นแบบวงจรนี้ได้ง่ายก่อนที่จะขยายขนาด

ตารางเปรียบเทียบ: อัตโนมัติ เทียบกับ LLM-as-Judge เทียบกับ HITL

เข้าใกล้ จุดแข็ง จุดอ่อน การใช้งานที่ดีที่สุด
เมตริกอัตโนมัติ รวดเร็ว ทำซ้ำได้ ราคาถูก ขาดความละเอียดอ่อน/การใช้เหตุผล ง่ายต่อการปรับให้เหมาะสมเกินไป การตรวจสอบพื้นฐานและการถดถอย
LLM-ในฐานะผู้พิพากษา ปรับขนาดการคัดแยกและระบุปัญหา แบ่งปันความลำเอียงของแบบจำลอง ไม่ใช่ระดับการตรวจสอบ ให้ความสำคัญกับการตรวจสอบของมนุษย์
HITL (ผู้ประเมินผู้เชี่ยวชาญ) จับรายละเอียดได้ชัดเจน พร้อมสำหรับการตรวจสอบ ช้ากว่า แพงกว่า หากไม่มีการแบ่งประเภท งานที่มีความเสี่ยงสูง นโยบาย/ประตูความปลอดภัย

เคล็ดลับ: รวมทั้งสามอย่างเพื่อความครอบคลุมและความน่าเชื่อถือ

เกณฑ์มาตรฐานความปลอดภัยและความเสี่ยงแตกต่างกัน

หน่วยงานกำกับดูแลและองค์กรกำหนดมาตรฐานคาดหวังการประเมินที่บันทึกความเสี่ยง ทดสอบ สถานการณ์ ที่สมจริงและแสดงให้เห็นถึงการกำกับดูแลNIST AI RMF (2024 GenAI Profile)ให้คำศัพท์และแนวปฏิบัติร่วมกัน โปรแกรม การประเมิน NIST GenAIกำลังจัดตั้งการทดสอบเฉพาะด้าน และHELM/AIR-Benchเน้นผลลัพธ์ที่โปร่งใสและครอบคลุมหลายตัวชี้วัด ใช้สิ่งเหล่านี้เป็นพื้นฐานในการสร้างเรื่องราวการกำกับดูแลของคุณ

สิ่งที่ต้องรวบรวมสำหรับการตรวจสอบความปลอดภัย

สิ่งที่ต้องรวบรวมสำหรับการตรวจสอบความปลอดภัย

  • การประเมินผล โปรโตคอล, รูบริกและ การฝึกอบรมผู้ให้คำอธิบายประกอบ วัสดุ
  • สายข้อมูล และการตรวจสอบการปนเปื้อน
  • ผู้ประเมินร่วม สถิติและหมายเหตุการตัดสิน
  • เวอร์ชัน ผลการประเมินประสิทธิภาพและประวัติการถดถอย

แอลแอลเอ็ม โซลูชั่น

เรื่องราวย่อ: การตัดผลบวกปลอมใน KYC ของธนาคาร

ทีมวิเคราะห์ KYC ของธนาคารแห่งหนึ่งได้ทดสอบโมเดลสองแบบสำหรับการสรุปการแจ้งเตือนด้านการปฏิบัติตามกฎระเบียบ คะแนนอัตโนมัติเหมือนกันทุกประการ ในระหว่างการตรวจสอบด้วย HITL ผู้ประเมินได้ชี้ให้เห็นว่าโมเดล Aมักละเว้น คำอธิบาย เชิงลบ (“ไม่มีประวัติการลงโทษมาก่อน”) ซึ่งทำให้ความหมายสลับกัน หลังจากกระบวนการตัดสิน ธนาคารจึงเลือกใช้โมเดล Bและปรับปรุงข้อความแจ้งเตือน อัตราการแจ้งเตือนผิดพลาดลดลง 18% ในหนึ่งสัปดาห์ ทำให้ทีมวิเคราะห์มีเวลาว่างสำหรับการตรวจสอบที่แท้จริง (บทเรียน: คะแนนอัตโนมัติพลาดข้อผิดพลาดเล็กน้อยที่มีผลกระทบสูง แต่ HITL ตรวจพบได้)

Shaip ช่วยเหลือที่ไหน

ผสานรวมระบบเมตริกอัตโนมัติเข้ากับการประเมินโดยมนุษย์ในงานที่มีความเสี่ยงสูงหรือคลุมเครือ บันทึกเกณฑ์การประเมิน การสอบเทียบผู้ประเมิน และการตัดสินเพื่อการตรวจสอบ จัดทำรายงานให้สอดคล้องกับส่วนงาน NIST RMF ที่คุณสนใจ

มนุษย์สามารถจับรายละเอียดเล็กๆ น้อยๆ ได้ เช่น โทนเสียง บริบท ความถูกต้องที่ลึกซึ้ง และการจัดแนวนโยบาย ซึ่งคะแนนอัตโนมัติไม่สามารถจับได้ ควรใช้ข้อมูลเหล่านี้ในกรณีที่มีความไม่แน่นอนสูงหรือมีความเสี่ยงสูง

ไม่ จำเป็นแต่ไม่เพียงพอ ความปลอดภัยจำเป็นต้องมีการทดสอบตามสถานการณ์จริง กรณีความเสี่ยง/การละเมิดที่ชัดเจน และการกำกับดูแลโดยมนุษย์ ดูคำแนะนำของ NIST GenAI และ HELM/AIR-Bench

เหมาะสำหรับการคัดกรองและปรับขนาด แต่มีความลำเอียงแบบเดียวกับโมเดล ใช้เพื่อจัดลำดับความสำคัญ ไม่ใช่แทนที่การตรวจสอบโดยมนุษย์ในงานที่ซับซ้อน

ตรวจสอบศูนย์ชุมชน เช่น HELM/AIR-Bench (ความปลอดภัย/ความทนทาน) และชุดอุปกรณ์เฉพาะด้านที่สอดคล้องกับความเสี่ยงของคุณ รักษาชุดอุปกรณ์ให้สดใหม่เพื่อหลีกเลี่ยงการปนเปื้อน

ชอบบทความนี้ไหม? ติดตาม Shaip บน LinkedIn เพื่อรับข้อมูลอัปเดตเพิ่มเติม

แบ่งปันสังคม