ข้อมูลการฝึกอบรม AI

Data Wars 2024: การต่อสู้ทางจริยธรรมและการปฏิบัติของการฝึกอบรม AI

หากคุณขอให้โมเดล Gen AI เขียนเนื้อเพลงให้กับเพลงแบบที่วง Beatles และถ้ามันทำงานได้อย่างน่าประทับใจ ก็มีเหตุผลอยู่ หรือหากคุณขอให้นางแบบเขียนร้อยแก้วในสไตล์ของนักเขียนคนโปรดและโมเดลนั้นเลียนแบบสไตล์นั้นจริงๆ ก็มีเหตุผลอยู่

แม้กระทั่งคุณอยู่ในประเทศอื่น และเมื่อคุณต้องการแปลชื่อของขนมที่น่าสนใจที่คุณพบตามทางเดินในซุปเปอร์มาร์เก็ต สมาร์ทโฟนของคุณจะตรวจจับฉลากและแปลข้อความได้อย่างราบรื่น

AI ยืนอยู่ที่จุดศูนย์กลางของความเป็นไปได้ทั้งหมด และสาเหตุหลักมาจากโมเดล AI จะได้รับการฝึกฝนเกี่ยวกับข้อมูลดังกล่าวจำนวนมหาศาล ในกรณีของเรา เพลงของ The Beatles หลายร้อยเพลง และอาจเป็นหนังสือจากนักเขียนคนโปรดของคุณ

ด้วยการเติบโตของปัญญาประดิษฐ์เชิงสร้างสรรค์ (Generative AI) ทุกคนจึงสามารถเป็นนักดนตรี นักเขียน ศิลปิน หรือทั้งหมดนี้ได้พร้อมกัน โมเดล Gen AI สามารถสร้างสรรค์งานศิลปะเฉพาะบุคคลได้ในเวลาเพียงไม่กี่วินาที ขึ้นอยู่กับคำสั่งของผู้ใช้ พวกมันสามารถสร้าง งานศิลปะ สไตล์แวนโกห์และแม้กระทั่งให้แอล ปาชิโนอ่านข้อกำหนดและเงื่อนไขการใช้งานโดยที่เขาไม่ได้อยู่ตรงนั้นด้วย ซ้ำ

นอกเหนือจากความหลงใหลแล้ว สิ่งสำคัญที่นี่คือจริยธรรม ยุติธรรมหรือไม่ที่ผลงานสร้างสรรค์ดังกล่าวได้ถูกนำมาใช้ในการฝึกโมเดล AI ซึ่งกำลังค่อยๆ พยายามที่จะเข้ามาแทนที่ศิลปิน ได้รับความยินยอมจากเจ้าของทรัพย์สินทางปัญญาดังกล่าวหรือไม่ พวกเขาได้รับการชดเชยอย่างยุติธรรมหรือไม่?

ยินดีต้อนรับสู่ปี 2024: ปีแห่งสงครามข้อมูล

ในช่วงไม่กี่ปีที่ผ่านมา ข้อมูลได้กลายเป็นแม่เหล็กดึงดูดความสนใจของบริษัทต่างๆ ให้ฝึกฝนโมเดล Gen AI ของตน เช่นเดียวกับเด็กทารก โมเดล AI ก็ไร้เดียงสา พวกเขาจะต้องได้รับการสอนและฝึกฝน นั่นคือเหตุผลที่บริษัทต่างๆ ต้องการข้อมูลนับพันล้านหรือหลายล้านเพื่อฝึกโมเดลเทียมเพื่อเลียนแบบมนุษย์

ตัวอย่างเช่น GPT-3 ได้รับการฝึกฝนเกี่ยวกับโทเค็นหลายพันล้าน (หลายร้อยโทเค็น) ซึ่งแปลเป็นคำศัพท์อย่างหลวม ๆ อย่างไรก็ตาม แหล่งข่าวเปิดเผยว่ามีการใช้โทเค็นดังกล่าวหลายล้านล้านเหรียญเพื่อฝึกโมเดลล่าสุด

ด้วยชุดข้อมูลการฝึกอบรมจำนวนมหาศาลที่จำเป็นต้องมี บริษัทเทคโนโลยีขนาดใหญ่จะไปอยู่ที่ไหน?

การขาดแคลนข้อมูลการฝึกอบรมอย่างเฉียบพลัน

ความทะเยอทะยานและปริมาณเป็นของคู่กัน ในขณะที่องค์กรขยายขนาดโมเดลและเพิ่มประสิทธิภาพ พวกเขาต้องการข้อมูลการฝึกอบรมเพิ่มมากขึ้น ซึ่งอาจเกิดจากความต้องการในการเปิดเผยโมเดล GPT รุ่นต่อๆ ไป หรือเพียงแค่มอบผลลัพธ์ที่ได้รับการปรับปรุงและแม่นยำ

ไม่ว่าในกรณีใด การจำเป็นต้องมีข้อมูลการฝึกอบรมจำนวนมากเป็นสิ่งที่หลีกเลี่ยงไม่ได้

นี่คือจุดที่องค์กรต่างๆ เผชิญกับสิ่งกีดขวางบนถนนครั้งแรก พูดง่ายๆ ก็คืออินเทอร์เน็ตมีขนาดเล็กเกินไปสำหรับโมเดล AI ที่จะฝึกฝนได้ หมายความว่าบริษัทต่างๆ กำลังจะหมดชุดข้อมูลที่มีอยู่เพื่อป้อนและฝึกอบรมโมเดลของตน

ทรัพยากรที่ลดลงนี้กำลังหลอกผู้มีส่วนได้ส่วนเสียและผู้ที่ชื่นชอบเทคโนโลยี เนื่องจากอาจจำกัดการพัฒนาและวิวัฒนาการของโมเดล AI ซึ่งส่วนใหญ่เชื่อมโยงอย่างใกล้ชิดกับวิธีที่แบรนด์ต่างๆ วางตำแหน่งผลิตภัณฑ์ของตน และวิธีที่มองว่าข้อกังวลที่แพร่ระบาดในโลกนี้ได้รับการแก้ไขด้วยการขับเคลื่อนด้วย AI โซลูชั่น

ขณะเดียวกัน ยังมีความหวังในรูปแบบของข้อมูลสังเคราะห์หรือการผสมพันธุ์ทางดิจิทัลตามที่เราเรียกกัน ในแง่ของบุคคลธรรมดา ข้อมูลสังเคราะห์คือข้อมูลการฝึกที่สร้างโดย AI ซึ่งจะถูกนำไปใช้ในการฝึกโมเดลอีกครั้ง

แม้ว่าฟังดูมีแนวโน้มดี แต่ผู้เชี่ยวชาญด้านเทคโนโลยีเชื่อว่าการสังเคราะห์ข้อมูลการฝึกอบรมดังกล่าวจะนำไปสู่สิ่งที่เรียกว่า Habsburg AI นี่เป็นข้อกังวลหลักสำหรับองค์กรต่างๆ เนื่องจากชุดข้อมูลที่มีมาแต่กำเนิดอาจมีข้อผิดพลาดทางข้อเท็จจริง อคติ หรือเพียงแค่พูดไม่ชัด ซึ่งส่งผลเสียต่อผลลัพธ์จากโมเดล AI

คิดว่านี่เป็นเกม Chinese Whisper แต่สิ่งเดียวที่หักมุมคือคำแรกที่ส่งต่ออาจไม่มีความหมายเช่นกัน

การแข่งขันเพื่อการจัดหาข้อมูลการฝึกอบรม AI

การจัดหาข้อมูลการฝึกอบรม AI การออกใบอนุญาตเป็นวิธีที่ดีเยี่ยมในการจัดหาข้อมูลการฝึกอบรม แม้ว่าห้องสมุดและแหล่งเก็บข้อมูลจะมีศักยภาพ แต่แหล่งที่มาก็มีจำกัด หมายความว่าอุปกรณ์เหล่านี้ไม่เพียงพอต่อข้อกำหนดด้านปริมาณของโมเดลขนาดใหญ่ ส่วนแบ่งทางสถิติที่น่าสนใจซึ่งเราอาจหมดข้อมูลคุณภาพสูงเพื่อฝึกโมเดลภายในปี 2026 โดยชั่งน้ำหนักความพร้อมใช้งานของข้อมูลให้ทัดเทียมกับทรัพยากรทางกายภาพอื่นๆ ในโลกแห่งความเป็นจริง

หนึ่งในคลังภาพที่ใหญ่ที่สุด – Shutterstock มีรูปภาพ 300 ล้านภาพ แม้ว่าการเริ่มต้นการฝึกอบรม การทดสอบ การตรวจสอบ และการเพิ่มประสิทธิภาพจะเพียงพอแล้ว แต่ก็ต้องอาศัยข้อมูลจำนวนมากอีกครั้ง

อย่างไรก็ตาม ยังมีแหล่งข้อมูลอื่นอยู่ด้วย สิ่งเดียวที่จับได้คือมีรหัสสีเป็นสีเทา เรากำลังพูดถึงข้อมูลที่เปิดเผยต่อสาธารณะจากอินเทอร์เน็ต นี่คือข้อเท็จจริงที่น่าสนใจบางประการ:

  • มีการโพสต์บล็อกมากกว่า 7.5 ล้านโพสต์ทุกวัน
  • มีผู้คนมากกว่า 5.4 พันล้านคนบนแพลตฟอร์มโซเชียลมีเดียเช่น Instagram, X, Snapchat, TikTok และอีกมากมาย
  • มีเว็บไซต์มากกว่า 1.8 พันล้านเว็บไซต์บนอินเทอร์เน็ต
  • มีการอัปโหลดวิดีโอมากกว่า 3.7 ล้านรายการบน YouTube เพียงอย่างเดียวทุกวัน

นอกจากนี้ ผู้คนยังแชร์ข้อความ วิดีโอ รูปภาพ และแม้แต่ความเชี่ยวชาญเฉพาะด้านต่อสาธารณะผ่านพอดแคสต์ที่มีแต่เสียงเท่านั้น

สิ่งเหล่านี้เป็นเนื้อหาที่มีอยู่อย่างชัดเจน

ดังนั้นการใช้มันเพื่อฝึกโมเดล AI จะต้องยุติธรรมใช่ไหม?

นี่คือพื้นที่สีเทาที่เรากล่าวถึงก่อนหน้านี้ ไม่มีความคิดเห็นที่จริงจังและรวดเร็วสำหรับคำถามนี้ เนื่องจากบริษัทเทคโนโลยีที่สามารถเข้าถึงข้อมูลจำนวนมหาศาลดังกล่าวกำลังมาพร้อมกับเครื่องมือใหม่และการแก้ไขนโยบายเพื่อรองรับความต้องการนี้

เครื่องมือบางอย่างเปลี่ยนเสียงจากวิดีโอ YouTube ให้เป็นข้อความแล้วใช้เป็นโทเค็นสำหรับการฝึกอบรม องค์กรต่างๆ กำลังทบทวนนโยบายความเป็นส่วนตัว และถึงขั้นใช้ข้อมูลสาธารณะเพื่อฝึกอบรมโมเดลที่มีเจตนาที่กำหนดไว้ล่วงหน้าในการเผชิญกับการฟ้องร้อง

กลไกตอบโต้

ในเวลาเดียวกัน บริษัทต่างๆ ต่างก็กำลังพัฒนาสิ่งที่เรียกว่าข้อมูลสังเคราะห์ โดยที่แบบจำลอง AI จะสร้างข้อความที่สามารถนำมาใช้ในการฝึกแบบจำลองแบบวนซ้ำได้อีกครั้ง

ในทางกลับกัน เพื่อตอบโต้การสูญเสียข้อมูลและป้องกันไม่ให้องค์กรแสวงหาประโยชน์จากช่องโหว่ทางกฎหมาย เว็บไซต์จึงใช้ปลั๊กอินและโค้ดเพื่อลดบอทที่ใช้ Data-Scaping

ทางออกที่ดีที่สุดคืออะไร?

ความหมายของ AI ในการแก้ปัญหาข้อกังวลในโลกแห่งความเป็นจริงได้รับการสนับสนุนจากความตั้งใจอันสูงส่งมาโดยตลอด ถ้าอย่างนั้นเหตุใดการจัดหาชุดข้อมูลเพื่อฝึกอบรมโมเดลดังกล่าวจึงต้องอาศัยโมเดลสีเทา

ในขณะที่การสนทนาและการถกเถียงเกี่ยวกับ AI ที่มีความรับผิดชอบ มีจริยธรรม และมีความรับผิดชอบได้รับความโดดเด่นและแข็งแกร่ง บริษัททุกขนาดจึงต้องเปลี่ยนไปใช้แหล่งข้อมูลอื่นที่มีเทคนิคหมวกขาวในการส่งข้อมูลการฝึกอบรม

นี่คือ จุดเด่นของ Shaipเขาเข้าใจถึงข้อกังวลที่เกิดขึ้นเกี่ยวกับการรวบรวมข้อมูล และสนับสนุนเทคนิคที่ถูกต้องตามหลักจริยธรรมมาโดยตลอด พร้อมทั้งได้ปรับปรุงและพัฒนาวิธีการรวบรวมและจัดทำข้อมูลจากแหล่งต่างๆ อย่างต่อเนื่อง

วิธีการจัดหาชุดข้อมูล White Hat

วิธีการจัดหาชุดข้อมูล Hat เครื่องมือรวบรวมข้อมูลที่เป็นกรรมสิทธิ์ของเรามีมนุษย์เป็นศูนย์กลางของการระบุข้อมูลและวงจรการจัดส่ง เราเข้าใจถึงความละเอียดอ่อนของกรณีการใช้งานที่ลูกค้าของเราดำเนินการอยู่ และผลกระทบที่ชุดข้อมูลของเราอาจมีต่อผลลัพธ์ของแบบจำลองของพวกเขา ตัวอย่างเช่น ชุดข้อมูลด้านการดูแลสุขภาพมีความละเอียดอ่อนเมื่อเปรียบเทียบกับชุดข้อมูลสำหรับการมองเห็นด้วยคอมพิวเตอร์สำหรับรถยนต์ขับเคลื่อนอัตโนมัติ

นี่คือเหตุผลว่าทำไมวิธีการทำงานของเราจึงเกี่ยวข้องกับการตรวจสอบคุณภาพและเทคนิคอย่างพิถีพิถันเพื่อระบุและรวบรวมชุดข้อมูลที่เกี่ยวข้อง สิ่งนี้ช่วยให้เราเพิ่มศักยภาพให้กับบริษัทต่างๆ ด้วยชุดข้อมูลการฝึกอบรม Gen AI สุดพิเศษในหลายรูปแบบ เช่น รูปภาพ วิดีโอ เสียง ข้อความ และข้อกำหนดเฉพาะอื่นๆ

ปรัชญาของเรา

เราดำเนินการตามปรัชญาหลัก เช่น ความยินยอม ความเป็นส่วนตัว และความเป็นธรรมในการรวบรวมชุดข้อมูล แนวทางของเรายังรับประกันความหลากหลายของข้อมูล ดังนั้นจึงไม่มีอคติโดยไม่รู้ตัว

ในขณะที่อาณาจักร AI เตรียมพร้อมสำหรับรุ่งอรุณของยุคใหม่ที่มีหลักปฏิบัติที่ยุติธรรม พวกเราที่ Shaip ตั้งใจที่จะเป็นผู้ถือธงและผู้บุกเบิกอุดมการณ์ดังกล่าว หากสิ่งที่คุณกำลังมองหาชุดข้อมูลที่ยุติธรรมและมีคุณภาพอย่างไม่ต้องสงสัยเพื่อฝึกฝนโมเดล AI ของคุณ โปรดติดต่อเราวันนี้

ชอบบทความนี้ไหม? ติดตาม Shaip บน LinkedIn เพื่อรับข้อมูลอัปเดตเพิ่มเติม

แบ่งปันสังคม