ชุดข้อมูล NLP เป็นแกนหลักของโครงการประมวลผลภาษาธรรมชาติมากมาย โดยมอบความยืดหยุ่นสำหรับงานที่หลากหลาย เช่น การจำแนกประเภทข้อความ การวิเคราะห์ความรู้สึก และการตอบคำถาม ยกตัวอย่างเช่น Blog Authorship Corpus ประกอบด้วยโพสต์บล็อกมากกว่า 681,000 โพสต์จากบล็อกเกอร์เกือบ 20,000 คน ทำให้เป็นแหล่งข้อมูลอันทรงคุณค่าสำหรับการศึกษารูปแบบการเขียน การระบุตัวตนของผู้เขียน และอื่นๆ อีกมากมาย
สำหรับผู้ที่สนใจงานวิจัยเชิงวิชาการ ชุดข้อมูลงานวิจัยของ arXiv เปิดโอกาสให้เข้าถึงชุดบทความวิทยาศาสตร์จำนวนมากจากหลากหลายสาขาวิชา ซึ่งรองรับงาน NLP ขั้นสูง เช่น การวิเคราะห์การอ้างอิงและการจำแนกประเภทเอกสาร ชุดข้อมูลศูนย์จัดซื้อจัดจ้างของรัฐบาลกลาง (Federal Procurement Data Center) เป็นอีกหนึ่งแหล่งข้อมูลที่มีประโยชน์ ซึ่งให้ข้อมูลโดยละเอียดเกี่ยวกับสัญญาของรัฐบาลกลาง เหมาะสำหรับโครงการที่เกี่ยวข้องกับข้อมูลภาครัฐและการรับรองหน่วยงาน
ชุดข้อมูล NLP เหล่านี้ถูกนำมาใช้อย่างแพร่หลายในการฝึกและประเมินโมเดลการเรียนรู้ของเครื่อง ช่วยให้นักวิจัยและนักพัฒนาสามารถปรับปรุงประสิทธิภาพของระบบในงาน NLP ต่างๆ ไม่ว่าคุณจะทำงานกับโพสต์บล็อก บทความวิจัย หรือข้อมูลภาครัฐ ชุดข้อมูลเหล่านี้จะเป็นรากฐานสำหรับแอปพลิเคชัน NLP ที่มีประสิทธิภาพและหลากหลาย
NLP คืออะไร
NLP (การประมวลผลภาษาธรรมชาติ) ช่วยให้คอมพิวเตอร์เข้าใจภาษาของมนุษย์ เหมือนกับการสอนคอมพิวเตอร์ให้อ่าน เข้าใจ และตอบสนองต่อข้อความและคำพูดในลักษณะเดียวกับที่มนุษย์ทำ
NLP สามารถทำอะไรได้บ้าง?
- เปลี่ยนข้อความที่ยุ่งเหยิงให้กลายเป็นข้อมูลที่เป็นระเบียบ
- เข้าใจว่าความคิดเห็นเป็นเชิงบวกหรือเชิงลบ
- แปลระหว่างภาษา
- สร้างบทสรุปของข้อความยาวๆ
- และอื่น ๆ อีกมากมาย!
- เริ่มต้นใช้งาน NLP:
ในการสร้างระบบ NLP ที่ดี คุณจำเป็นต้องมีตัวอย่างจำนวนมากเพื่อฝึกฝนระบบเหล่านั้น เหมือนกับที่มนุษย์เรียนรู้ได้ดีขึ้นเมื่อฝึกฝนมากขึ้น ข่าวดีก็คือ มีแหล่งข้อมูลฟรีมากมายที่คุณสามารถค้นหาตัวอย่างเหล่านี้ได้ เช่นHugging Face , KaggleและGitHubคุณสามารถเข้าถึงชุดข้อมูลจากแพลตฟอร์มเหล่านี้ได้อย่างง่ายดาย ซึ่งจะช่วยเร่งการพัฒนาโครงการ NLP
ขนาดและการเติบโตของตลาด NLP:
ณ ปี 2023 ตลาดการประมวลผลภาษาธรรมชาติ (NLP) มีมูลค่าประมาณ 26 พันล้านดอลลาร์ คาดว่าจะเติบโตอย่างมีนัยสำคัญ โดยมีอัตราการเติบโตต่อปีแบบทบต้น (CAGR) ประมาณ 30% ตั้งแต่ปี 2023 ถึง 2030 การเติบโตนี้ขับเคลื่อนโดยความต้องการแอปพลิเคชัน NLP ที่เพิ่มขึ้นในอุตสาหกรรมต่างๆ เช่น การดูแลสุขภาพ การเงิน และบริการลูกค้า
วิธีการเลือกชุดข้อมูล NLP ที่ดี ควรพิจารณาปัจจัยต่อไปนี้:
- ติดต่อโฆษณา:ตรวจสอบให้แน่ใจว่าชุดข้อมูลสอดคล้องกับงานหรือโดเมนเฉพาะของคุณ
- ขนาด:โดยทั่วไปแล้วชุดข้อมูลขนาดใหญ่จะช่วยปรับปรุงประสิทธิภาพของแบบจำลอง แต่จะต้องรักษาสมดุลระหว่างขนาดและคุณภาพด้วย
- ความหลากหลาย:ค้นหาชุดข้อมูลที่มีรูปแบบภาษาและบริบทที่หลากหลายเพื่อเพิ่มความทนทานของแบบจำลอง
- คุณภาพ:ตรวจสอบข้อมูลที่มีป้ายกำกับอย่างดีและถูกต้องเพื่อหลีกเลี่ยงการเกิดข้อผิดพลาด
- การเข้าถึง:ให้แน่ใจว่าชุดข้อมูลพร้อมใช้งานและพิจารณาข้อจำกัดการออกใบอนุญาตต่างๆ
- กระบวนการเตรียมการผลิต:กำหนดว่าชุดข้อมูลจำเป็นต้องมีการทำความสะอาดหรือการประมวลผลล่วงหน้าอย่างมีนัยสำคัญหรือไม่
- การสนับสนุนชุมชน:ชุดข้อมูลยอดนิยมมักจะมีทรัพยากรและการสนับสนุนจากชุมชนมากกว่า ซึ่งอาจเป็นประโยชน์ได้
การประเมินปัจจัยเหล่านี้จะช่วยให้คุณเลือกชุดข้อมูลที่เหมาะสมที่สุดกับความต้องการของโครงการของคุณ การเลือกชุดข้อมูลที่เหมาะสมเป็นสิ่งสำคัญอย่างยิ่งต่อการบรรลุผลลัพธ์ที่ดีที่สุดในโครงการ NLP เนื่องจากชุดข้อมูลเหล่านี้ส่งผลโดยตรงต่อประสิทธิภาพของโมเดลและประสิทธิภาพในการฝึกอบรม
33 ชุดข้อมูลเปิดที่ต้องดูสำหรับ NLP
ทั่วไป
สแปมเบสของ UCI (ลิงค์)
Spambase สร้างขึ้นที่ Hewlett-Packard Labs มีกลุ่มอีเมลสแปมโดยผู้ใช้ โดยมีเป้าหมายเพื่อพัฒนาตัวกรองสแปมส่วนบุคคล มีการสังเกตจากข้อความอีเมลมากกว่า 4600 รายการ ซึ่งเกือบ 1820 รายการเป็นสแปม
ชุดข้อมูล Enron (ลิงค์)
ชุดข้อมูลของ Enron ประกอบด้วยอีเมล "จริง" ที่ไม่ระบุตัวตนจำนวนมาก ซึ่งเปิดให้สาธารณชนเข้าถึงได้เพื่อฝึกฝนโมเดลการเรียนรู้ของเครื่อง ชุดข้อมูลนี้มีอีเมลมากกว่าครึ่งล้านฉบับจากผู้ใช้กว่า 150 ราย ซึ่งส่วนใหญ่เป็นผู้บริหารระดับสูงของ Enron ชุดข้อมูลนี้พร้อมใช้งานทั้งในรูปแบบที่มีโครงสร้างและไม่มีโครงสร้าง เพื่อปรับปรุงข้อมูลที่ไม่มีโครงสร้างให้สวยงามยิ่งขึ้น คุณจำเป็นต้องประยุกต์ใช้เทคนิคการประมวลผลข้อมูล
ชุดข้อมูลระบบผู้แนะนำ (ลิงค์)
ชุดข้อมูลระบบผู้แนะนำคือชุดข้อมูลขนาดใหญ่ที่มีคุณลักษณะต่างๆ เช่น
- รีวิวสินค้า
- การจัดระดับดาว
- ติดตามการออกกำลังกาย
- ข้อมูลเพลง
- เครือข่ายทางสังคม
- timestamps
- การโต้ตอบกับผู้ใช้/รายการ
- ข้อมูล GPS
เพนน์ ทรีแบงค์ (ลิงค์)
คลังข้อมูลนี้จาก Wall Street Journal ได้รับความนิยมในการทดสอบโมเดลการติดฉลากตามลำดับ
เอ็นแอลทีเค (ลิงค์)
ไลบรารี Python นี้ให้สิทธิ์เข้าถึงคลังข้อมูลและทรัพยากรคำศัพท์มากกว่า 100 รายการสำหรับ NLP นอกจากนี้ยังมีหนังสือ NLTK ซึ่งเป็นหลักสูตรฝึกอบรมการใช้งานไลบรารีนี้ NLTK ยังสามารถเข้าถึง WordNet ซึ่งเป็นฐานข้อมูลคำศัพท์ภาษาอังกฤษขนาดใหญ่ที่รวบรวมคำต่างๆ เช่น คำนาม คำกริยา คำคุณศัพท์ และคำวิเศษณ์ ไว้ในกลุ่มคำพ้องความหมายตามความหมายร่วมกัน นอกจากนี้ NLTK ยังมีรายการคลังข้อมูลและทรัพยากรคำศัพท์พร้อมคำอธิบายประกอบสำหรับการวิจัย NLP อีกด้วย
การพึ่งพาสากล (ลิงค์)
UD มอบวิธีการอธิบายไวยากรณ์ที่สอดคล้องกันด้วยทรัพยากรในกว่า 100 ภาษา ธนาคารต้นไม้ 200 แห่ง และการสนับสนุนจากสมาชิกชุมชนมากกว่า 300 คน
ชุดข้อมูลการวิเคราะห์ความรู้สึก
พจนานุกรมสำหรับภาพยนตร์และการเงิน (ลิงค์)
ชุดข้อมูล Dictionaries for Movies and Finance มีพจนานุกรมเฉพาะโดเมนสำหรับขั้วบวกหรือลบในการเติม Finance และบทวิจารณ์ภาพยนตร์ พจนานุกรมเหล่านี้มาจากการกรอก IMDb และแบบฟอร์ม 8 ของสหรัฐอเมริกาค่าความเชื่อมั่น 140 (ลิงค์)
Sentiment 140 มีทวีตมากกว่า 160,000 รายการพร้อมอีโมติคอนต่างๆ ที่จัดอยู่ใน 6 ฟิลด์ที่แตกต่างกัน: วันที่ทวีต ขั้ว ข้อความ ชื่อผู้ใช้ ID และข้อความค้นหา ชุดข้อมูลนี้ช่วยให้คุณค้นพบความรู้สึกของแบรนด์ ผลิตภัณฑ์ หรือแม้แต่หัวข้อตามกิจกรรมของ Twitter เนื่องจากชุดข้อมูลนี้ถูกสร้างขึ้นโดยอัตโนมัติ ซึ่งแตกต่างจากทวีตอื่น ๆ ที่มีคำอธิบายประกอบโดยมนุษย์ จึงจัดประเภททวีตที่มีอารมณ์เชิงบวกและอารมณ์เชิงลบว่าไม่เอื้ออำนวย
ชุดข้อมูลความเชื่อมั่นแบบหลายโดเมน (ลิงค์)
ชุดข้อมูลความเชื่อมั่นแบบหลายโดเมนนี้เป็นที่เก็บบทวิจารณ์ Amazon สำหรับผลิตภัณฑ์ต่างๆ หมวดหมู่สินค้าบางประเภท เช่น หนังสือ มีบทวิจารณ์เป็นพันรายการ ในขณะที่ประเภทอื่นๆ มีบทวิจารณ์เพียงไม่กี่ร้อยรายการ นอกจากนี้ บทวิจารณ์ที่มีการจัดระดับดาวสามารถแปลงเป็นป้ายกำกับไบนารีได้
ธนาคารต้นไม้ความเชื่อมั่นสแตนฟอร์ด (ลิงค์)
ชุดข้อมูล NLP นี้จาก Rotten Tomatoes มีวลีที่ยาวขึ้นและตัวอย่างข้อความที่มีรายละเอียดมากขึ้น
คลังข้อมูลผู้เขียนบล็อก (ลิงค์)
คอลเลกชันนี้มีโพสต์บล็อกที่มีเกือบ 1.4 ล้านคำ แต่ละบล็อกเป็นชุดข้อมูลแยกกัน
ชุดข้อมูล OpinRank (ลิงค์)
300,000 รีวิวจาก Edmunds และ TripAdvisor จัดเรียงตามรุ่นรถยนต์ สถานที่ท่องเที่ยว และโรงแรม
ชุดข้อมูลข้อความ
Wiki QA Corpus (ลิงค์)
WiKi QA Corpus สร้างขึ้นเพื่อช่วยตอบคำถามในโดเมนแบบเปิดกว้าง เป็นหนึ่งในชุดข้อมูลสาธารณะที่กว้างขวางที่สุด รวบรวมจากบันทึกการสืบค้นของโปรแกรมค้นหาของ Bing ซึ่งมาพร้อมกับคู่คำถามและคำตอบ มีคำถามมากกว่า 3000 ข้อและประโยคคำตอบ 1500 ประโยค
ชุดข้อมูลรายงานกรณีทางกฎหมาย (ลิงค์)
ชุดข้อมูลรายงานกรณีทางกฎหมายมีคอลเลกชันคดีทางกฎหมาย 4000 คดี และสามารถใช้ในการฝึกอบรมสำหรับการสรุปข้อความอัตโนมัติและการวิเคราะห์การอ้างอิง แต่ละเอกสาร บทกลอน คลาสการอ้างอิง บทอ้างอิงอ้างอิง และอื่นๆ ถูกนำมาใช้
อันตราย (ลิงค์)
ชุดข้อมูล Jeopardy คือชุดคำถามมากกว่า 200,000 คำถามในรายการทีวีตอบคำถามยอดนิยมที่รวบรวมโดยผู้ใช้ Reddit จุดข้อมูลแต่ละจุดจะจำแนกตามวันที่ออกอากาศ หมายเลขตอน มูลค่า รอบ และคำถาม/คำตอบ
20 กลุ่มข่าว (ลิงค์)
คอลเลกชันเอกสาร 20,000 ฉบับประกอบด้วยกลุ่มข่าวและหัวข้อข่าว 20 กลุ่ม โดยมีรายละเอียดหัวข้อต่างๆ ตั้งแต่ศาสนาไปจนถึงกีฬายอดนิยม
ชุดข้อมูลข่าวรอยเตอร์ (ลิงค์)
ชุดข้อมูลนี้ปรากฏครั้งแรกในปี 1987 ได้รับการติดป้ายกำกับ จัดทำดัชนี และเรียบเรียงเพื่อการเรียนรู้ของเครื่อง
อาร์ซีฟ (ลิงค์)
ชุดข้อมูลขนาดใหญ่ 270 GB นี้ประกอบด้วยข้อความฉบับสมบูรณ์ของเอกสารวิจัย arXiv ทั้งหมด
การดำเนินการของรัฐสภายุโรป Parallel Corpus (ลิงค์)
คู่ประโยคจากการพิจารณาคดีของรัฐสภาประกอบด้วยรายการจาก 21 ภาษายุโรป ซึ่งมีภาษาที่ใช้กันทั่วไปน้อยกว่าสำหรับการเรียนรู้ของเครื่อง
เกณฑ์มาตรฐานพันล้านคำ (ลิงค์)
ชุดข้อมูลการสร้างแบบจำลองภาษานี้ได้มาจากการรวบรวมข่าว WMT 2011 ประกอบด้วยคำเกือบหนึ่งพันล้านคำสำหรับทดสอบเทคนิคการสร้างแบบจำลองภาษาที่เป็นนวัตกรรมใหม่
ชุดข้อมูลเสียงพูด
ภาษาวิกิพีเดียภาษาพูด (ลิงค์)
ชุดข้อมูลนี้เหมาะสำหรับทุกคนที่ต้องการก้าวไปไกลกว่าภาษาอังกฤษ ชุดข้อมูลนี้มีชุดบทความที่ใช้ภาษาดัตช์ เยอรมัน และอังกฤษ มีหัวข้อและชุดผู้พูดที่หลากหลายซึ่งใช้เวลาหลายร้อยชั่วโมง2000 HUB5 ภาษาอังกฤษ (ลิงค์)
ชุดข้อมูลภาษาอังกฤษ HUB2000 ของ 5 มีบันทึกการสนทนาทางโทรศัพท์เป็นภาษาอังกฤษ 40 รายการ ข้อมูลนี้จัดทำโดยสถาบันมาตรฐานและเทคโนโลยีแห่งชาติ โดยมุ่งเน้นที่การจดจำคำพูดสนทนาและการแปลงคำพูดเป็นข้อความ
LibriSpeech (ลิงค์)
ชุดข้อมูล LibriSpeech คือชุดของคำพูดภาษาอังกฤษเกือบ 1000 ชั่วโมงที่นำมาและแบ่งตามหัวข้ออย่างเหมาะสมเป็นบทจากหนังสือเสียง ทำให้เป็นเครื่องมือที่สมบูรณ์แบบสำหรับการประมวลผลภาษาธรรมชาติ
ชุดข้อมูล Spoken Digit ฟรี (ลิงค์)
ชุดข้อมูล NLP นี้ประกอบด้วยการบันทึกตัวเลขที่พูดเป็นภาษาอังกฤษมากกว่า 1,500 รายการ
ชุดข้อมูลคำพูดของ M-AI Labs (ลิงค์)
ชุดข้อมูลนำเสนอเสียงเกือบ 1,000 ชั่วโมงพร้อมการถอดเสียง ครอบคลุมหลายภาษาและจัดหมวดหมู่ตามเสียงผู้ชาย ผู้หญิง และเสียงผสม
ฐานข้อมูลคำพูดที่มีเสียงดัง (ลิงค์)
ชุดข้อมูลนี้มีการบันทึกคำพูดที่คมชัดและเสียงรบกวนคู่ขนาน มีไว้สำหรับการพัฒนาซอฟต์แวร์เพิ่มประสิทธิภาพคำพูด แต่ยังมีประโยชน์สำหรับการฝึกอบรมการพูดในสภาวะที่ท้าทายอีกด้วย
รีวิวชุดข้อมูล
Yelp ความคิดเห็น (ลิงค์)
ชุดข้อมูล Yelp มีคอลเลกชั่นรีวิว 8.5 ล้านรีวิวจากกว่า 160,000 ธุรกิจ บทวิจารณ์ และข้อมูลผู้ใช้ บทวิจารณ์สามารถใช้เพื่อฝึกโมเดลของคุณเกี่ยวกับการวิเคราะห์ความเชื่อมั่นได้ นอกจากนี้ ชุดข้อมูลนี้ยังมีรูปภาพมากกว่า 200,000 ภาพครอบคลุมพื้นที่ในเมืองใหญ่แปดแห่ง
IMDB ความคิดเห็น (ลิงค์)
บทวิจารณ์ IMDB เป็นหนึ่งในชุดข้อมูลยอดนิยมที่มีข้อมูลนักแสดง การให้คะแนน คำอธิบาย และประเภทสำหรับภาพยนตร์มากกว่า 50 เรื่อง สามารถใช้ชุดข้อมูลนี้เพื่อทดสอบและฝึกโมเดลการเรียนรู้ของเครื่อง
ชุดข้อมูลรีวิวและการให้คะแนนของ Amazon (ลิงค์)
ชุดข้อมูลการตรวจสอบและการให้คะแนนของ Amazon ประกอบด้วยชุดข้อมูลเมตาอันมีค่าและบทวิจารณ์ผลิตภัณฑ์ต่างๆ จาก Amazon ที่รวบรวมตั้งแต่ปี 1996 ถึง 2014 – ประมาณ 142.8 ล้านระเบียน ข้อมูลเมตาประกอบด้วยราคา คำอธิบายผลิตภัณฑ์ แบรนด์ หมวดหมู่ และอื่นๆ ในขณะที่บทวิจารณ์มีคุณภาพข้อความ ประโยชน์ของข้อความ การให้คะแนน และอื่นๆ
ชุดข้อมูลคำถามและคำตอบ
ชุดข้อมูลคำถามและคำตอบของสแตนฟอร์ด (SQuAD) (ลิงค์)
ชุดข้อมูลเพื่อความเข้าใจในการอ่านนี้มีคำถามที่ตอบได้ 100,000 ข้อ และคำถามที่ตอบไม่ได้ 50,000 ข้อ ซึ่งทั้งหมดนี้สร้างขึ้นโดยกลุ่มคนทำงานของ Wikipedia
คำถามธรรมชาติ (ลิงค์)
ชุดการฝึกอบรมนี้มีตัวอย่างการฝึกอบรมมากกว่า 300,000 ตัวอย่าง ตัวอย่างการพัฒนา 7,800 รายการ และตัวอย่างการทดสอบ 7,800 รายการ โดยแต่ละรายการมีคำถามใน Google และหน้า Wikipedia ที่ตรงกัน
เรื่องไม่สำคัญQA (ลิงค์)
ชุดคำถามที่ท้าทายนี้มีคู่ QA 950,000 คู่ รวมถึงชุดย่อยที่ตรวจสอบโดยมนุษย์และที่สร้างโดยเครื่องจักร
CLEVR (ภาษาองค์ประกอบและการใช้เหตุผลเชิงภาพเบื้องต้น) (ลิงค์)
ชุดข้อมูลตอบคำถามแบบภาพนี้มีวัตถุที่เรนเดอร์ 3 มิติและคำถามหลายพันรายการพร้อมรายละเอียดเกี่ยวกับฉากที่มองเห็น
คุณเลือกชุดข้อมูลใดในการฝึกโมเดลแมชชีนเลิร์นนิงของคุณ
ก่อนจากกันไป เราจะฝากเคล็ดลับดีๆ ไว้ให้คุณสักข้อ
ตรวจสอบให้แน่ใจว่าได้อ่านไฟล์ README อย่างละเอียดก่อนที่จะเลือกชุดข้อมูล NLP ตามความต้องการของคุณ ชุดข้อมูลจะมีข้อมูลที่จำเป็นทั้งหมดที่คุณอาจต้องการ เช่น เนื้อหาของชุดข้อมูล พารามิเตอร์ต่างๆ ที่มีการจัดหมวดหมู่ข้อมูล และกรณีการใช้งานที่เป็นไปได้ของชุดข้อมูล
ไม่ว่าคุณจะสร้างโมเดลใด มีโอกาสที่น่าตื่นเต้นในการบูรณาการเครื่องจักรของเราให้ใกล้ชิดและเข้ากับชีวิตของเรามากขึ้น ด้วย NLP ความเป็นไปได้สำหรับธุรกิจ ภาพยนตร์ การรู้จำเสียง การเงิน และอื่นๆ จะเพิ่มขึ้นมากมาย