ชุดข้อมูล NLP สำหรับ ML

ชุดข้อมูล NLP ชั้นนำเพื่อเพิ่มประสิทธิภาพให้กับโมเดลการเรียนรู้ของเครื่องของคุณ

ชุดข้อมูล NLP เป็นแกนหลักของโครงการประมวลผลภาษาธรรมชาติมากมาย โดยมอบความยืดหยุ่นสำหรับงานที่หลากหลาย เช่น การจำแนกประเภทข้อความ การวิเคราะห์ความรู้สึก และการตอบคำถาม ยกตัวอย่างเช่น Blog Authorship Corpus ประกอบด้วยโพสต์บล็อกมากกว่า 681,000 โพสต์จากบล็อกเกอร์เกือบ 20,000 คน ทำให้เป็นแหล่งข้อมูลอันทรงคุณค่าสำหรับการศึกษารูปแบบการเขียน การระบุตัวตนของผู้เขียน และอื่นๆ อีกมากมาย

สำหรับผู้ที่สนใจงานวิจัยเชิงวิชาการ ชุดข้อมูลงานวิจัยของ arXiv เปิดโอกาสให้เข้าถึงชุดบทความวิทยาศาสตร์จำนวนมากจากหลากหลายสาขาวิชา ซึ่งรองรับงาน NLP ขั้นสูง เช่น การวิเคราะห์การอ้างอิงและการจำแนกประเภทเอกสาร ชุดข้อมูลศูนย์จัดซื้อจัดจ้างของรัฐบาลกลาง (Federal Procurement Data Center) เป็นอีกหนึ่งแหล่งข้อมูลที่มีประโยชน์ ซึ่งให้ข้อมูลโดยละเอียดเกี่ยวกับสัญญาของรัฐบาลกลาง เหมาะสำหรับโครงการที่เกี่ยวข้องกับข้อมูลภาครัฐและการรับรองหน่วยงาน

ชุดข้อมูล NLP เหล่านี้ถูกนำมาใช้อย่างแพร่หลายในการฝึกและประเมินโมเดลการเรียนรู้ของเครื่อง ช่วยให้นักวิจัยและนักพัฒนาสามารถปรับปรุงประสิทธิภาพของระบบในงาน NLP ต่างๆ ไม่ว่าคุณจะทำงานกับโพสต์บล็อก บทความวิจัย หรือข้อมูลภาครัฐ ชุดข้อมูลเหล่านี้จะเป็นรากฐานสำหรับแอปพลิเคชัน NLP ที่มีประสิทธิภาพและหลากหลาย

NLP คืออะไร

NLP (การประมวลผลภาษาธรรมชาติ) ช่วยให้คอมพิวเตอร์เข้าใจภาษาของมนุษย์ เหมือนกับการสอนคอมพิวเตอร์ให้อ่าน เข้าใจ และตอบสนองต่อข้อความและคำพูดในลักษณะเดียวกับที่มนุษย์ทำ

NLP สามารถทำอะไรได้บ้าง?

  • เปลี่ยนข้อความที่ยุ่งเหยิงให้กลายเป็นข้อมูลที่เป็นระเบียบ
  • เข้าใจว่าความคิดเห็นเป็นเชิงบวกหรือเชิงลบ
  • แปลระหว่างภาษา
  • สร้างบทสรุปของข้อความยาวๆ
  • และอื่น ๆ อีกมากมาย!
  • เริ่มต้นใช้งาน NLP:

ในการสร้างระบบ NLP ที่ดี คุณจำเป็นต้องมีตัวอย่างจำนวนมากเพื่อฝึกฝนระบบเหล่านั้น เหมือนกับที่มนุษย์เรียนรู้ได้ดีขึ้นเมื่อฝึกฝนมากขึ้น ข่าวดีก็คือ มีแหล่งข้อมูลฟรีมากมายที่คุณสามารถค้นหาตัวอย่างเหล่านี้ได้ เช่นHugging Face , KaggleและGitHubคุณสามารถเข้าถึงชุดข้อมูลจากแพลตฟอร์มเหล่านี้ได้อย่างง่ายดาย ซึ่งจะช่วยเร่งการพัฒนาโครงการ NLP

ขนาดและการเติบโตของตลาด NLP:

ณ ปี 2023 ตลาดการประมวลผลภาษาธรรมชาติ (NLP) มีมูลค่าประมาณ 26 พันล้านดอลลาร์ คาดว่าจะเติบโตอย่างมีนัยสำคัญ โดยมีอัตราการเติบโตต่อปีแบบทบต้น (CAGR) ประมาณ 30% ตั้งแต่ปี 2023 ถึง 2030 การเติบโตนี้ขับเคลื่อนโดยความต้องการแอปพลิเคชัน NLP ที่เพิ่มขึ้นในอุตสาหกรรมต่างๆ เช่น การดูแลสุขภาพ การเงิน และบริการลูกค้า

วิธีการเลือกชุดข้อมูล NLP ที่ดี ควรพิจารณาปัจจัยต่อไปนี้:

  • ติดต่อโฆษณา:ตรวจสอบให้แน่ใจว่าชุดข้อมูลสอดคล้องกับงานหรือโดเมนเฉพาะของคุณ
  • ขนาด:โดยทั่วไปแล้วชุดข้อมูลขนาดใหญ่จะช่วยปรับปรุงประสิทธิภาพของแบบจำลอง แต่จะต้องรักษาสมดุลระหว่างขนาดและคุณภาพด้วย
  • ความหลากหลาย:ค้นหาชุดข้อมูลที่มีรูปแบบภาษาและบริบทที่หลากหลายเพื่อเพิ่มความทนทานของแบบจำลอง
  • คุณภาพ:ตรวจสอบข้อมูลที่มีป้ายกำกับอย่างดีและถูกต้องเพื่อหลีกเลี่ยงการเกิดข้อผิดพลาด
  • การเข้าถึง:ให้แน่ใจว่าชุดข้อมูลพร้อมใช้งานและพิจารณาข้อจำกัดการออกใบอนุญาตต่างๆ
  • กระบวนการเตรียมการผลิต:กำหนดว่าชุดข้อมูลจำเป็นต้องมีการทำความสะอาดหรือการประมวลผลล่วงหน้าอย่างมีนัยสำคัญหรือไม่
  • การสนับสนุนชุมชน:ชุดข้อมูลยอดนิยมมักจะมีทรัพยากรและการสนับสนุนจากชุมชนมากกว่า ซึ่งอาจเป็นประโยชน์ได้

การประเมินปัจจัยเหล่านี้จะช่วยให้คุณเลือกชุดข้อมูลที่เหมาะสมที่สุดกับความต้องการของโครงการของคุณ การเลือกชุดข้อมูลที่เหมาะสมเป็นสิ่งสำคัญอย่างยิ่งต่อการบรรลุผลลัพธ์ที่ดีที่สุดในโครงการ NLP เนื่องจากชุดข้อมูลเหล่านี้ส่งผลโดยตรงต่อประสิทธิภาพของโมเดลและประสิทธิภาพในการฝึกอบรม

33 ชุดข้อมูลเปิดที่ต้องดูสำหรับ NLP

ทั่วไป

  • สแปมเบสของ UCI (ลิงค์)

    Spambase สร้างขึ้นที่ Hewlett-Packard Labs มีกลุ่มอีเมลสแปมโดยผู้ใช้ โดยมีเป้าหมายเพื่อพัฒนาตัวกรองสแปมส่วนบุคคล มีการสังเกตจากข้อความอีเมลมากกว่า 4600 รายการ ซึ่งเกือบ 1820 รายการเป็นสแปม

  • ชุดข้อมูล Enron (ลิงค์)

    ชุดข้อมูลของ Enron ประกอบด้วยอีเมล "จริง" ที่ไม่ระบุตัวตนจำนวนมาก ซึ่งเปิดให้สาธารณชนเข้าถึงได้เพื่อฝึกฝนโมเดลการเรียนรู้ของเครื่อง ชุดข้อมูลนี้มีอีเมลมากกว่าครึ่งล้านฉบับจากผู้ใช้กว่า 150 ราย ซึ่งส่วนใหญ่เป็นผู้บริหารระดับสูงของ Enron ชุดข้อมูลนี้พร้อมใช้งานทั้งในรูปแบบที่มีโครงสร้างและไม่มีโครงสร้าง เพื่อปรับปรุงข้อมูลที่ไม่มีโครงสร้างให้สวยงามยิ่งขึ้น คุณจำเป็นต้องประยุกต์ใช้เทคนิคการประมวลผลข้อมูล

  • ชุดข้อมูลระบบผู้แนะนำ (ลิงค์)

    ชุดข้อมูลระบบผู้แนะนำคือชุดข้อมูลขนาดใหญ่ที่มีคุณลักษณะต่างๆ เช่น

    • รีวิวสินค้า
    • การจัดระดับดาว
    • ติดตามการออกกำลังกาย
    • ข้อมูลเพลง
    • เครือข่ายทางสังคม
    • timestamps
    • การโต้ตอบกับผู้ใช้/รายการ
    • ข้อมูล GPS
  • เพนน์ ทรีแบงค์ (ลิงค์)

    คลังข้อมูลนี้จาก Wall Street Journal ได้รับความนิยมในการทดสอบโมเดลการติดฉลากตามลำดับ

  • เอ็นแอลทีเค (ลิงค์)

    ไลบรารี Python นี้ให้สิทธิ์เข้าถึงคลังข้อมูลและทรัพยากรคำศัพท์มากกว่า 100 รายการสำหรับ NLP นอกจากนี้ยังมีหนังสือ NLTK ซึ่งเป็นหลักสูตรฝึกอบรมการใช้งานไลบรารีนี้ NLTK ยังสามารถเข้าถึง WordNet ซึ่งเป็นฐานข้อมูลคำศัพท์ภาษาอังกฤษขนาดใหญ่ที่รวบรวมคำต่างๆ เช่น คำนาม คำกริยา คำคุณศัพท์ และคำวิเศษณ์ ไว้ในกลุ่มคำพ้องความหมายตามความหมายร่วมกัน นอกจากนี้ NLTK ยังมีรายการคลังข้อมูลและทรัพยากรคำศัพท์พร้อมคำอธิบายประกอบสำหรับการวิจัย NLP อีกด้วย

  • การพึ่งพาสากล (ลิงค์)

    UD มอบวิธีการอธิบายไวยากรณ์ที่สอดคล้องกันด้วยทรัพยากรในกว่า 100 ภาษา ธนาคารต้นไม้ 200 แห่ง และการสนับสนุนจากสมาชิกชุมชนมากกว่า 300 คน

ชุดข้อมูลการวิเคราะห์ความรู้สึก

  • พจนานุกรมสำหรับภาพยนตร์และการเงิน (ลิงค์)

    การวิเคราะห์ความเชื่อมั่น
    ชุดข้อมูล Dictionaries for Movies and Finance มีพจนานุกรมเฉพาะโดเมนสำหรับขั้วบวกหรือลบในการเติม Finance และบทวิจารณ์ภาพยนตร์ พจนานุกรมเหล่านี้มาจากการกรอก IMDb และแบบฟอร์ม 8 ของสหรัฐอเมริกา

  • ค่าความเชื่อมั่น 140 (ลิงค์)

    Sentiment 140 มีทวีตมากกว่า 160,000 รายการพร้อมอีโมติคอนต่างๆ ที่จัดอยู่ใน 6 ฟิลด์ที่แตกต่างกัน: วันที่ทวีต ขั้ว ข้อความ ชื่อผู้ใช้ ID และข้อความค้นหา ชุดข้อมูลนี้ช่วยให้คุณค้นพบความรู้สึกของแบรนด์ ผลิตภัณฑ์ หรือแม้แต่หัวข้อตามกิจกรรมของ Twitter เนื่องจากชุดข้อมูลนี้ถูกสร้างขึ้นโดยอัตโนมัติ ซึ่งแตกต่างจากทวีตอื่น ๆ ที่มีคำอธิบายประกอบโดยมนุษย์ จึงจัดประเภททวีตที่มีอารมณ์เชิงบวกและอารมณ์เชิงลบว่าไม่เอื้ออำนวย

  • ชุดข้อมูลความเชื่อมั่นแบบหลายโดเมน (ลิงค์)

    ชุดข้อมูลความเชื่อมั่นแบบหลายโดเมนนี้เป็นที่เก็บบทวิจารณ์ Amazon สำหรับผลิตภัณฑ์ต่างๆ หมวดหมู่สินค้าบางประเภท เช่น หนังสือ มีบทวิจารณ์เป็นพันรายการ ในขณะที่ประเภทอื่นๆ มีบทวิจารณ์เพียงไม่กี่ร้อยรายการ นอกจากนี้ บทวิจารณ์ที่มีการจัดระดับดาวสามารถแปลงเป็นป้ายกำกับไบนารีได้

  • ธนาคารต้นไม้ความเชื่อมั่นสแตนฟอร์ด (ลิงค์)

    ชุดข้อมูล NLP นี้จาก Rotten Tomatoes มีวลีที่ยาวขึ้นและตัวอย่างข้อความที่มีรายละเอียดมากขึ้น

  • คลังข้อมูลผู้เขียนบล็อก (ลิงค์)

    คอลเลกชันนี้มีโพสต์บล็อกที่มีเกือบ 1.4 ล้านคำ แต่ละบล็อกเป็นชุดข้อมูลแยกกัน

  • ชุดข้อมูล OpinRank (ลิงค์)

    300,000 รีวิวจาก Edmunds และ TripAdvisor จัดเรียงตามรุ่นรถยนต์ สถานที่ท่องเที่ยว และโรงแรม

ชุดข้อมูลข้อความ

  • Wiki QA Corpus (ลิงค์)

    WiKi QA Corpus สร้างขึ้นเพื่อช่วยตอบคำถามในโดเมนแบบเปิดกว้าง เป็นหนึ่งในชุดข้อมูลสาธารณะที่กว้างขวางที่สุด รวบรวมจากบันทึกการสืบค้นของโปรแกรมค้นหาของ Bing ซึ่งมาพร้อมกับคู่คำถามและคำตอบ มีคำถามมากกว่า 3000 ข้อและประโยคคำตอบ 1500 ประโยค

  • ชุดข้อมูลรายงานกรณีทางกฎหมาย (ลิงค์)

    ชุดข้อมูลรายงานกรณีทางกฎหมายมีคอลเลกชันคดีทางกฎหมาย 4000 คดี และสามารถใช้ในการฝึกอบรมสำหรับการสรุปข้อความอัตโนมัติและการวิเคราะห์การอ้างอิง แต่ละเอกสาร บทกลอน คลาสการอ้างอิง บทอ้างอิงอ้างอิง และอื่นๆ ถูกนำมาใช้

  • อันตราย (ลิงค์)

    ชุดข้อมูล Jeopardy คือชุดคำถามมากกว่า 200,000 คำถามในรายการทีวีตอบคำถามยอดนิยมที่รวบรวมโดยผู้ใช้ Reddit จุดข้อมูลแต่ละจุดจะจำแนกตามวันที่ออกอากาศ หมายเลขตอน มูลค่า รอบ และคำถาม/คำตอบ

  • 20 กลุ่มข่าว (ลิงค์)

    คอลเลกชันเอกสาร 20,000 ฉบับประกอบด้วยกลุ่มข่าวและหัวข้อข่าว 20 กลุ่ม โดยมีรายละเอียดหัวข้อต่างๆ ตั้งแต่ศาสนาไปจนถึงกีฬายอดนิยม

  • ชุดข้อมูลข่าวรอยเตอร์ (ลิงค์)

    ชุดข้อมูลนี้ปรากฏครั้งแรกในปี 1987 ได้รับการติดป้ายกำกับ จัดทำดัชนี และเรียบเรียงเพื่อการเรียนรู้ของเครื่อง

  • อาร์ซีฟ (ลิงค์)

    ชุดข้อมูลขนาดใหญ่ 270 GB นี้ประกอบด้วยข้อความฉบับสมบูรณ์ของเอกสารวิจัย arXiv ทั้งหมด

  • การดำเนินการของรัฐสภายุโรป Parallel Corpus (ลิงค์)

    คู่ประโยคจากการพิจารณาคดีของรัฐสภาประกอบด้วยรายการจาก 21 ภาษายุโรป ซึ่งมีภาษาที่ใช้กันทั่วไปน้อยกว่าสำหรับการเรียนรู้ของเครื่อง

  • เกณฑ์มาตรฐานพันล้านคำ (ลิงค์)

    ชุดข้อมูลการสร้างแบบจำลองภาษานี้ได้มาจากการรวบรวมข่าว WMT 2011 ประกอบด้วยคำเกือบหนึ่งพันล้านคำสำหรับทดสอบเทคนิคการสร้างแบบจำลองภาษาที่เป็นนวัตกรรมใหม่

ชุดข้อมูลเสียงพูด

  • ภาษาวิกิพีเดียภาษาพูด (ลิงค์)

    เสียงพูด ชุดข้อมูลนี้เหมาะสำหรับทุกคนที่ต้องการก้าวไปไกลกว่าภาษาอังกฤษ ชุดข้อมูลนี้มีชุดบทความที่ใช้ภาษาดัตช์ เยอรมัน และอังกฤษ มีหัวข้อและชุดผู้พูดที่หลากหลายซึ่งใช้เวลาหลายร้อยชั่วโมง

  • 2000 HUB5 ภาษาอังกฤษ (ลิงค์)

    ชุดข้อมูลภาษาอังกฤษ HUB2000 ของ 5 มีบันทึกการสนทนาทางโทรศัพท์เป็นภาษาอังกฤษ 40 รายการ ข้อมูลนี้จัดทำโดยสถาบันมาตรฐานและเทคโนโลยีแห่งชาติ โดยมุ่งเน้นที่การจดจำคำพูดสนทนาและการแปลงคำพูดเป็นข้อความ

  • LibriSpeech (ลิงค์)

    ชุดข้อมูล LibriSpeech คือชุดของคำพูดภาษาอังกฤษเกือบ 1000 ชั่วโมงที่นำมาและแบ่งตามหัวข้ออย่างเหมาะสมเป็นบทจากหนังสือเสียง ทำให้เป็นเครื่องมือที่สมบูรณ์แบบสำหรับการประมวลผลภาษาธรรมชาติ

  • ชุดข้อมูล Spoken Digit ฟรี (ลิงค์)

    ชุดข้อมูล NLP นี้ประกอบด้วยการบันทึกตัวเลขที่พูดเป็นภาษาอังกฤษมากกว่า 1,500 รายการ

  • ชุดข้อมูลคำพูดของ M-AI Labs (ลิงค์)

    ชุดข้อมูลนำเสนอเสียงเกือบ 1,000 ชั่วโมงพร้อมการถอดเสียง ครอบคลุมหลายภาษาและจัดหมวดหมู่ตามเสียงผู้ชาย ผู้หญิง และเสียงผสม

  • ฐานข้อมูลคำพูดที่มีเสียงดัง (ลิงค์)

    ชุดข้อมูลนี้มีการบันทึกคำพูดที่คมชัดและเสียงรบกวนคู่ขนาน มีไว้สำหรับการพัฒนาซอฟต์แวร์เพิ่มประสิทธิภาพคำพูด แต่ยังมีประโยชน์สำหรับการฝึกอบรมการพูดในสภาวะที่ท้าทายอีกด้วย

รีวิวชุดข้อมูล

  • Yelp ความคิดเห็น (ลิงค์)

    ชุดข้อมูล Yelp มีคอลเลกชั่นรีวิว 8.5 ล้านรีวิวจากกว่า 160,000 ธุรกิจ บทวิจารณ์ และข้อมูลผู้ใช้ บทวิจารณ์สามารถใช้เพื่อฝึกโมเดลของคุณเกี่ยวกับการวิเคราะห์ความเชื่อมั่นได้ นอกจากนี้ ชุดข้อมูลนี้ยังมีรูปภาพมากกว่า 200,000 ภาพครอบคลุมพื้นที่ในเมืองใหญ่แปดแห่ง

  • IMDB ความคิดเห็น (ลิงค์)

    บทวิจารณ์ IMDB เป็นหนึ่งในชุดข้อมูลยอดนิยมที่มีข้อมูลนักแสดง การให้คะแนน คำอธิบาย และประเภทสำหรับภาพยนตร์มากกว่า 50 เรื่อง สามารถใช้ชุดข้อมูลนี้เพื่อทดสอบและฝึกโมเดลการเรียนรู้ของเครื่อง

  • ชุดข้อมูลรีวิวและการให้คะแนนของ Amazon (ลิงค์)

    ชุดข้อมูลการตรวจสอบและการให้คะแนนของ Amazon ประกอบด้วยชุดข้อมูลเมตาอันมีค่าและบทวิจารณ์ผลิตภัณฑ์ต่างๆ จาก Amazon ที่รวบรวมตั้งแต่ปี 1996 ถึง 2014 – ประมาณ 142.8 ล้านระเบียน ข้อมูลเมตาประกอบด้วยราคา คำอธิบายผลิตภัณฑ์ แบรนด์ หมวดหมู่ และอื่นๆ ในขณะที่บทวิจารณ์มีคุณภาพข้อความ ประโยชน์ของข้อความ การให้คะแนน และอื่นๆ

ชุดข้อมูลคำถามและคำตอบ

  • ชุดข้อมูลคำถามและคำตอบของสแตนฟอร์ด (SQuAD) (ลิงค์)

    ชุดข้อมูลเพื่อความเข้าใจในการอ่านนี้มีคำถามที่ตอบได้ 100,000 ข้อ และคำถามที่ตอบไม่ได้ 50,000 ข้อ ซึ่งทั้งหมดนี้สร้างขึ้นโดยกลุ่มคนทำงานของ Wikipedia

  • คำถามธรรมชาติ (ลิงค์)

    ชุดการฝึกอบรมนี้มีตัวอย่างการฝึกอบรมมากกว่า 300,000 ตัวอย่าง ตัวอย่างการพัฒนา 7,800 รายการ และตัวอย่างการทดสอบ 7,800 รายการ โดยแต่ละรายการมีคำถามใน Google และหน้า Wikipedia ที่ตรงกัน

  • เรื่องไม่สำคัญQA (ลิงค์)

    ชุดคำถามที่ท้าทายนี้มีคู่ QA 950,000 คู่ รวมถึงชุดย่อยที่ตรวจสอบโดยมนุษย์และที่สร้างโดยเครื่องจักร

  • CLEVR (ภาษาองค์ประกอบและการใช้เหตุผลเชิงภาพเบื้องต้น) (ลิงค์)

    ชุดข้อมูลตอบคำถามแบบภาพนี้มีวัตถุที่เรนเดอร์ 3 มิติและคำถามหลายพันรายการพร้อมรายละเอียดเกี่ยวกับฉากที่มองเห็น

คุณเลือกชุดข้อมูลใดในการฝึกโมเดลแมชชีนเลิร์นนิงของคุณ

ก่อนจากกันไป เราจะฝากเคล็ดลับดีๆ ไว้ให้คุณสักข้อ

ตรวจสอบให้แน่ใจว่าได้อ่านไฟล์ README อย่างละเอียดก่อนที่จะเลือกชุดข้อมูล NLP ตามความต้องการของคุณ ชุดข้อมูลจะมีข้อมูลที่จำเป็นทั้งหมดที่คุณอาจต้องการ เช่น เนื้อหาของชุดข้อมูล พารามิเตอร์ต่างๆ ที่มีการจัดหมวดหมู่ข้อมูล และกรณีการใช้งานที่เป็นไปได้ของชุดข้อมูล

ไม่ว่าคุณจะสร้างโมเดลใด มีโอกาสที่น่าตื่นเต้นในการบูรณาการเครื่องจักรของเราให้ใกล้ชิดและเข้ากับชีวิตของเรามากขึ้น ด้วย NLP ความเป็นไปได้สำหรับธุรกิจ ภาพยนตร์ การรู้จำเสียง การเงิน และอื่นๆ จะเพิ่มขึ้นมากมาย

ชอบบทความนี้ไหม? ติดตาม Shaip บน LinkedIn เพื่อรับข้อมูลอัปเดตเพิ่มเติม

แบ่งปันสังคม