กรณีศึกษา: การรวบรวมคำพูด
ส่งมอบ 7M+ Utterances เพื่อสร้างผู้ช่วยดิจิทัลหลายภาษาใน 13 ภาษา
โซลูชั่นโลกแห่งความจริง
ข้อมูลที่ขับเคลื่อนการสนทนาทั่วโลก
ความจำเป็นในการฝึกอบรม Utterance เกิดขึ้นเนื่องจากลูกค้าบางรายอาจใช้คำหรือวลีที่แน่นอนในขณะที่โต้ตอบหรือถามคำถามกับผู้ช่วยเสียงในรูปแบบสคริปต์ นั่นเป็นเหตุผลที่แอปพลิเคชันเสียงเฉพาะต้องได้รับการฝึกอบรมเกี่ยวกับข้อมูลเสียงพูดที่เกิดขึ้นเอง เช่น “โรงพยาบาลที่ใกล้ที่สุดอยู่ที่ไหน” “หาโรงพยาบาลใกล้ฉัน” หรือ “มีโรงพยาบาลใกล้ๆ ไหม” ทั้งหมดระบุจุดประสงค์ในการค้นหาเดียวกันแต่ใช้ถ้อยคำต่างกัน
ปัญหา
เพื่อดำเนินการตามแผนงานการพูดของผู้ช่วยดิจิทัลของลูกค้าสำหรับภาษาทั่วโลก ทีมงานจำเป็นต้องได้รับข้อมูลการฝึกอบรมจำนวนมากสำหรับโมเดล AI การรู้จำเสียงพูด ข้อกำหนดที่สำคัญของลูกค้าคือ:
- รับข้อมูลการฝึกอบรมจำนวนมาก (พร้อมท์คำพูดของผู้พูดคนเดียวที่มีความยาวไม่เกิน 3-30 วินาที ) สำหรับบริการรู้จำเสียงพูดใน 13 ภาษาทั่วโลก
- สำหรับแต่ละภาษา ซัพพลายเออร์จะสร้างข้อความแจ้งให้ผู้พูดบันทึก (เว้นแต่
อุปกรณ์ของลูกค้า) และถ่ายทอดเสียงที่ได้ - ให้ข้อมูลเสียงและการถอดเสียงคำพูดที่บันทึกไว้ด้วยไฟล์ JSON ที่สอดคล้องกัน
มีข้อมูลเมตาสำหรับการบันทึกทั้งหมด - รับรองผู้พูดที่หลากหลายตามอายุ เพศ การศึกษา และภาษาถิ่น
- ตรวจสอบให้แน่ใจว่ามีสภาพแวดล้อมการบันทึกที่หลากหลายตามข้อกำหนด
- การบันทึกเสียงแต่ละรายการต้องมีอย่างน้อย 16kHz แต่ควรเป็น 44kHz
“หลังจากประเมินผู้ขายหลายรายแล้ว ลูกค้าเลือก Shaip เพราะมีความเชี่ยวชาญในโครงการ AI เชิงสนทนา เราประทับใจกับความสามารถในการดำเนินโครงการของ Shaip ความเชี่ยวชาญในการค้นหา ถอดเสียง และส่งมอบคำพูดที่ต้องการจากผู้เชี่ยวชาญด้านภาษาศาสตร์ใน 13 ภาษาภายในระยะเวลาที่เข้มงวดและด้วยคุณภาพตามที่ต้องการ”
Solution
ด้วยความเข้าใจอย่างลึกซึ้งเกี่ยวกับ AI ในการสนทนา เราจึงช่วยลูกค้ารวบรวม ถอดเสียง และใส่คำอธิบายประกอบข้อมูลกับทีมนักภาษาศาสตร์ผู้เชี่ยวชาญและผู้ทำหมายเหตุประกอบเพื่อฝึกอบรมชุดเสียงหลายภาษาที่ประมวลผลคำพูดที่ขับเคลื่อนด้วย AI
ขอบเขตงานของ Shaip รวมถึงแต่ไม่จำกัดเพียง การรวบรวมข้อมูลเสียงจำนวนมากสำหรับการฝึกฝนระบบรู้จำเสียงพูด การถอดเสียงบันทึกเสียงในหลายภาษาสำหรับทุกภาษาในแผนงานภาษา Tier 1 และ Tier 2 ของเรา และการส่งมอบ ไฟล์ JSON ที่เกี่ยวข้อง ซึ่งมีข้อมูลเมตา Shaip รวบรวมคำพูดที่มีความยาว 3-30 วินาทีในปริมาณมาก ในขณะที่ยังคงรักษาระดับคุณภาพที่ต้องการซึ่งจำเป็นต่อการฝึกฝนโมเดล ML สำหรับโครงการที่ซับซ้อน
- เสียงที่รวบรวม ถอดความ และใส่คำอธิบายประกอบ: 22,250 ชั่วโมง
- ภาษาที่รองรับ: 13 (เดนมาร์ก เกาหลี อาหรับซาอุดีอาระเบีย ดัตช์ จีนแผ่นดินใหญ่และไต้หวัน ฝรั่งเศส แคนาดา สเปนเม็กซิกัน ตุรกี ฮินดี โปแลนด์ ญี่ปุ่น รัสเซีย)
- จำนวนคำพูด: 7
- ระยะเวลา: เดือน 7 8-

ขณะรวบรวมเสียงพูดที่ 16 kHz เรามั่นใจว่าผู้พูดจะผสมกันอย่างเหมาะสมตามอายุ เพศ การศึกษา และภาษาถิ่นในสภาพแวดล้อมการบันทึกที่หลากหลาย
ความเชี่ยวชาญของเรา
ทรัพยากรที่แนะนำ
คู่มือผู้ซื้อ
คู่มือผู้ซื้อ: AI สนทนา
Chatbot ที่คุณสนทนาด้วยทำงานบนระบบ AI การสนทนาขั้นสูงที่ได้รับการฝึกอบรม ทดสอบ และสร้างโดยใช้ชุดข้อมูลการรู้จำเสียงพูดจำนวนมาก
บทความ
สถานะของการสนทนา AI 2025
อินโฟกราฟิก Conversational AI 2025 พูดถึง Conversational AI คืออะไร วิวัฒนาการ ประเภท ตลาด Conversational AI ตามภูมิภาค กรณีใช้งาน ความท้าทาย ฯลฯ
บทความ
Siri และ Alexa เข้าใจสิ่งที่คุณพูดได้อย่างไร
ผู้ช่วยเสียงอาจเป็นเสียงผู้หญิงที่เท่และโดดเด่นที่ตอบสนองต่อคำขอของคุณเพื่อค้นหาร้านอาหารที่ใกล้ที่สุดหรือเส้นทางที่สั้นที่สุดไปยังห้างสรรพสินค้า