การรู้จำเสียงพูดอัตโนมัติ (ASR) มาไกลแล้ว แม้ว่าจะถูกประดิษฐ์ขึ้นเมื่อนานมาแล้ว แต่ก็แทบจะไม่มีใครใช้เลย อย่างไรก็ตาม เวลาและเทคโนโลยีได้เปลี่ยนแปลงไปอย่างมากในขณะนี้ การถอดเสียงมีวิวัฒนาการอย่างมาก
เทคโนโลยีเช่น AI (ปัญญาประดิษฐ์) ได้ขับเคลื่อนกระบวนการแปลเสียงเป็นข้อความเพื่อผลลัพธ์ที่รวดเร็วและแม่นยำ เป็นผลให้แอปพลิเคชันในโลกแห่งความเป็นจริงเพิ่มขึ้นด้วยแอพยอดนิยมบางตัวเช่น Tik Tok, Spotify และ Zoom ที่ฝังกระบวนการไว้ในแอพมือถือของพวกเขา
ให้เราสำรวจ ASR และค้นพบว่าทำไมมันถึงเป็นหนึ่งในเทคโนโลยีที่ได้รับความนิยมมากที่สุดในปี 2022
คำพูดเป็นข้อความคืออะไร?
การแปลงเสียงพูดเป็นข้อความ (Speech-to-text: STT) หรือที่เรียกว่าการรู้จำเสียงพูดอัตโนมัติ (ASR) จะแปลงเสียงพูดเป็นข้อความ ระบบสมัยใหม่เป็นบริการซอฟต์แวร์ที่วิเคราะห์สัญญาณเสียงและแสดงผลคำพร้อมค่าประทับเวลาและคะแนนความเชื่อมั่น
สำหรับทีมที่สร้างศูนย์ติดต่อลูกค้า การดูแลสุขภาพ และ UX ของเสียง STT ถือเป็นประตูสู่การสนทนาที่ค้นหาและวิเคราะห์ได้ คำบรรยายช่วยเหลือ และ AI ปลายทาง เช่น การสรุปหรือ QA
ชื่อสามัญของคำพูดเป็นข้อความ
เทคโนโลยีการรู้จำเสียงขั้นสูงนี้ยังเป็นที่นิยมและเรียกตามชื่อ:
- การรู้จำเสียงพูดอัตโนมัติ (ASR)
- การรู้จำเสียงพูด
- การรู้จำเสียงพูดของคอมพิวเตอร์
- การถอดเสียงเป็นคำ
- การอ่านหน้าจอ
การประยุกต์ใช้เทคโนโลยีการแปลงคำพูดเป็นข้อความ
ศูนย์ติดต่อ
การถอดเสียงแบบเรียลไทม์ช่วยสนับสนุนตัวแทนแบบเรียลไทม์ การถอดเสียงแบบแบตช์ช่วยควบคุม QA การตรวจสอบการปฏิบัติตามข้อกำหนด และการเก็บถาวรการโทรที่ค้นหาได้
ตัวอย่าง : ใช้ระบบ ASR แบบเรียลไทม์เพื่อแสดงข้อความแจ้งเตือนระหว่างการโต้แย้งเรื่องการเรียกเก็บเงิน จากนั้นทำการถอดเสียงแบบกลุ่มหลังจากการสนทนาเสร็จสิ้นเพื่อประเมินคุณภาพและสร้างสรุปโดยอัตโนมัติ
การดูแลสุขภาพ
แพทย์จะจดบันทึกและรับสรุปการเข้าพบแพทย์ บันทึกการสนทนาจะสนับสนุนการเข้ารหัส (CPT/ICD) และการบันทึกข้อมูลทางคลินิก โดยมีการป้องกัน PHI เสมอ
ตัวอย่าง : ผู้ให้บริการบันทึกการให้คำปรึกษา เรียกใช้ ASR เพื่อร่างบันทึก SOAP และไฮไลต์ชื่อยาและข้อมูลสำคัญโดยอัตโนมัติสำหรับการตรวจสอบโดยผู้ให้รหัส โดยมีการใช้การปกปิดข้อมูลส่วนบุคคลด้านสุขภาพ (PHI)
สื่อและการศึกษา
สร้างคำบรรยาย/คำบรรยายใต้ภาพสำหรับการบรรยาย เว็บสัมมนา และการออกอากาศ เพิ่มการแก้ไขโดยมนุษย์เล็กน้อยเมื่อคุณต้องการความแม่นยำที่เกือบสมบูรณ์แบบ
ตัวอย่าง : มหาวิทยาลัยแห่งหนึ่งถอดเสียงวิดีโอการบรรยายเป็นชุด จากนั้นผู้ตรวจสอบจะแก้ไขชื่อและคำศัพท์เฉพาะทางก่อนที่จะเผยแพร่คำบรรยายที่เข้าถึงได้ง่าย
ผลิตภัณฑ์เสียงและ IVR
การจดจำคำปลุกและคำสั่งช่วยให้สามารถใช้ UX ได้ฟรีในแอป ตู้บริการข้อมูล ยานพาหนะ และอุปกรณ์อัจฉริยะ ส่วน IVR จะใช้การถอดเสียงเพื่อกำหนดเส้นทางและแก้ไขปัญหา
ตัวอย่าง : ระบบตอบรับอัตโนมัติ (IVR) ของธนาคารจะรับรู้คำสั่ง “ระงับบัตรของฉัน” ยืนยันรายละเอียด และเริ่มขั้นตอนการทำงาน โดยไม่จำเป็นต้องกดปุ่มใดๆ
การดำเนินงานและความรู้
การประชุมและการโทรภาคสนามจะกลายเป็นข้อความที่ค้นหาได้พร้อมทั้งมีการระบุเวลา ผู้พูด และรายการการดำเนินการเพื่อการฝึกสอนและการวิเคราะห์
ตัวอย่าง : บันทึกการสนทนาทางโทรศัพท์เพื่อการขายจะถูกถอดเสียง ติดแท็กตามหัวข้อ (ราคา ข้อโต้แย้ง) และสรุป ผู้จัดการจะกรองตาม "ความเสี่ยงในการต่อสัญญา" เพื่อวางแผนการติดตามผล
ทำไมคุณจึงควรใช้คำพูดเป็นข้อความ?
- ทำให้การสนทนาสามารถค้นพบได้เปลี่ยนเสียงหลายชั่วโมงให้เป็นข้อความที่ค้นหาได้สำหรับการตรวจสอบ การฝึกอบรม และข้อมูลเชิงลึกของลูกค้า
- การถอดเสียงด้วยตนเองแบบอัตโนมัติ. ลดเวลาและต้นทุนในการดำเนินการเมื่อเทียบกับเวิร์กโฟลว์ที่ดำเนินการโดยมนุษย์เพียงอย่างเดียว ในขณะที่ยังคงรักษามาตรฐานการทำงานโดยมนุษย์ซึ่งคุณภาพจะต้องสมบูรณ์แบบ
- พลัง AI ดาวน์สตรีมการสรุปข้อมูลการถอดเสียง การแยกเจตนา/หัวข้อ การกำหนดธงการปฏิบัติตาม และการฝึกสอน
- ปรับปรุงการช่วยสำหรับการเข้าถึงคำบรรยายและบทถอดเสียงช่วยให้ผู้ใช้ที่มีปัญหาการได้ยินและปรับปรุง UX ในสภาพแวดล้อมที่มีเสียงดัง
- รองรับการตัดสินใจแบบเรียลไทม์การสตรีม ASR ช่วยให้สามารถให้คำแนะนำในการโทร แบบฟอร์มแบบเรียลไทม์ และการตรวจสอบแบบสด
ประโยชน์ของเทคโนโลยีการแปลงคำพูดเป็นข้อความ
ความยืดหยุ่นของความเร็วและโหมด
การสตรีมช่วยให้สามารถใช้งานแบบสดได้ในระดับวินาทีย่อยๆ ขณะเดียวกันก็ยังสามารถประมวลผลงานค้างได้อย่างละเอียดมากขึ้น
ตัวอย่าง : ถอดเสียงแบบเรียลไทม์เพื่อช่วยเหลือเจ้าหน้าที่ จากนั้นถอดเสียงซ้ำเป็นชุดในภายหลังเพื่อจัดเก็บเป็นไฟล์ที่มีคุณภาพตามมาตรฐาน QA
คุณสมบัติคุณภาพที่สร้างขึ้นใน
รับการแบ่งวรรคตอน การใช้เครื่องหมายวรรคตอน/การใช้ตัวพิมพ์เล็ก/ใหญ่ การประทับเวลา และคำแนะนำวลี/คำศัพท์ที่กำหนดเองเพื่อจัดการกับศัพท์แสง
ตัวอย่าง : ติดป้ายกำกับลำดับการพบแพทย์/ผู้ป่วย และเน้นชื่อยาเพื่อให้บันทึกได้อย่างถูกต้อง
ทางเลือกการใช้งาน
ใช้ API ของคลาวด์สำหรับการปรับขนาด/อัปเดต หรือคอนเทนเนอร์ภายในองค์กร/เอจสำหรับการเก็บข้อมูลและความหน่วงต่ำ
ตัวอย่าง : โรงพยาบาลแห่งหนึ่งใช้งาน ASR ในศูนย์ข้อมูลของตนเองเพื่อเก็บรักษาข้อมูล PHI ไว้ในสถานที่
การปรับแต่งและหลายภาษา
ปิดช่องว่างความแม่นยำด้วยรายการวลีและการปรับโดเมน รองรับหลายภาษาและการสลับโค้ด
ตัวอย่าง : แอปพลิเคชันฟินเทคช่วยโปรโมตชื่อแบรนด์และสัญลักษณ์หุ้นในภาษาอังกฤษ/ฮิงลิช จากนั้นจึงปรับแต่งให้เหมาะสมกับคำเฉพาะกลุ่ม
ทำความเข้าใจการทำงานของการรู้จำเสียงอัตโนมัติ

การทำงานของซอฟต์แวร์แปลเสียงเป็นข้อความมีความซับซ้อนและเกี่ยวข้องกับการดำเนินการหลายขั้นตอน อย่างที่เราทราบกันดีว่าคำพูดเป็นข้อความเป็นซอฟต์แวร์พิเศษที่ออกแบบมาเพื่อแปลงไฟล์เสียงให้อยู่ในรูปแบบข้อความที่แก้ไขได้ มันทำได้โดยใช้ประโยชน์จากการจดจำเสียง
กระบวนการ
- ในขั้นต้น โดยใช้ตัวแปลงแอนะล็อกเป็นดิจิทัล โปรแกรมคอมพิวเตอร์ใช้อัลกอริธึมทางภาษากับข้อมูลที่ให้มาเพื่อแยกความแตกต่างของการสั่นจากสัญญาณการได้ยิน
- ถัดไป เสียงที่เกี่ยวข้องจะถูกกรองโดยการวัดคลื่นเสียง
- นอกจากนี้ เสียงจะถูกกระจาย/แบ่งส่วนออกเป็นร้อยหรือพันวินาทีและจับคู่กับหน่วยเสียง (หน่วยเสียงที่วัดได้เพื่อแยกคำหนึ่งจากคำอื่น)
- หน่วยเสียงจะดำเนินการต่อไปโดยใช้แบบจำลองทางคณิตศาสตร์เพื่อเปรียบเทียบข้อมูลที่มีอยู่กับคำ ประโยค และวลีที่เป็นที่รู้จัก
- ผลลัพธ์เป็นข้อความหรือไฟล์เสียงที่ใช้คอมพิวเตอร์
[อ่านเพิ่มเติม: ภาพรวมโดยละเอียดของระบบรู้จำเสียงพูดอัตโนมัติ ]
การใช้คำพูดเป็นข้อความคืออะไร
มีซอฟต์แวร์การรู้จำเสียงพูดอัตโนมัติหลายตัวเช่น
- การค้นหาเนื้อหา: พวกเราส่วนใหญ่เปลี่ยนจากการพิมพ์ตัวอักษรบนโทรศัพท์ไปเป็นการกดปุ่มเพื่อให้ซอฟต์แวร์จดจำเสียงของเราและให้ผลลัพธ์ที่ต้องการ
- การบริการของลูกค้า: Chatbots และผู้ช่วย AI ที่สามารถแนะนำลูกค้าผ่านขั้นตอนเริ่มต้นไม่กี่ขั้นตอนได้กลายเป็นเรื่องปกติ
- คำบรรยายแบบเรียลไทม์: ด้วยการเข้าถึงเนื้อหาทั่วโลกที่เพิ่มขึ้น คำอธิบายภาพแบบเรียลไทม์จึงกลายเป็นตลาดที่โดดเด่นและมีความสำคัญ ผลักดัน ASR ไปข้างหน้าสำหรับการใช้งาน
- เอกสารอิเล็กทรอนิกส์: ฝ่ายบริหารหลายแห่งเริ่มใช้ ASR เพื่อบรรลุวัตถุประสงค์ด้านเอกสาร เพื่อรองรับความเร็วและประสิทธิภาพที่ดีขึ้น
อะไรคือความท้าทายหลักในการรู้จำเสียง?
สำเนียงและภาษาถิ่นคำเดียวกันอาจฟังดูแตกต่างกันมากในแต่ละภูมิภาค ซึ่งทำให้โมเดลที่ฝึกฝนด้วยภาษาพูด "มาตรฐาน" เกิดความสับสน วิธีแก้ไขนั้นง่ายมาก: รวบรวมและทดสอบด้วยเสียงที่มีสำเนียงหลากหลาย และเพิ่มคำแนะนำเกี่ยวกับวลี/การออกเสียงสำหรับชื่อแบรนด์ สถานที่ และบุคคล
บริบทและคำพ้องเสียงการเลือกใช้คำที่ถูกต้อง (“to/too/two”) จำเป็นต้องอาศัยบริบทโดยรอบและความรู้เฉพาะด้าน ใช้แบบจำลองภาษาที่แข็งแกร่งกว่า ปรับให้เข้ากับข้อความเฉพาะด้านของคุณ และตรวจสอบความถูกต้องของเอนทิตีที่สำคัญ เช่น ชื่อยาหรือ SKU
เสียงรบกวนและช่องสัญญาณเสียงที่ไม่ดีการจราจร เสียงแทรกซ้อน ตัวแปลงสัญญาณการโทร และไมโครโฟนที่อยู่ไกลเกินไป ทำให้เสียงสำคัญถูกกลบ ลดเสียงรบกวนและปรับระดับเสียงให้เป็นมาตรฐาน ใช้การตรวจจับกิจกรรมเสียง จำลองเสียงรบกวน/ตัวแปลงสัญญาณจริงในการฝึกอบรม และเลือกใช้ไมโครโฟนคุณภาพดีกว่าเท่าที่จะทำได้
การสลับภาษาและการพูดหลายภาษาผู้คนมักผสมภาษาหรือสลับภาษาในระหว่างประโยค ซึ่งทำให้แบบจำลองภาษาเดียวใช้งานไม่ได้ ควรเลือกแบบจำลองหลายภาษาหรือแบบจำลองที่รับรู้การสลับภาษา ประเมินผลจากไฟล์เสียงที่มีหลายภาษา และรักษาลิสต์วลีเฉพาะพื้นที่ไว้
ผู้พูดหลายคนและการพูดซ้อนทับกันเมื่อเสียงซ้อนทับกัน การถอดเสียงจะทำให้ไม่ชัดเจนว่า "ใครพูดอะไร" เปิดใช้งานการแยกเสียงผู้พูดเพื่อระบุลำดับการพูด และใช้การแยกเสียง/การสร้างลำแสงหากมีการบันทึกเสียงจากไมโครโฟนหลายตัว
การใช้ภาพประกอบในการบันทึกในวิดีโอ การขยับริมฝีปากและข้อความบนหน้าจอจะเพิ่มความหมายที่เสียงอย่างเดียวอาจขาดหายไป ในกรณีที่คุณภาพมีความสำคัญ ให้ใช้แบบจำลองภาพและเสียง และจับคู่ ASR กับ OCR เพื่อบันทึกชื่อเรื่อง ชื่อ และคำศัพท์ในสไลด์
คุณภาพของการบันทึกและการติดป้ายกำกับ การถอดเสียงที่ไม่สอดคล้องกัน การระบุผู้พูดผิด หรือเครื่องหมายวรรคตอนที่ไม่เรียบร้อย จะบั่นทอนทั้งการฝึกอบรมและการประเมินผล ควรกำหนดคู่มือรูปแบบที่ชัดเจน ตรวจสอบตัวอย่างอย่างสม่ำเสมอ และเก็บชุดตัวอย่างมาตรฐานขนาดเล็กไว้เพื่อวัดความสม่ำเสมอของผู้บันทึก
ความเป็นส่วนตัวและการปฏิบัติตามกฎระเบียบ การโทรและการบันทึกทางการแพทย์อาจมีข้อมูลส่วนบุคคลที่ระบุตัวตนได้ (PII/PHI) ดังนั้นการจัดเก็บและการเข้าถึงจึงต้องได้รับการควบคุมอย่างเข้มงวด ควรแก้ไขหรือลบข้อมูลส่วนบุคคลออกจากผลลัพธ์ จำกัดการเข้าถึง และเลือกใช้ระบบคลาวด์แทนการใช้งานภายในองค์กร/ระบบ Edge เพื่อให้เป็นไปตามนโยบายของคุณ
วิธีเลือกผู้จำหน่ายการแปลงคำพูดเป็นข้อความที่ดีที่สุด
เลือกผู้ให้บริการโดยการทดสอบเสียงของคุณ (สำเนียง อุปกรณ์ เสียงรบกวน) และชั่งน้ำหนักความแม่นยำกับความเป็นส่วนตัว ความหน่วง และต้นทุน เริ่มจากสิ่งเล็กๆ วัดผล แล้วค่อยขยายขนาด
กำหนดความต้องการก่อน
- กรณีการใช้งาน: สตรีมมิ่ง, แบตช์ หรือทั้งสองอย่าง
- ภาษา/สำเนียง (รวมถึงการสลับรหัส)
- ช่องเสียง: โทรศัพท์ (8 kHz), แอป/เดสก์ท็อป, ระยะไกล
- ความเป็นส่วนตัว/ถิ่นที่อยู่: PII/PHI, ภูมิภาค, การเก็บรักษา, การตรวจสอบ
- ข้อจำกัด: เป้าหมายเวลาแฝง, SLA, งบประมาณ, คลาวด์เทียบกับออนพรีมิส/เอจ
ประเมินเสียงของคุณ
- ความแม่นยำ: WER + ความแม่นยำของเอนทิตี (ศัพท์แสง ชื่อ รหัส)
- ผู้พูดหลายคน: คุณภาพการเขียนไดอารี่ (ใครพูดเมื่อไหร่)
- การจัดรูปแบบ: เครื่องหมายวรรคตอน, ตัวพิมพ์ใหญ่, ตัวเลข/วันที่
- การสตรีม: TTFT/TTF ความหน่วง + ความเสถียร
- คุณสมบัติ: รายการวลี, โมเดลที่กำหนดเอง, การแก้ไข, ตราประทับเวลา
ถามใน RFP
- แสดงผลลัพธ์ดิบบนชุดทดสอบของเรา (ตามสำเนียง/สัญญาณรบกวน)
- ให้ความหน่วงการสตรีม p50/p95 บนคลิปของเรา
- ความแม่นยำในการเขียนไดอะแกรมสำหรับผู้พูด 2–3 คนพร้อมการทับซ้อน
- การจัดการข้อมูล: การประมวลผลในภูมิภาค การเก็บรักษา บันทึกการเข้าถึง
- เส้นทางจากรายการวลี → โมเดลที่กำหนดเอง (ข้อมูล เวลา ต้นทุน)
ระวังธงสีแดง
- เดโม่เยี่ยมมาก แต่ผลลัพธ์เสียงของคุณไม่ดี
- “เราจะแก้ไขด้วยการปรับปรุง” แต่ไม่มีแผน/ข้อมูล
- ค่าธรรมเนียมที่ซ่อนอยู่สำหรับการจัดทำไดอารี่/การแก้ไข/การจัดเก็บ
[อ่านเพิ่มเติม: ทำความเข้าใจกระบวนการรวบรวมข้อมูลเสียงสำหรับการรู้จำเสียงพูดอัตโนมัติ ]
อนาคตของเทคโนโลยีการแปลงคำพูดเป็นข้อความ
โมเดลพื้นฐานขนาดใหญ่ที่รองรับหลายภาษาคาดหวังโมเดลเดียวที่ครอบคลุมมากกว่า 100 ภาษา พร้อมความแม่นยำที่ดีขึ้นในทรัพยากรน้อย berkat การฝึกฝนล่วงหน้าจำนวนมากและการปรับแต่งเล็กน้อย
การประมวลผลเสียงและการแปลรวมอยู่ในระบบเดียวโมเดลแบบรวมจะจัดการทั้งระบบรู้จำเสียงพูด (ASR) การแปลงเสียงเป็นข้อความ และแม้กระทั่งการแปลงเสียงเป็นเสียงพูด ช่วยลดความหน่วงและโค้ดเชื่อมต่อที่ซับซ้อน
การจัดรูปแบบและการแยกเสียงพูดที่ชาญฉลาดขึ้นโดยค่าเริ่มต้น การใส่เครื่องหมายวรรคตอนอัตโนมัติ การใช้ตัวพิมพ์ใหญ่-เล็ก ตัวเลข และการระบุ "ใครพูดเมื่อไหร่" ที่เชื่อถือได้ จะถูกรวมเข้าไว้ในระบบมากขึ้นเรื่อยๆ ทั้งสำหรับการประมวลผลแบบกลุ่มและแบบสตรีมมิ่ง
การรู้จำภาพและเสียงสำหรับสภาพแวดล้อมที่ยากลำบากการใช้สัญญาณจากริมฝีปากและข้อความบนหน้าจอ (OCR) จะช่วยเพิ่มประสิทธิภาพการถอดเสียงเมื่อเสียงมีเสียงรบกวน ซึ่งเป็นพื้นที่วิจัยที่กำลังพัฒนาอย่างรวดเร็วและมีต้นแบบผลิตภัณฑ์ในระยะเริ่มต้นแล้ว
การฝึกอบรมที่คำนึงถึงความเป็นส่วนตัวเป็นอันดับแรก และการเรียนรู้บนอุปกรณ์/ระบบปลายทางการเรียนรู้แบบกระจายศูนย์และการใช้งานแบบคอนเทนเนอร์จะช่วยรักษาข้อมูลไว้ในพื้นที่ขณะที่ยังคงปรับปรุงโมเดลให้ดีขึ้น ซึ่งเป็นสิ่งสำคัญสำหรับภาคส่วนที่อยู่ภายใต้การกำกับดูแล
AI ที่คำนึงถึงกฎระเบียบกำหนดเวลาของกฎหมาย AI ของสหภาพยุโรปหมายถึงความโปร่งใส การควบคุมความเสี่ยง และเอกสารประกอบที่มากขึ้นในผลิตภัณฑ์และการจัดซื้อจัดจ้างของ STT
การประเมินที่ครอบคลุมมากขึ้นนอกเหนือจาก WER (Whole Sale Rate)ทีมงานจะกำหนดมาตรฐานโดยพิจารณาจากความถูกต้องของข้อมูลพื้นฐาน คุณภาพการแยกเสียงพูด ความหน่วง (TTFT/TTF) และความเป็นธรรมในการใช้สำเนียง/อุปกรณ์ต่างๆ ไม่ใช่แค่ WER ในหัวข้อข่าวเท่านั้น
Shaip ช่วยคุณไปถึงจุดนั้นได้อย่างไร
เมื่อเทรนด์เหล่านี้เกิดขึ้น ความสำเร็จยังคงขึ้นอยู่กับข้อมูลของคุณ Shaip จัดหาชุดข้อมูลหลายภาษาที่มีสำเนียงหลากหลาย การปกปิดข้อมูลส่วนบุคคลที่ปลอดภัย และชุดทดสอบมาตรฐาน (WER, เอนทิตี, การแยกเสียงพูด, ความหน่วง) เพื่อเปรียบเทียบผู้ให้บริการอย่างยุติธรรมและปรับแต่งโมเดล เพื่อให้คุณสามารถนำเทคโนโลยี STT ในอนาคตมาใช้ได้อย่างมั่นใจพูดคุยกับผู้เชี่ยวชาญด้านข้อมูล ASR ของ Shaipเพื่อวางแผนโครงการนำร่องอย่างรวดเร็ว