การตรวจจับข้อความด้วย OCR และการใส่คำอธิบายประกอบการถอดเสียง
Shaip นำเสนอการใส่คำอธิบายประกอบการถอดเสียงระดับคำและระดับตัวอักษรจากแหล่งข้อความที่หลากหลาย เช่น เอกสารสิ่งพิมพ์ ลายมือ ป้าย สัญลักษณ์ ป้ายทะเบียนรถ ใบเสร็จรับเงิน โดยสร้างเป็นชุดข้อมูล OCR และระบบอัจฉริยะด้านเอกสารระดับใช้งานจริงด้วยความแม่นยำ 99%
ภาพรวมโครงการ
เนื่องจากเทคโนโลยี OCR ก้าวข้ามขอบเขตของเอกสารสิ่งพิมพ์ที่คมชัดไปสู่ข้อความในฉากจริงและการวิเคราะห์ข้อมูลเอกสาร ลูกค้าจึงต้องการระบบการประมวลผลคำอธิบายประกอบที่สามารถจัดการกับประเภทข้อความ แบบอักษร การวางแนว ภาษา และสภาพพื้นผิวที่หลากหลาย ด้วยความแม่นยำทั้งในเชิงพื้นที่และระดับตัวอักษร
Shaip ได้สร้างไปป์ไลน์การทำคำอธิบายประกอบแบบครบวงจร ครอบคลุมตั้งแต่การวางกรอบขอบเขตระดับคำ การถอดเสียงตัวอักษรอย่างแม่นยำ การติดแท็กหลายคุณลักษณะ และการตรวจสอบคุณภาพเชิงพื้นที่และการถอดเสียงแบบคู่ ซึ่งทำให้ได้ชุดข้อมูล OCR ที่พร้อมใช้งานสำหรับโมเดลจากแหล่งข้อความมากกว่า 10 ประเภท
สถิติสำคัญ
คำอธิบายประกอบต่อภาพ
100 คำ
เกณฑ์ความแม่นยำ
99%
แหล่งที่มาของข้อความ
10 +
เลเยอร์แอตทริบิวต์
5
ชาเลนจ์ (Challenge)
- คำอธิบายประกอบ ข้อความทุกอินสแตนซ์ที่มองเห็นได้ ในระดับคำ — หลายร้อยคำต่อภาพที่มีความหนาแน่นสูง
- รวม ความแม่นยำของกรอบขอบเขตเชิงพื้นที่ สีสดสวย การถอดเสียงระดับตัวอักษรที่แม่นยำ ในแบบคู่ขนาน
- การจัดการ ข้อความที่โค้งงอ บิดเบี้ยว และหมุนไปจากแนวตรง บนป้ายโฆษณาและฉลากผลิตภัณฑ์
- ถอดความ จางลง ความคมชัดต่ำ และถูกบดบังบางส่วน คำต่างๆ โดยไม่ต้องเดาตัวอักษรที่อ่านไม่ออก
- ผู้จัดการ ข้อความผสมภาษาและหลายอักษร ภายในภาพเดียวกัน
Solution
การระบุตำแหน่งเชิงพื้นที่ระดับคำ
ข้อความทุกส่วนที่ปรากฏในแต่ละภาพจะถูกระบุด้วยกรอบสี่เหลี่ยมที่พอดีกับแต่ละคำอย่างแม่นยำ เพื่อบันทึกตำแหน่งเชิงพื้นที่ที่แน่นอนขององค์ประกอบข้อความแต่ละส่วน สำหรับภาพที่มีรายละเอียดสูง เช่น ใบเสร็จหรือแบบฟอร์ม นั่นหมายถึงการระบุข้อความหลายร้อยรายการต่อภาพ โดยแต่ละรายการยังคงรักษาความแม่นยำในการจัดแนวพื้นฐานไว้
การถอดเสียงระดับตัวอักษร
นอกเหนือจากกรอบสี่เหลี่ยมที่ล้อมรอบแล้ว ผู้ให้ข้อมูลยังถอดความเนื้อหาข้อความของแต่ละคำอย่างแม่นยำ รวมถึงตัวเลข อักขระพิเศษ เครื่องหมายวรรคตอน และการผสมตัวอักษรและตัวเลข กระบวนการทำงานแบบคู่ขนานนี้ — การระบุตำแหน่งและการถอดความ — ดำเนินการควบคู่กันไปโดยมีกฎเกณฑ์ความสอดคล้องในทั้งสองชั้น
การครอบคลุมจากหลายแหล่ง
ขอบเขตการรวบรวมข้อมูลครอบคลุมแหล่งข้อมูลที่หลากหลายมาก ได้แก่ เอกสารสิ่งพิมพ์ บันทึกที่เขียนด้วยลายมือ ป้ายบอกทาง ป้ายผลิตภัณฑ์ ป้ายทะเบียนรถยนต์ หน้าร้าน ป้ายโฆษณา ใบเสร็จรับเงิน ใบแจ้งหนี้ เมนู และช่องกรอกข้อมูลในแบบฟอร์ม แหล่งข้อมูลแต่ละประเภทมีแนวทางการเขียนคำอธิบายประกอบเฉพาะที่ปรับให้เข้ากับลักษณะทาง視覚ของแหล่งข้อมูลนั้นๆ
การติดแท็กคุณลักษณะ 5 ชั้น
แต่ละส่วนของข้อความที่ถูกระบุคำอธิบายประกอบจะได้รับการเสริมด้วยคุณลักษณะต่างๆ ครอบคลุมถึงการวางแนวข้อความ (แนวนอน แนวตั้ง แนวทแยง) ภาษาและรูปแบบตัวอักษร ความชัดเจนของข้อความ (อ่านได้ชัดเจน อ่านได้บางส่วน อ่านไม่ออกเลย) รูปแบบตัวอักษร (พิมพ์หรือเขียนด้วยมือ) และประเภทพื้นหลังของข้อความ (เรียบ มีลวดลาย ซับซ้อน) เลเยอร์คุณลักษณะที่หลากหลายนี้ช่วยให้โมเดลที่ได้รับการฝึกฝนสามารถจัดการกับสภาพข้อความในโลกแห่งความเป็นจริงที่หลากหลายได้มากกว่า OCR เอกสารมาตรฐาน
เกณฑ์การมองเห็นและการตรวจสอบคุณภาพแบบคู่
มีการกำหนดแนวทางที่เข้มงวดสำหรับเกณฑ์ความชัดเจนขั้นต่ำ โดยข้อความที่ไม่สามารถอ่านได้จะถูกทำเครื่องหมายไว้แทนที่จะคาดเดา เพื่อรักษาความสมบูรณ์ของชุดข้อมูล ภาพที่ได้รับการระบุคำอธิบายประกอบทุกภาพต้องผ่านกระบวนการตรวจสอบคุณภาพสองระดับ ซึ่งรวมถึงการตรวจสอบความแม่นยำของกรอบล้อมรอบและการตรวจสอบความถูกต้องของการถอดความ โดยมีเกณฑ์ความถูกต้อง 99% ในทั้งสองระดับ
ขอบเขตโครงการ
| ประเภทชุดข้อมูล | ระดับคำอธิบายประกอบ | แหล่งที่มา | คุณสมบัติ | QA | ความถูกต้อง |
|---|---|---|---|---|---|
| การตรวจจับข้อความด้วย OCR + การถอดเสียง | กล่องข้อความ + การถอดเสียงตัวอักษร | แหล่งข้อมูลมากกว่า 10 ประเภท | เลเยอร์แอตทริบิวต์ 5 ชั้น | QC แบบ Dual spatial + transcription | 99% |
ผลลัพธ์
- ก่อตั้งเป็น กระบวนการถอดเสียงแบบคู่ขนานระดับคำเชิงพื้นที่ + ระดับตัวอักษร สำหรับ AI OCR
- มาตรฐาน ครอบคลุมแหล่งข้อมูลมากกว่า 10 แหล่ง ครอบคลุมทั้งเอกสาร ข้อความในฉาก และลายมือ
- จัดส่ง เลเยอร์แอตทริบิวต์ 5 ชั้น เพื่อการวางแนว ภาษา ความชัดเจน รูปแบบตัวอักษร และพื้นหลัง
- การบำรุงรักษา ประตูความแม่นยำ 99% ครอบคลุมทั้งชั้น QA ด้านพื้นที่และการถอดรหัส
- เปิดใช้งานของลูกค้า การแปลงเอกสารเป็นดิจิทัล, OCR สำหรับธุรกิจค้าปลีก, การนำทาง, การธนาคาร และกฎหมาย แอปพลิเคชั่น AI
โดยรวมแล้ว Shaip ช่วยเปลี่ยนความต้องการการระบุข้อความจากหลายแหล่งให้กลายเป็นไปป์ไลน์ OCR ที่มีโครงสร้างและพร้อมใช้งานในระดับการผลิต ซึ่งสามารถรองรับการแปลงเอกสารเป็นดิจิทัล การตรวจจับข้อความในภาพ การวิเคราะห์ข้อมูลค้าปลีก ระบบอัตโนมัติทางการธนาคาร และ AI สำหรับการปฏิบัติตามกฎหมาย ด้วยความแม่นยำทั้งด้านพื้นที่และการถอดเสียง
Shaip สามารถจัดการกับกรณีพิเศษของ OCR ที่ผู้ให้บริการส่วนใหญ่ทำไม่ได้ เช่น ข้อความบนป้ายโค้ง ตัวอักษรผสม ใบเสร็จที่ซีดจาง และบันทึกที่เขียนด้วยลายมือ การตรวจสอบคุณภาพแบบคู่ขนานของพวกเขา ทั้งในส่วนของกรอบล้อมรอบและการถอดเสียง ทำให้เราได้ข้อมูลฝึกฝนที่เราสามารถนำไปใช้ได้จริง
— ผู้อำนวยการ ฝ่าย AI ด้านเอกสาร