การตรวจจับข้อความด้วย OCR และการใส่คำอธิบายประกอบการถอดเสียง

Shaip นำเสนอการใส่คำอธิบายประกอบการถอดเสียงระดับคำและระดับตัวอักษรจากแหล่งข้อความที่หลากหลาย เช่น เอกสารสิ่งพิมพ์ ลายมือ ป้าย สัญลักษณ์ ป้ายทะเบียนรถ ใบเสร็จรับเงิน โดยสร้างเป็นชุดข้อมูล OCR และระบบอัจฉริยะด้านเอกสารระดับใช้งานจริงด้วยความแม่นยำ 99%

การตรวจจับข้อความด้วย OCR และการใส่คำอธิบายประกอบการถอดเสียง

ภาพรวมโครงการ

เนื่องจากเทคโนโลยี OCR ก้าวข้ามขอบเขตของเอกสารสิ่งพิมพ์ที่คมชัดไปสู่ข้อความในฉากจริงและการวิเคราะห์ข้อมูลเอกสาร ลูกค้าจึงต้องการระบบการประมวลผลคำอธิบายประกอบที่สามารถจัดการกับประเภทข้อความ แบบอักษร การวางแนว ภาษา และสภาพพื้นผิวที่หลากหลาย ด้วยความแม่นยำทั้งในเชิงพื้นที่และระดับตัวอักษร

Shaip ได้สร้างไปป์ไลน์การทำคำอธิบายประกอบแบบครบวงจร ครอบคลุมตั้งแต่การวางกรอบขอบเขตระดับคำ การถอดเสียงตัวอักษรอย่างแม่นยำ การติดแท็กหลายคุณลักษณะ และการตรวจสอบคุณภาพเชิงพื้นที่และการถอดเสียงแบบคู่ ซึ่งทำให้ได้ชุดข้อมูล OCR ที่พร้อมใช้งานสำหรับโมเดลจากแหล่งข้อความมากกว่า 10 ประเภท

สถิติสำคัญ

คำอธิบายประกอบต่อภาพ

100 คำ

เกณฑ์ความแม่นยำ

99%

แหล่งที่มาของข้อความ

10 +

เลเยอร์แอตทริบิวต์

5

ชาเลนจ์ (Challenge)

  • คำอธิบายประกอบ ข้อความทุกอินสแตนซ์ที่มองเห็นได้ ในระดับคำ — หลายร้อยคำต่อภาพที่มีความหนาแน่นสูง
  • รวม ความแม่นยำของกรอบขอบเขตเชิงพื้นที่ สีสดสวย การถอดเสียงระดับตัวอักษรที่แม่นยำ ในแบบคู่ขนาน
  • การจัดการ ข้อความที่โค้งงอ บิดเบี้ยว และหมุนไปจากแนวตรง บนป้ายโฆษณาและฉลากผลิตภัณฑ์
  • ถอดความ จางลง ความคมชัดต่ำ และถูกบดบังบางส่วน คำต่างๆ โดยไม่ต้องเดาตัวอักษรที่อ่านไม่ออก
  • ผู้จัดการ ข้อความผสมภาษาและหลายอักษร ภายในภาพเดียวกัน

Solution

การระบุตำแหน่งเชิงพื้นที่ระดับคำ

ข้อความทุกส่วนที่ปรากฏในแต่ละภาพจะถูกระบุด้วยกรอบสี่เหลี่ยมที่พอดีกับแต่ละคำอย่างแม่นยำ เพื่อบันทึกตำแหน่งเชิงพื้นที่ที่แน่นอนขององค์ประกอบข้อความแต่ละส่วน สำหรับภาพที่มีรายละเอียดสูง เช่น ใบเสร็จหรือแบบฟอร์ม นั่นหมายถึงการระบุข้อความหลายร้อยรายการต่อภาพ โดยแต่ละรายการยังคงรักษาความแม่นยำในการจัดแนวพื้นฐานไว้

การถอดเสียงระดับตัวอักษร

นอกเหนือจากกรอบสี่เหลี่ยมที่ล้อมรอบแล้ว ผู้ให้ข้อมูลยังถอดความเนื้อหาข้อความของแต่ละคำอย่างแม่นยำ รวมถึงตัวเลข อักขระพิเศษ เครื่องหมายวรรคตอน และการผสมตัวอักษรและตัวเลข กระบวนการทำงานแบบคู่ขนานนี้ — การระบุตำแหน่งและการถอดความ — ดำเนินการควบคู่กันไปโดยมีกฎเกณฑ์ความสอดคล้องในทั้งสองชั้น

การครอบคลุมจากหลายแหล่ง

ขอบเขตการรวบรวมข้อมูลครอบคลุมแหล่งข้อมูลที่หลากหลายมาก ได้แก่ เอกสารสิ่งพิมพ์ บันทึกที่เขียนด้วยลายมือ ป้ายบอกทาง ป้ายผลิตภัณฑ์ ป้ายทะเบียนรถยนต์ หน้าร้าน ป้ายโฆษณา ใบเสร็จรับเงิน ใบแจ้งหนี้ เมนู และช่องกรอกข้อมูลในแบบฟอร์ม แหล่งข้อมูลแต่ละประเภทมีแนวทางการเขียนคำอธิบายประกอบเฉพาะที่ปรับให้เข้ากับลักษณะทาง視覚ของแหล่งข้อมูลนั้นๆ

การติดแท็กคุณลักษณะ 5 ชั้น

แต่ละส่วนของข้อความที่ถูกระบุคำอธิบายประกอบจะได้รับการเสริมด้วยคุณลักษณะต่างๆ ครอบคลุมถึงการวางแนวข้อความ (แนวนอน แนวตั้ง แนวทแยง) ภาษาและรูปแบบตัวอักษร ความชัดเจนของข้อความ (อ่านได้ชัดเจน อ่านได้บางส่วน อ่านไม่ออกเลย) รูปแบบตัวอักษร (พิมพ์หรือเขียนด้วยมือ) และประเภทพื้นหลังของข้อความ (เรียบ มีลวดลาย ซับซ้อน) เลเยอร์คุณลักษณะที่หลากหลายนี้ช่วยให้โมเดลที่ได้รับการฝึกฝนสามารถจัดการกับสภาพข้อความในโลกแห่งความเป็นจริงที่หลากหลายได้มากกว่า OCR เอกสารมาตรฐาน

เกณฑ์การมองเห็นและการตรวจสอบคุณภาพแบบคู่

มีการกำหนดแนวทางที่เข้มงวดสำหรับเกณฑ์ความชัดเจนขั้นต่ำ โดยข้อความที่ไม่สามารถอ่านได้จะถูกทำเครื่องหมายไว้แทนที่จะคาดเดา เพื่อรักษาความสมบูรณ์ของชุดข้อมูล ภาพที่ได้รับการระบุคำอธิบายประกอบทุกภาพต้องผ่านกระบวนการตรวจสอบคุณภาพสองระดับ ซึ่งรวมถึงการตรวจสอบความแม่นยำของกรอบล้อมรอบและการตรวจสอบความถูกต้องของการถอดความ โดยมีเกณฑ์ความถูกต้อง 99% ในทั้งสองระดับ

ขอบเขตโครงการ

ประเภทชุดข้อมูล ระดับคำอธิบายประกอบ แหล่งที่มา คุณสมบัติ QA ความถูกต้อง
การตรวจจับข้อความด้วย OCR + การถอดเสียง กล่องข้อความ + การถอดเสียงตัวอักษร แหล่งข้อมูลมากกว่า 10 ประเภท เลเยอร์แอตทริบิวต์ 5 ชั้น QC แบบ Dual spatial + transcription 99%

ผลลัพธ์

  • ก่อตั้งเป็น กระบวนการถอดเสียงแบบคู่ขนานระดับคำเชิงพื้นที่ + ระดับตัวอักษร สำหรับ AI OCR
  • มาตรฐาน ครอบคลุมแหล่งข้อมูลมากกว่า 10 แหล่ง ครอบคลุมทั้งเอกสาร ข้อความในฉาก และลายมือ
  • จัดส่ง เลเยอร์แอตทริบิวต์ 5 ชั้น เพื่อการวางแนว ภาษา ความชัดเจน รูปแบบตัวอักษร และพื้นหลัง
  • การบำรุงรักษา ประตูความแม่นยำ 99% ครอบคลุมทั้งชั้น QA ด้านพื้นที่และการถอดรหัส
  • เปิดใช้งานของลูกค้า การแปลงเอกสารเป็นดิจิทัล, OCR สำหรับธุรกิจค้าปลีก, การนำทาง, การธนาคาร และกฎหมาย แอปพลิเคชั่น AI

โดยรวมแล้ว Shaip ช่วยเปลี่ยนความต้องการการระบุข้อความจากหลายแหล่งให้กลายเป็นไปป์ไลน์ OCR ที่มีโครงสร้างและพร้อมใช้งานในระดับการผลิต ซึ่งสามารถรองรับการแปลงเอกสารเป็นดิจิทัล การตรวจจับข้อความในภาพ การวิเคราะห์ข้อมูลค้าปลีก ระบบอัตโนมัติทางการธนาคาร และ AI สำหรับการปฏิบัติตามกฎหมาย ด้วยความแม่นยำทั้งด้านพื้นที่และการถอดเสียง

ไอคอนคำคม

Shaip สามารถจัดการกับกรณีพิเศษของ OCR ที่ผู้ให้บริการส่วนใหญ่ทำไม่ได้ เช่น ข้อความบนป้ายโค้ง ตัวอักษรผสม ใบเสร็จที่ซีดจาง และบันทึกที่เขียนด้วยลายมือ การตรวจสอบคุณภาพแบบคู่ขนานของพวกเขา ทั้งในส่วนของกรอบล้อมรอบและการถอดเสียง ทำให้เราได้ข้อมูลฝึกฝนที่เราสามารถนำไปใช้ได้จริง

— ผู้อำนวยการ ฝ่าย AI ด้านเอกสาร

★★★★★
ไอคอนคำคม