วิธีดึงข้อความภาษาไทยจาก PDF ที่สแกน (OCR)
อ่านข้อความจากเอกสารสแกนเป็นภาษาไทย ลาว อังกฤษ และภาษาอื่นอีกกว่า 20 ภาษา — ทำในเครื่องของคุณ
เอกสารสแกนคือรูปของหน้ากระดาษ จึงคัดลอกข้อความไม่ได้ OCR จะอ่านรูปนั้นแล้วแปลงเป็นข้อความที่คัดลอกได้ ทุกอย่างทำในเบราว์เซอร์ของคุณ — หน้าเอกสารไม่ถูกอัปโหลด
ขั้นตอน
- เปิด PDF ใน โปรแกรมแก้ไข
- กด ดึงข้อความ
- หน้าที่เป็นรูปสแกนจะถูกตรวจพบเอง เลือกภาษาของเอกสาร (เช่น ไทย) แล้วกด อ่านด้วย OCR
- ถ้าเลือกคัดลอกข้อความได้แต่ออกมาเป็นตัวอักษรแปลก ๆ ให้กด บังคับใช้ OCR มักเกิดกับเอกสารที่พิมพ์ด้วยฟอนต์เก่าที่ไม่ใช่ Unicode
- กด คัดลอกข้อความ หรือดาวน์โหลดเป็นไฟล์ .TXT หรือ Markdown
เพื่อผลลัพธ์ที่ดี
- เลือกภาษาให้ถูกก่อนเริ่ม — สำคัญที่สุด
- เอกสารที่สแกนตรงและชัดจะอ่านได้ดีกว่ารูปถ่ายที่เอียง
- OCR ใช้เวลา เอกสารยาวจะช้า และครั้งแรกต้องดาวน์โหลดข้อมูลของภาษานั้น
- ควรตรวจทานเสมอ OCR ดีมากแต่ไม่สมบูรณ์แบบ — โดยเฉพาะตาราง ลายมือ และรูปที่ไม่ชัด