กลับไปฟีด
Getnotes
Getnotes4 ส.ค.
GetNotes

PDF ไฟล์นี้อ่านข้อความได้เลย หรือต้องส่งเข้า OCR? ให้ระบบแยกให้อัตโนมัติก่อน GitHub Daily วันนี้ขอแนะนำ firecrawl/pdf-inspector — Library แบบ Open Source ที่เขียนด้วย Rust สำหรับตรวจสอบและแยกประเภทไฟล์ PDF ว่าเป็นไฟล์ข้อความ, ไฟล์สแกน, ไฟล์รูปภาพ หรือมีเนื้อหาแบบผสม พร้อมดึงข้อความออกมาเป็น Markdown ที่นำไปใช้กับระบบ AI และงานเอกสารต่อได้ง่ายขึ้น สิ่งที่นำไปใช้ได้จริง • ตรวจว่า PDF หน้าไหนอ่านข้อความได้ และหน้าไหนจำเป็นต้องใช้ OCR • ดึงข้อความ หัวข้อ รายการ และตารางออกมาเป็น Markdown • ลดค่าใช้จ่ายและเวลาจากการส่ง PDF ทุกไฟล์เข้า OCR โดยไม่จำเป็น • ใช้ทำระบบอ่านใบแจ้งหนี้ รายงาน งานวิจัย หรือเอกสารจำนวนมาก • เชื่อมต่อได้ทั้ง Python, Node.js, Rust, Browser WebAssembly และ CLI • ประมวลผลบนเครื่องได้โดยไม่ต้องส่งเอกสารไปยังบริการภายนอก ข้อควรรู้: pdf-inspector ไม่ใช่เครื่องมือ OCR ในตัว หากพบ PDF ที่เป็นภาพสแกนหรือมีปัญหาเรื่องการเข้ารหัสฟอนต์ ระบบจะช่วยระบุหน้าที่ควรส่งต่อไปยัง OCR ดังนั้นคุณยังต้องเชื่อมบริการหรือเครื่องมือ OCR เพิ่มสำหรับไฟล์ประเภทนั้น #Getnotes #GitHubDaily #PDFInspector #PDF #OCR #Rust #DeveloperTools #OpenSource

PDF ไฟล์นี้อ่านข้อความได้เลย หรือต้องส่งเข้า OCR? ให้ระบบแยกให้อัตโนมัติก่อน GitHub Daily วันนี้ขอแนะนำ firecrawl/pdf-inspector — Library แบบ Open Source ที่เขียนด้วย Rust สำหรั...
0

คอมเมนต์

0 ความคิดเห็นในโพสต์นี้

ฟีดทั้งหมด
G
คุยแบบสุภาพและช่วยกันต่อยอด

ยังไม่มีคอมเมนต์

เป็นคนแรกที่เริ่มคุยใต้โพสต์นี้ได้เลย