רוב הכלים שממירים PDF מוציאים עברית הפוכה — «לתלמידים» הופך ל-«םידימלתל». הכלי הזה בונה כל שורה מחדש לפי מיקום האותיות בדף, כולל טבלאות. קבצי Word, PowerPoint ו-Excel מומרים גם הם — שם העברית בטוחה מלכתחילה.
הכלי בנוי על PyMuPDF ומיישם את אלגוריתם ה-bidi של יוניקוד בכיוון ההפוך,
כדי לשחזר את סדר הקריאה מתוך מיקומי האותיות בדף.
קובצי Office (docx / pptx / xlsx) שומרים את הטקסט בסדר לוגי, ולכן מומרים ישירות —
קבצים בפורמט הישן (doc / ppt / xls) יש לשמור מחדש בתבנית החדשה.
קובץ סרוק (תמונות של דפים בלי שכבת טקסט) עדיין לא נתמך — נדרש OCR.
מאת עומרי אירם