📄

המרת מסמכים ל-Markdown — בלי להפוך את העברית

רוב הכלים שממירים PDF מוציאים עברית הפוכה — «לתלמידים» הופך ל-«םידימלתל». הכלי הזה בונה כל שורה מחדש לפי מיקום האותיות בדף, כולל טבלאות. קבצי Word, PowerPoint ו-Excel מומרים גם הם — שם העברית בטוחה מלכתחילה.

📄
גררו לכאן קובץ PDF / Word / PowerPoint / Excel, או לחצו לבחירה
pdf · docx · pptx · xlsx · עד 25MB · הקובץ נמחק מהשרת מיד בסיום ההמרה
📊 מה תוקן בהמרה?

ההשוואה היא מול קריאה רגילה של אותו קובץ — הטקסט שתוכנת PDF רגילה או כלי AI היו מקבלים ממנו. כל שורה בטבלה היא ספירה של תקלה שזוהתה בטקסט עצמו, לא הערכת דיוק כללית.

מה נמדדלפניאחרי

❔ מה ההבדל בין הגרסאות והפורמטים?

למה בכלל Markdown? זהו קובץ טקסט פשוט שבו סימנים מסמנים מבנה: # לכותרת, | לטבלה, ** להדגשה. Obsidian‏, Notion‏, כלי AI וגם Word יודעים לקרוא אותו — כך המסמך שומר על הכותרות והטבלאות שלו אחרי ההמרה.

גרסה נקייה (ברירת המחדל): ‏PDF שומר כל שורה בנפרד, ולכן פסקה שנשברה לארבע שורות מגיעה כארבעה קטעים נפרדים. הגרסה הנקייה מאחה אותן חזרה לפסקאות שלמות לפי המיקום בדף. כיבוי המתג מציג את השורות אחת־לאחת, בדיוק כמו ב-PDF — נוח להשוואה מול המקור.

.md לעומת .txt: קובץ .md הוא קובץ טקסט לכל דבר — הסיומת רק אומרת לתוכנות להציג את המבנה. קובץ ה-.txt כאן עובר ניקוי נוסף: סימני ה-Markdown מוסרים וטבלאות הופכות לשורות פשוטות — מוכן להדבקה למייל, ל-Word או למסמך שיתופי.

למה יש ![](images/…) בטקסט? זו הדרך של Markdown לשבץ תמונה במקום הנכון: כשפותחים את ה-ZIP ב-Obsidian או ב-VS Code, כל תמונה מופיעה בדיוק היכן שהייתה במסמך המקורי. בלי השורה הזו התמונות בתיקייה היו מנותקות מהטקסט. מי שרוצה טקסט בלבד — הכפתור «‎.md בלי תמונות» מוריד את הקובץ בלי האזכורים, וגם ב-.txt הם מוסרים לגמרי.

הכלי בנוי על PyMuPDF ומיישם את אלגוריתם ה-bidi של יוניקוד בכיוון ההפוך, כדי לשחזר את סדר הקריאה מתוך מיקומי האותיות בדף.
קובצי Office (docx / pptx / xlsx) שומרים את הטקסט בסדר לוגי, ולכן מומרים ישירות — קבצים בפורמט הישן (doc / ppt / xls) יש לשמור מחדש בתבנית החדשה.
קובץ סרוק (תמונות של דפים בלי שכבת טקסט) עדיין לא נתמך — נדרש OCR.
מאת עומרי אירם