שלח תוצאה אל:
סריקה היא צילום של עמוד. רוב הכלים משאירים אותה כך: הם מזהים את המילים ומסתירים אותן בשכבה בלתי נראית מתחת לתמונה, כך שאפשר לחפש בקובץ אבל אי אפשר לשנות בו דבר. האפליקציה הזאת בונה את המסמך מחדש. המילים ומיקומן מגיעות מזיהוי התווים, מבנה העמוד — כותרות, טורים, טבלאות וכיתובים — נקבע בנפרד, והעמוד נכתב שוב כטקסט אמיתי, טבלאות אמיתיות ותמונות אמיתיות בקובץ Word (.docx).
מכיוון שהמבנה נמצא לפני שהטקסט מונח, טבלה מהסריקה חוזרת כטבלה עם העמודות שלה, ולא כקיר של שורות מפוזרות. טופס חוזר עם התוויות והערכים שלו מיושרים בזוגות, בדיוק כפי שהודפסו. כותרות נשארות כותרות, וכל עמוד בסריקה נשאר עמוד במסמך.
שפת המסמך נלמדת מהעמודים עצמם, ולכן סריקה בגרמנית או באיטלקית אינה דורשת שום הגדרה ידנית. מילים שהזיהוי אינו בטוח בהן נקראות שוב מהסריקה במקום להיות מנוחשות, ומספרים ומזהים לעולם אינם נכתבים מחדש. כשהקובץ מוכן, שורה אחת מספרת כמה עמודים נבנו מחדש, כמה מילים תוקנו וכמה נותרו מוטלות בספק.
מה שמקבלים הוא קובץ .docx שנפתח ב‑Word, ב‑Google Docs או ב‑Pages ונערך כמו כל מסמך אחר. תמונות מהסריקה עוברות עם טקסט חלופי, והכותרות מתויגות ככותרות, כך שקורא מסך יכול לעקוב אחרי המסמך — דבר שסריקה עם שכבת טקסט נסתרת לעולם אינה מאפשרת.
יש מגבלות שכדאי להכיר. הטקסט נכתב מחדש בגופן סטנדרטי אחד, ולכן העמוד הבנוי לא יתאים לסריקה אות באות: הפריסה נשמרת, הטיפוגרפיה לא. כתב יד אינו מה שהזיהוי נבנה עבורו, והערות בכתב יד עלולות לחזור כמילים משובשות. סריקה דהויה, עקומה או ברזולוציה נמוכה עולה בדיוק בכל שלב. בדקו את התוצאה לפני שתסתמכו עליה, ושמרו את המקור.
אם אינכם צריכים לערוך דבר ורוצים שהעמוד ייראה זהה עד רמת הפיקסל, הכלי הנכון הוא «חיפוש בקובץ PDF»: הוא שומר את התמונה ומניח מעליה שכבת טקסט נסתרת. הכלי הזה מחליף את המראה המדויק במסמך שאפשר לשנות.
הכול פועל בדפדפן, בשרתים שלנו: בלי התקנה, בלי הרשמה, בלי CAPTCHA. עד 10 קבצים בכל פעם, 10 MB כל אחד. הקבצים שהועלו וקישורי ההורדה נמחקים לאחר 24 שעות.
זיהוי התווים האופטי (OCR) קורא את המילים ואת מיקומן, מבנה העמוד נקבע בנפרד, והמסמך נכתב שוב כטקסט, טבלאות ותמונות אמיתיות בקובץ .docx.
הקבצים נמחקים מהשרתים שלנו לאחר 24 שעות, ולאחר מכן קישורי ההורדה מפסיקים לפעול.
גררו את ה‑PDF הסרוק לאזור הלבן, או לחצו עליו כדי לבחור את הקובץ, ואז לחצו «המר». כשהעמודים ייבנו, הורידו את קובץ ה‑.docx. עד 10 קבצים בכל פעם, 10 MB כל אחד.
הפריסה נשמרת — כותרות, טורים, טבלאות ותמונות נשארים במקומם — אבל הטקסט נכתב מחדש בגופן סטנדרטי אחד, ולכן לא יתאים אות באות. אם דרוש עמוד זהה עד רמת הפיקסל, השתמשו ב«חיפוש בקובץ PDF»: הוא שומר את התמונה ומוסיף שכבת טקסט נסתרת.
OCR נבנה עבור טקסט מודפס. הערות בכתב יד וחתימות עלולות לחזור כמילים משובשות, לכן בדקו אותן לפני שתסתמכו על המסמך.
מסמך Word (.docx) לכל קובץ שהעליתם, שבו הטקסט, הטבלאות והתמונות של הסריקה נבנו מחדש כאובייקטים אמיתיים.
הקבצים נמחקים מהשרתים שלנו לאחר 24 שעות וקישורי ההורדה מפסיקים לפעול. לאף אחד אחר אין גישה אליהם.
כן. הכול מעובד בשרתים שלנו, ולכן מספיק כל דפדפן מודרני — Chrome, Firefox, Safari או Opera, בכל מערכת הפעלה.