Formatowanie pliku PDF na Word zmienia się, ponieważ plik PDF opisuje stałą stronę wizualną, podczas gdy dokument programu Word opisuje edytowalną zawartość, która może przepływać i być ponownie układana. Konwerter często musi wnioskować o akapitach, kolumnach i tabelach na podstawie pozycjonowanego tekstu. Plik PDF może nie zawierać wystarczającej ilości informacji, aby odtworzyć strukturę oryginalnego dokumentu.
Dlaczego strona, która wygląda dobrze, może źle konwertować
W pliku PDF można narysować osobne fragmenty tekstu o określonych współrzędnych. Człowiek widzi jeden akapit lub dwie kolumny, ale zapisane operacje niekoniecznie identyfikują tę relację. WordprocessingML, format dokumentu w DOCX, reprezentuje struktury takie jak akapity, ciągi tekstu i tabele. Konwersja między tymi modelami wiąże się z interpretacją.
Na przykład biuletyn dwukolumnowy może przechowywać fragmenty tekstu w kolejności innej niż normalna kolejność czytania. Konwerter może przypadkowo połączyć zdanie w lewej kolumnie z nagłówkiem w prawej kolumnie. Podobnie liczby ustawione tak, aby wyglądały jak tabela, mogą nie mieć rzeczywistej struktury tabeli, którą można odzyskać.
Dlaczego zmieniają się czcionki i podziały wierszy?
Plik PDF może zawierać czcionkę lub tylko podzbiór jej znaków. Nie gwarantuje to dostępności tej samej użytecznej czcionki w przekonwertowanym dokumencie programu Word. Podstawianie czcionek, szerokość znaków, odstępy między akapitami i marginesy strony mogą zmieniać zawijanie wierszy. Mała różnica na początku może przenieść treść na inną stronę.
Zachowanie wizualne a konwersja edytowalna
| Podejście | Co dostajesz | Główny kompromis |
|---|---|---|
| Zachowanie wizualne | Wyrenderowany obraz każdej strony PDF umieszczony w pliku DOCX. | Strona może wyglądać podobnie, ale jej tekst nie jest zwykłym edytowalnym tekstem programu Word. |
| Edytowalna rekonstrukcja | Rozpoznany lub wyodrębniony tekst przebudowany na treść programu Word. | Możesz edytować tekst, ale układ i struktura dokumentu mogą ulec zmianie. |
Dokument zawierający obraz strony może być przydatny, gdy odbiorca szczególnie potrzebuje pliku DOCX zawierającego strony wizualne. Zwykle jest to zły wybór w przypadku przepisywania akapitów. Edytowalna rekonstrukcja pasuje do poprawek tekstu, pod warunkiem, że dasz czas na przejrzenie nagłówków, list, tabel i kolejności czytania. Żadne podejście nie przywraca idealnie oryginalnego pliku źródłowego.
Co się zmienia po zeskanowaniu pliku PDF?
Skan składający się wyłącznie z obrazu nie zawiera tekstu, który można wykorzystać w normalnym ekstraktorze tekstu. OCR szacuje znaki na podstawie pikseli. Może błędnie odczytać zero jako literę O lub połączyć sąsiednie kolumny, a rozpoznanie słów nie przywróci oryginalnych stylów i struktury dokumentu. Dowiedz się jak skan z możliwością przeszukiwania różni się od natywnego pliku PDF.
Wybierz odpowiednie wyjście SoraFiles
Prąd Narzędzie SoraFiles PDF do Word oferuje edytowalne i wizualne wyniki. Edytowalna konwersja wyodrębnia dostępny tekst, w razie potrzeby używa OCR i tworzy akapity programu Word z wywnioskowanymi nagłówkami, listami i prostymi tabelami. Nie obiecuje rekonstrukcji oryginalnego układu ani całej zawartości graficznej. Wynik wizualny umieszcza wyrenderowane strony PDF w formacie DOCX jako obrazy.
Wybierz edytowalne wyjście, jeśli zmiana sformułowań ma największe znaczenie. Wybierz efekt wizualny, jeśli zachowanie widocznego układu strony jest ważniejsze niż edycja tekstu. Sprawdź wybraną opcję wyjściową przed konwersją i przejrzyj złożoną stronę, zanim zaczniesz polegać na całym dokumencie.
Jak ograniczyć niespodzianki
- Poproś o oryginalny dokument DOCX, jeśli jest dostępny; jest to lepsze źródło edycji niż przekonwertowany plik PDF.
- Przed edycją całego pliku sprawdź pierwszą stronę, gęstą stronę i każdą złożoną tabelę.
- Porównaj kolejność czytania kolumn, listy numerowane, nagłówki, przypisy i podziały stron.
- Przejrzyj nazwiska, daty, sumy i identyfikatory po OCR. Słowo wyglądające wiarygodnie może być nadal błędne.
- Po edycji utwórz plik PDF i ponownie porównaj końcowe strony przed udostępnieniem.
Jeśli potrzebujesz tylko znaleźć lub wyodrębnić zeskanowany tekst, PDF-OCR może wystarczyć. Po edycji pliku DOCX użyj Słowo do pliku PDF przygotować jednostronicową kopię, a następnie sprawdzić ją w przeglądarce plików PDF.
Referencje
- Microsoft: Otwieranie plików PDF w programie Word (External link, opens in a new tab)
- Microsoft: Struktura dokumentu WordprocessingML (External link, opens in a new tab)
- Adobe: Obsługa czcionek w konwersji PDF (External link, opens in a new tab)
- SoraFiles: PDF do Worda