PDF dua kolom keluar dengan kolomnya berselang-seling
Anda menyorot teks sebuah makalah yang disusun dua kolom, menyalinnya, menempelkannya ke Word — dan satu baris kolom kiri disusul satu baris kolom kanan, berulang terus. Dua uraian yang berbeda saling terjalin, dan batas kalimatnya pun tidak lagi terlihat.
Penyebabnya, PDF sama sekali tidak menyimpan struktur kolom. Isi berkasnya hanya perintah: «gambar glif ini pada koordinat ini». Tidak ada catatan di mana satu kolom dimulai dan yang lain berakhir. Menyalin dan mengekstrak teks menelusuri halaman dari atas ke bawah, baris demi baris, menurut posisi gambarnya, sehingga dua kolom pada ketinggian yang sama terambil bergantian, satu baris setiap kali.
Jadi kolomnya harus dibaca ulang dari tata letaknya. PDFIntact menemukan blok-blok pada halaman — teks, judul, tabel, gambar — lalu menatanya kembali dalam urutan baca sebelum menulis ke Word, Markdown, dan JSON. Susunan kolomnya sendiri tidak ditiru: yang Anda dapat adalah dokumen satu kolom dalam urutan baca.
Coba sekarang
Periksa dengan PDF Anda sendiri
Pemeriksaan berjalan sepenuhnya di dalam peramban Anda. Berkas tidak pernah diunggah dan akun pun tidak perlu. Sebelum membayar, Anda sudah bisa melihat berapa halaman, tabel, dan gambar yang bisa diambil.
Contoh
行の拾われ方が変わります
左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。
コピーしたとき(描かれた位置の順)
左の段 1行目 右の段 1行目 左の段 2行目 右の段 2行目 左の段 3行目 右の段 3行目
PDFIntact を通したとき(読み順)
左の段 1行目 左の段 2行目 左の段 3行目 右の段 1行目 右の段 2行目 右の段 3行目
形式ごとに、どう入るか
同じ読み順でも、書き出す形式によって入り方が違います。
Word(.docx)
読み順のまま、1段の段落として並びます。段組は再現しません。
Markdown(.md)
同じ範囲を、ページごとの見出しの下に読み順で置きます。
JSON
ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。
Excel(.xlsx)
本文は入りません。Excelに書き出すのは表とグラフだけです。
脚注・キャプション・ページ番号
これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。
Pertanyaan yang sering diajukan
- Mengapa kolomnya berselang-seling saat PDF dua kolom disalin?
- Karena PDF tidak menyimpan kolom sebagai kolom. Di dalam berkas hanya ada «gambar glif ini pada koordinat ini», tanpa penanda di mana satu kolom dimulai dan yang lain berakhir. Menyalin menelusuri halaman dari atas ke bawah baris demi baris, sehingga dua kolom pada ketinggian yang sama terambil bergantian, satu baris setiap kali.
- Bagaimana urutan bacanya dipulihkan?
- Blok-blok pada halaman — teks, judul, tabel, gambar — ditemukan lebih dulu, lalu dikembalikan ke urutan baca sebelum apa pun ditulis. Susunan dua kolomnya sendiri tidak ditiru: Word dan Markdown menerima dokumen satu kolom dalam urutan baca.
- Bagaimana dengan catatan kaki dan keterangan gambar?
- Keduanya keluar sebagai blok tersendiri, berupa paragraf, pada tempatnya dalam urutan baca. Dalam pengujian kami, keterangan gambar tetap terpisah dari teks, semua yang berada di bawah garis catatan kaki menjadi blok tersendiri, dan nomor halaman tidak tercampur ke dalam teks. Keduanya tidak menjadi catatan kaki Word, melainkan masuk sebagai paragraf.
- Ke format apa saja teksnya bisa diekspor?
- Word, Markdown, dan JSON. JSON juga membawa jenis blok, nomor halaman, dan posisi di halaman, sehingga Anda bisa melacak sebuah bagian berasal dari kolom dan titik yang mana. Teks isi tidak masuk ke Excel: ekspor Excel hanya berisi tabel dan grafik.
- Kalau urutan bacanya benar, apakah hurufnya juga benar?
- Itu dua hal yang berbeda. Urutan baca bisa bertahan sementara pembacaan hurufnya berantakan, dan hal itu memang kami temui pada satu sampel. Karena itu setiap blok membawa pita keyakinan — terbaca, perkiraan, atau tak terbaca. Cocokkan hasilnya dengan PDF aslinya.
Periksa PDF untuk semua gejala sekaligus/ Apa isi tiap format