OCR ile PDF metin çıkarma nedir?

Bazı PDF'lerde, kopyalanamayan veya doğru şekilde çıkarılamayan metinler bulunur. Taranmış bir belge, her sayfayı resim olarak saklar; bu nedenle kopyalanabilecek bir metin içermez. Diğer PDF'ler metinlerini saklar, ancak yazı tipi kodlaması bozuk veya alışılmadık olabilir: Harfler sayfada doğru görünür, ancak kopyalandıklarında rastgele karakterler, boş kutular ya da hiçbir şey elde edilmez. Bu durum, yazı tipinin harf şekillerinin her birinin hangi karakteri temsil ettiğini belirtmemesi veya bunu yanlış belirtmesiyle ortaya çıkar.

OCR (optik karakter tanıma), metni sayfadaki harf şekillerinden, bir insanın okuduğu gibi okur. PDF'de saklanan metni kullanmadığı için her iki dosya türünden de doğru metni çıkarır.

Araç açıklaması

Bu araç, PDF'deki metni doğrudan tarayıcınızda OCR ile çıkarır. Her sayfayı resim olarak işler ve üzerindeki harfleri Tesseract OCR motoruyla tanır. PDF'yi ve belgenin dilini seçin, metni çıkarın, ardından kopyalayın veya .txt dosyası olarak indirin. Her sayfanın metni bir sayfa başlığıyla başlar ve işlemin ilerleyişini sayfa sayfa takip edebilirsiniz.

Örnek

Metni kopyalandığında "еКпФщЮФГиНтЮЧьФщ" gibi anlamsız karakterlere dönüşen iki sütunlu bir rapor sayfasının çıktısı şöyledir:

Sayfa 1

Üç Aylık Rapor

İlk sütun burada başlıyor. Mart ayında yeni deponun
açılması ve gönderim sürelerinin iki gün kısalması
sayesinde raporlama döneminde gelir arttı.

Maliyetler sabit kaldı. Ekip dört mühendis işe aldı ve
faturalandırma sistemini müşteriler için hiçbir kesinti
yaşanmadan yeni sunuculara taşıdı.

İkinci sütunda rapor devam ediyor. Müşteri memnuniyeti
puanları yüzde 87'ye yükseldi ve destek ekibi taleplerin
çoğunu bir saat içinde yanıtladı.

Şirket gelecek çeyrekte Lizbon'da bir ofis açmayı,
web sitesini Portekizceye çevirmeyi ve tabletler için
mobil uygulamayı kullanıma sunmayı planlıyor.

Özellikler

  • Taranmış PDF'lerden ve yazı tipi kodlaması bozuk veya alışılmadık olan PDF'lerden metin çıkarır
  • Arapça, Çince, Hintçe, Japonca, Korece ve Rusça dâhil 19 dildeki metni tanır
  • Birden fazla sütun içeren sayfaları sütunları sırayla okuyarak işler
  • Yan veya baş aşağı taranmış sayfaları okur
  • Cihazınızın işlemci çekirdeği sayısına bağlı olarak aynı anda en fazla dört sayfayı işler
  • Her sayfanın metnini okunur okunmaz gösterir ve işlemi iptal etseniz bile metni korur
  • Tarayıcınızda çalışır; böylece PDF cihazınızdan çıkmaz

Nasıl çalışır?

Araç, PDF'yi PDF.js ile açar ve her sayfayı görselleri, metinleri ve çizimleriyle birlikte 300 dpi çözünürlükte düzgün yönde işler. Sayfa gri tonlamalı bir görüntüye dönüştürülür. Tesseract sayfadaki sütunları ve metin bloklarını bulur, ardından her satırı tanır. Metin görüntüden okunduğu için PDF'de kullanılan yazı tipleri ve saklanan metin önem taşımaz.

Tesseract bir sayfadaki metni düşük güven düzeyiyle okursa sayfa baş aşağı olabilir. Bu durumda araç sayfayı ters çevirip yeniden okur ve Tesseract'ın daha emin olduğu sonucu kullanır.

Araç, belge dilini okuyabiliyorsa başlangıçta bu sitenin dilini kullanır; okuyamıyorsa İngilizceyi kullanır. Bir dilde ilk kez metin çıkardığınızda tarayıcı, o dile ait tanıma verilerini bu siteden indirir.

İpuçları

  • Belgenin yazıldığı dili seçin. Yanlış dil seçildiğinde ä, ß veya é gibi harfler sık sık yanlış okunur.
  • PDF'deki metni olduğu gibi kopyalayabiliyorsanız PDF Metin Çıkarıcı, saklanan metni doğrudan okur. Bu yöntem daha hızlıdır ve karakterleri tam olarak korur.
  • Sonuç düz metindir: Her sayfanın satırları ve paragraflar arasındaki boş satırlar korunur, ancak yazı tipleri, kalın yazı ve sayfa düzeni korunmaz.
  • Posterler gibi çok büyük sayfalar daha düşük çözünürlükte işlenir; bu nedenle üzerlerindeki küçük yazılar atlanabilir.
  • Metin içermeyen sayfaların sayısını (örneğin boş sayfaları) bir uyarı gösterir.
  • Parola korumalı PDF'ler okunamaz. Önce parolayı kaldırın.