PDF Metin Çıkarıcı
Bir PDF dosyasındaki gömülü metni doğrudan tarayıcınızda her sayfadan çıkarın.
Girdi
Çıktı
Readme
PDF metin çıkarma nedir?
PDF metin çıkarma, bir PDF belgesinin içinde depolanan makine tarafından okunabilir karakterleri alır. Optik karakter tanımadan (OCR) farklı olarak, harfleri sayfa görüntülerinden tanımak yerine dosyaya zaten gömülü olan metin katmanını okur.
Çıkarılan metin aranabilir, kopyalanabilir, dizine eklenebilir, analiz edilebilir veya diğer belgelerde yeniden kullanılabilir. Sonucun sıralaması, PDF'nin metnini nasıl depoladığına bağlıdır; bu nedenle sütunlar, tablolar ve konumlandırılmış etiketler gibi karmaşık düzenler görsel okuma sırasını izlemeyebilir.
Araç açıklaması
Bu araç, bir PDF'deki gömülü metni doğrudan tarayıcınızda çıkarır. Her sayfayı işlemek için bir PDF seçin, çıkarma ilerlemesini inceleyin ve sonucu .txt dosyası olarak kopyalayın veya indirin. Sayfa başlıkları, farklı sayfalardaki içeriğin birbirinden ayrılmasını sağlar ve bir uyarı, gömülü metin içermeyen sayfaları belirtir.
Örnekler
İlk sayfasında bir başlık ve ikinci sayfasında kısa bir paragraf bulunan iki sayfalık bir PDF şu sonucu üretebilir:
Sayfa 1
Üç Aylık Rapor
Sayfa 2
Raporlama döneminde gelir arttı.Özellikler
- PDF'deki okunabilir her sayfadan gömülü metni çıkarır
- Sayfa sayfa ilerlemeyi gösterir ve metin katmanı bulunmayan sayfaları bildirir
- Tarayıcıda yerel olarak çalışır ve sonucu metin dosyası olarak indirmenize olanak tanır
Nasıl çalışır?
Araç, PDF'yi tarayıcınızda yükler, her sayfada depolanan metin öğelerini okur ve bunları düz metin hâline getirir. PDF'deki satır sonları mevcut oldukları durumlarda korunur ve çıkarılan içeriğin önüne sayfa başlıkları eklenir.
Sınırlamalar
- Taranmış veya yalnızca görüntü içeren sayfalar OCR gerektirir ve bu araçla metin üretmez.
- Çok sütunlu belgeler, tablolar ve yoğun biçimde konumlandırılmış düzenler beklenmeyen bir okuma sırasıyla çıkarılabilir.
- Hasarlı veya parola korumalı PDF'ler okunamayabilir.