Czym jest ekstraktor artykułów z Wikipedii?

Ekstraktor artykułów z Wikipedii pobiera treść strony Wikipedii i konwertuje ją do czystego, uporządkowanego formatu, który łatwiej ponownie wykorzystać niż oryginalną stronę wiki — może to być zwykły tekst do czytania offline, Markdown do notatek i dokumentacji, HTML do osadzania albo surowy wikitext używany wewnętrznie przez MediaWiki. Jest to przydatne dla badaczy, autorów i programistów, którzy potrzebują treści artykułów poza przeglądarką, bez niezwiązanych z treścią elementów strony, takich jak menu nawigacyjne, reklamy czy odnośniki do edycji.

Opis narzędzia

To narzędzie pobiera artykuł z Wikipedii bezpośrednio z jego adresu URL i wyodrębnia jego treść do jednego z sześciu wybranych formatów: zwykłego tekstu, Markdown, HTML, surowego wikitextu, reprezentacji AST (JSON) przeanalizowanej struktury albo pliku PDF do pobrania. Możesz precyzyjnie określić, co ma zostać uwzględnione — nagłówki, listy, tabele, odnośniki, przypisy, obrazy, szablony i kategorie — a następnie skopiować wynik lub pobrać go jako plik.

Funkcje

  • Pobieranie dowolnego publicznego artykułu z Wikipedii bezpośrednio z jego adresu URL, we wszystkich wersjach językowych Wikipedii
  • Sześć formatów wyjściowych: zwykły tekst, Markdown, HTML, surowy wikitext, AST (JSON) i PDF
  • Szczegółowe opcje zawartości pozwalające uwzględnić lub wykluczyć nagłówki, listy, tabele, odnośniki, przypisy, obrazy, szablony i kategorie
  • Bieżące liczniki znaków i słów dla wyodrębnionej treści
  • Przeglądarka wyników z podświetlaniem składni, numerami wierszy i zawijaniem wierszy
  • Pobieranie wyniku jako pliku w odpowiednim formacie (.txt, .md, .html, .wiki, .json lub .pdf)

Jak używać

  1. Wklej adres URL artykułu z Wikipedii, np. https://en.wikipedia.org/wiki/Dog
  2. Kliknij „Pobierz artykuł”, aby wczytać treść strony
  3. Wybierz format wyjściowy: zwykły tekst, Markdown, HTML, surowy wikitext, AST (JSON) lub PDF
  4. Przełącz opcje zawartości (nagłówki, listy, tabele, odnośniki, przypisy, obrazy, szablony i kategorie), aby określić, co ma zostać uwzględnione
  5. Przejrzyj wyodrębnioną treść oraz liczniki znaków i słów, a w razie potrzeby pobierz wynik

Wskazówki

  • Język i tytuł artykułu są odczytywane bezpośrednio z adresu URL, dlatego działa również wklejenie odnośnika do dowolnej wersji językowej Wikipedii, nie tylko angielskiej
  • Opcje zawartości dotyczą wyłącznie formatów Tekst, Markdown, HTML i PDF — surowy wikitext oraz AST zawsze zwracają pełne, niefiltrowane źródło
  • Wyłącz opcję „Przypisy” i pozostaw wyłączoną opcję „Szablony” (są to ustawienia domyślne), aby uzyskać najczytelniejszą kopię artykułu, ponieważ te elementy często dodają treści niezwiązane z głównym tekstem
  • Użyj formatu AST (JSON), jeśli chcesz przeanalizować lub przetwarzać programowo strukturę artykułu po analizie

FAQ

Które wersje językowe Wikipedii są obsługiwane?
Obsługiwana jest dowolna wersja językowa Wikipedii — wystarczy wkleić adres URL artykułu z subdomeny danego języka, np. de.wikipedia.org lub ja.wikipedia.org.

Dlaczego w wynikach brakuje odnośnika lub szablonu?
Sprawdź opcje zawartości — odnośniki, szablony, kategorie, obrazy i przypisy można niezależnie włączać i wyłączać, a niektóre z nich są domyślnie wyłączone.

Czy to narzędzie modyfikuje artykuł z Wikipedii lub zapisuje go?
Nie — narzędzie jedynie odczytuje publicznie dostępną treść artykułu w celu jej wyodrębnienia i wyświetlenia. Żadne dane nie są przesyłane do Wikipedii ani na niej przechowywane.

Czy mogę uzyskać dokładnie oryginalne znaczniki wiki?
Tak — wybierz „Surowy wikitext” jako format wyjściowy, aby wyświetlić niezmodyfikowane znaczniki źródłowe dokładnie w takiej postaci, w jakiej są przechowywane na Wikipedii.