Wat is een Wikipedia-artikelextractor?

Een Wikipedia-artikelextractor haalt de inhoud van een Wikipedia-pagina op en zet deze om in een schone, gestructureerde indeling die gemakkelijker opnieuw te gebruiken is dan de oorspronkelijke wikipagina — of het nu gaat om platte tekst om offline te lezen, Markdown voor notities en documentatie, HTML om in te voegen, of de onbewerkte wikitext-markup die intern door MediaWiki wordt gebruikt. Dit is nuttig voor onderzoekers, schrijvers en ontwikkelaars die artikelinhoud buiten een browser nodig hebben, zonder niet-gerelateerde pagina-elementen zoals navigatiemenu's, advertenties of bewerkingskoppelingen.

Beschrijving van de tool

Deze tool haalt rechtstreeks via de URL een Wikipedia-artikel op en extraheert de inhoud naar een van zes indelingen: platte tekst, Markdown, HTML, onbewerkte wikitext, een AST-weergave (JSON) van de geparseerde structuur, of een downloadbare PDF. Je kunt nauwkeurig instellen wat wordt opgenomen — koppen, lijsten, tabellen, koppelingen, referenties, afbeeldingen, sjablonen en categorieën — en vervolgens het resultaat kopiëren of als bestand downloaden.

Functies

  • Haalt elk openbaar Wikipedia-artikel rechtstreeks via de URL op, uit alle Wikipedia-taaledities
  • Zes uitvoerindelingen: platte tekst, Markdown, HTML, onbewerkte wikitext, AST (JSON) en PDF
  • Gedetailleerde opties om koppen, lijsten, tabellen, koppelingen, referenties, afbeeldingen, sjablonen en categorieën op te nemen of uit te sluiten
  • Directe telling van tekens en woorden in de geëxtraheerde inhoud
  • Weergave van de uitvoer met syntaxiskleuren, regelnummers en automatische tekstterugloop
  • Download het resultaat als bestand in de bijbehorende indeling (.txt, .md, .html, .wiki, .json of .pdf)

Gebruik

  1. Plak de URL van een Wikipedia-artikel, bijvoorbeeld https://en.wikipedia.org/wiki/Dog
  2. Klik op "Artikel ophalen" om de pagina-inhoud te laden
  3. Kies een uitvoerindeling: Platte tekst, Markdown, HTML, onbewerkte wikitext, AST (JSON) of PDF
  4. Schakel de inhoudsopties (koppen, lijsten, tabellen, koppelingen, referenties, afbeeldingen, sjablonen en categorieën) in of uit om te bepalen wat wordt opgenomen
  5. Bekijk de geëxtraheerde inhoud en de telling van tekens en woorden, en download het resultaat indien nodig

Tips

  • De taal en de titel van het artikel worden rechtstreeks uit de URL gelezen. Een koppeling naar een Wikipedia-taaledition plakken werkt dus altijd, niet alleen voor het Engels
  • Inhoudsopties zijn alleen van toepassing op de indelingen Tekst, Markdown, HTML en PDF — onbewerkte wikitext en AST geven altijd de volledige, ongefilterde bron terug
  • Schakel "Referenties" uit en laat "Sjablonen" uitgeschakeld (de standaardinstellingen) voor de meest overzichtelijke leesversie van een artikel, omdat deze vaak extra inhoud toevoegen die geen deel uitmaakt van de hoofdtekst
  • Gebruik de indeling AST (JSON) als je de geparseerde structuur van het artikel wilt inspecteren of programmatisch wilt verwerken

Veelgestelde vragen

Welke Wikipedia-taaledities worden ondersteund? Elke Wikipedia-taaledition wordt ondersteund — plak gewoon de artikel-URL van het subdomein van die taal (bijvoorbeeld de.wikipedia.org, ja.wikipedia.org).

Waarom ontbreekt er een koppeling of sjabloon in mijn uitvoer? Controleer de inhoudsopties — koppelingen, sjablonen, categorieën, afbeeldingen en referenties kunnen elk afzonderlijk worden in- of uitgeschakeld, en sommige zijn standaard uitgeschakeld.

Past deze tool het Wikipedia-artikel aan of slaat hij het op? Nee — de tool leest alleen de openbare inhoud van het artikel om deze te extraheren en weer te geven. Er wordt niets naar Wikipedia geüpload of daar opgeslagen.

Kan ik de exacte oorspronkelijke wikimarkup ophalen? Ja — selecteer "Onbewerkte wikitext" als uitvoerindeling om de ongewijzigde bronmark-up exact weer te geven zoals die op Wikipedia is opgeslagen.