Wikipedia-artikelextractor
Plak de URL van een Wikipedia-artikel en ontvang de pagina-inhoud als schone platte tekst, Markdown, HTML, onbewerkte wikitext of een geparseerde syntaxboom.
Invoer
Uitvoer
Readme
Wat is een Wikipedia-artikelextractor?
Een Wikipedia-artikelextractor haalt de inhoud van een Wikipedia-pagina op en zet deze om in een schone, gestructureerde indeling die gemakkelijker opnieuw te gebruiken is dan de oorspronkelijke wikipagina — of het nu gaat om platte tekst om offline te lezen, Markdown voor notities en documentatie, HTML om in te voegen, of de onbewerkte wikitext-markup die intern door MediaWiki wordt gebruikt. Dit is nuttig voor onderzoekers, schrijvers en ontwikkelaars die artikelinhoud buiten een browser nodig hebben, zonder niet-gerelateerde pagina-elementen zoals navigatiemenu's, advertenties of bewerkingskoppelingen.
Beschrijving van de tool
Deze tool haalt rechtstreeks via de URL een Wikipedia-artikel op en extraheert de inhoud naar een van zes indelingen: platte tekst, Markdown, HTML, onbewerkte wikitext, een AST-weergave (JSON) van de geparseerde structuur, of een downloadbare PDF. Je kunt nauwkeurig instellen wat wordt opgenomen — koppen, lijsten, tabellen, koppelingen, referenties, afbeeldingen, sjablonen en categorieën — en vervolgens het resultaat kopiëren of als bestand downloaden.
Functies
- Haalt elk openbaar Wikipedia-artikel rechtstreeks via de URL op, uit alle Wikipedia-taaledities
- Zes uitvoerindelingen: platte tekst, Markdown, HTML, onbewerkte wikitext, AST (JSON) en PDF
- Gedetailleerde opties om koppen, lijsten, tabellen, koppelingen, referenties, afbeeldingen, sjablonen en categorieën op te nemen of uit te sluiten
- Directe telling van tekens en woorden in de geëxtraheerde inhoud
- Weergave van de uitvoer met syntaxiskleuren, regelnummers en automatische tekstterugloop
- Download het resultaat als bestand in de bijbehorende indeling (
.txt,.md,.html,.wiki,.jsonof.pdf)
Gebruik
- Plak de URL van een Wikipedia-artikel, bijvoorbeeld
https://en.wikipedia.org/wiki/Dog - Klik op "Artikel ophalen" om de pagina-inhoud te laden
- Kies een uitvoerindeling: Platte tekst, Markdown, HTML, onbewerkte wikitext, AST (JSON) of PDF
- Schakel de inhoudsopties (koppen, lijsten, tabellen, koppelingen, referenties, afbeeldingen, sjablonen en categorieën) in of uit om te bepalen wat wordt opgenomen
- Bekijk de geëxtraheerde inhoud en de telling van tekens en woorden, en download het resultaat indien nodig
Tips
- De taal en de titel van het artikel worden rechtstreeks uit de URL gelezen. Een koppeling naar een Wikipedia-taaledition plakken werkt dus altijd, niet alleen voor het Engels
- Inhoudsopties zijn alleen van toepassing op de indelingen Tekst, Markdown, HTML en PDF — onbewerkte wikitext en AST geven altijd de volledige, ongefilterde bron terug
- Schakel "Referenties" uit en laat "Sjablonen" uitgeschakeld (de standaardinstellingen) voor de meest overzichtelijke leesversie van een artikel, omdat deze vaak extra inhoud toevoegen die geen deel uitmaakt van de hoofdtekst
- Gebruik de indeling AST (JSON) als je de geparseerde structuur van het artikel wilt inspecteren of programmatisch wilt verwerken
Veelgestelde vragen
Welke Wikipedia-taaledities worden ondersteund?
Elke Wikipedia-taaledition wordt ondersteund — plak gewoon de artikel-URL van het subdomein van die taal (bijvoorbeeld de.wikipedia.org, ja.wikipedia.org).
Waarom ontbreekt er een koppeling of sjabloon in mijn uitvoer? Controleer de inhoudsopties — koppelingen, sjablonen, categorieën, afbeeldingen en referenties kunnen elk afzonderlijk worden in- of uitgeschakeld, en sommige zijn standaard uitgeschakeld.
Past deze tool het Wikipedia-artikel aan of slaat hij het op? Nee — de tool leest alleen de openbare inhoud van het artikel om deze te extraheren en weer te geven. Er wordt niets naar Wikipedia geüpload of daar opgeslagen.
Kan ik de exacte oorspronkelijke wikimarkup ophalen? Ja — selecteer "Onbewerkte wikitext" als uitvoerindeling om de ongewijzigde bronmark-up exact weer te geven zoals die op Wikipedia is opgeslagen.