Vad är ett extraheringsverktyg för Wikipediaartiklar?

Ett extraheringsverktyg för Wikipediaartiklar hämtar innehållet från en Wikipedia-sida och omvandlar det till ett rent, strukturerat format som är enklare att återanvända än den ursprungliga wikisidan – oavsett om det handlar om oformaterad text för läsning offline, Markdown för anteckningar och dokumentation, HTML för inbäddning eller den råa wikitext-markeringen som används internt av MediaWiki. Detta är användbart för forskare, skribenter och utvecklare som behöver artikelinnehåll utanför en webbläsare, utan ovidkommande sidelement som navigeringsmenyer, annonser eller redigeringslänkar.

Verktygsbeskrivning

Det här verktyget hämtar en Wikipediaartikel direkt från dess URL och extraherar innehållet i det format du väljer bland sex alternativ: oformaterad text, Markdown, HTML, rå wikitext, en AST-representation (JSON) av den tolkade strukturen eller en nedladdningsbar PDF. Du kan finjustera vad som ska inkluderas – rubriker, listor, tabeller, länkar, referenser, bilder, mallar och kategorier – och sedan kopiera resultatet eller ladda ner det som en fil.

Funktioner

  • Hämtar alla offentliga Wikipediaartiklar direkt från deras URL:er, i alla Wikipediaspråkversioner
  • Sex utdataformat: oformaterad text, Markdown, HTML, rå wikitext, AST (JSON) och PDF
  • Detaljerade innehållsalternativ för att inkludera eller exkludera rubriker, listor, tabeller, länkar, referenser, bilder, mallar och kategorier
  • Tecken- och ordräkning i realtid för det extraherade innehållet
  • Utdata med syntaxmarkering, radnummer och radbrytning
  • Ladda ner resultatet som en fil i motsvarande format (.txt, .md, .html, .wiki, .json eller .pdf)

Så här använder du verktyget

  1. Klistra in URL:en till en Wikipediaartikel, till exempel https://en.wikipedia.org/wiki/Dog
  2. Klicka på ”Hämta artikel” för att läsa in sidans innehåll
  3. Välj ett utdataformat: Oformaterad text, Markdown, HTML, Rå wikitext, AST (JSON) eller PDF
  4. Aktivera eller inaktivera innehållsalternativen (rubriker, listor, tabeller, länkar, referenser, bilder, mallar och kategorier) för att styra vad som ska inkluderas
  5. Granska det extraherade innehållet samt tecken- och ordräkningen, och ladda ner resultatet vid behov

Tips

  • Språket och artikelrubriken läses direkt från URL:en, så det fungerar att klistra in en länk till valfri Wikipediaspråkversion, inte bara den engelska
  • Innehållsalternativen gäller endast formaten Oformaterad text, Markdown, HTML och PDF – Rå wikitext och AST returnerar alltid hela, ofiltrerade källan
  • Inaktivera ”Referenser” och låt ”Mallar” vara inaktiverat (standardinställningarna) för att få den renaste läsversionen av en artikel, eftersom dessa ofta tillför innehåll som inte ingår i den centrala brödtexten
  • Använd formatet AST (JSON) om du behöver granska eller bearbeta artikelns tolkade struktur programmatiskt

Vanliga frågor

Vilka Wikipediaspråkversioner stöds?
Alla Wikipediaspråkversioner stöds – klistra bara in artikelns URL från språkversionens subdomän, till exempel de.wikipedia.org eller ja.wikipedia.org.

Varför saknas en länk eller mall i mina utdata?
Kontrollera innehållsalternativen – länkar, mallar, kategorier, bilder och referenser kan aktiveras eller inaktiveras var för sig, och vissa är inaktiverade som standard.

Ändrar eller sparar det här verktyget Wikipediaartikeln?
Nej – det läser endast artikelns offentliga innehåll för extrahering och visning. Inget laddas upp till eller lagras på Wikipedia.

Kan jag få den exakta ursprungliga wiki-markeringen?
Ja – välj ”Rå wikitext” som utdataformat för att se den oförändrade källmarkeringen exakt så som den är lagrad på Wikipedia.