Extrator de Artigos da Wikipédia
Cole a URL de um artigo da Wikipédia e obtenha o conteúdo da página como texto simples, Markdown, HTML, wikitexto bruto ou árvore sintática analisada.
Entrada
Saída
Leia-me
O que é um extrator de artigos da Wikipédia?
Um extrator de artigos da Wikipédia obtém o conteúdo de uma página da Wikipédia e o converte em um formato limpo e estruturado, mais fácil de reutilizar do que a página wiki original — seja como texto simples para leitura offline, Markdown para anotações e documentação, HTML para incorporação ou a marcação wikitext bruta usada internamente pelo MediaWiki. Isso é útil para pesquisadores, redatores e desenvolvedores que precisam do conteúdo de artigos fora de um navegador, sem elementos irrelevantes da página, como menus de navegação, anúncios ou links de edição.
Descrição da ferramenta
Esta ferramenta obtém um artigo da Wikipédia diretamente de sua URL e extrai o conteúdo em um dos seis formatos disponíveis: texto simples, Markdown, HTML, wikitext bruto, uma representação AST (JSON) da estrutura analisada ou um PDF para download. Você pode ajustar detalhadamente o que será incluído — títulos, listas, tabelas, links, referências, imagens, modelos e categorias — e depois copiar o resultado ou baixá-lo como um arquivo.
Recursos
- Obtém qualquer artigo público da Wikipédia diretamente de sua URL, em todas as edições linguísticas da Wikipédia
- Seis formatos de saída: texto simples, Markdown, HTML, wikitext bruto, AST (JSON) e PDF
- Opções detalhadas de conteúdo para incluir ou excluir títulos, listas, tabelas, links, referências, imagens, modelos e categorias
- Contagem em tempo real de caracteres e palavras do conteúdo extraído
- Visualizador de saída com realce de sintaxe, números de linha e quebra automática de linha
- Baixe o resultado como um arquivo no formato correspondente (
.txt,.md,.html,.wiki,.jsonou.pdf)
Como usar
- Cole a URL de um artigo da Wikipédia, por exemplo,
https://en.wikipedia.org/wiki/Dog - Clique em "Obter artigo" para carregar o conteúdo da página
- Escolha um formato de saída: Texto simples, Markdown, HTML, Wikitext bruto, AST (JSON) ou PDF
- Ative ou desative as opções de conteúdo (títulos, listas, tabelas, links, referências, imagens, modelos e categorias) para controlar o que será incluído
- Revise o conteúdo extraído, as contagens de caracteres e palavras e baixe o resultado, se necessário
Dicas
- O idioma e o título do artigo são lidos diretamente da URL, portanto colar um link de qualquer edição linguística da Wikipédia — não apenas da edição em inglês — funciona
- As opções de conteúdo só se aplicam aos formatos Texto, Markdown, HTML e PDF — o wikitext bruto e o AST sempre retornam a fonte completa, sem filtros
- Desative "Referências" e mantenha "Modelos" desativado (as opções padrão) para obter a cópia de leitura mais limpa de um artigo, pois esses elementos costumam adicionar informações desnecessárias que não fazem parte do texto principal
- Use o formato AST (JSON) se precisar inspecionar ou processar programaticamente a estrutura analisada do artigo
Perguntas frequentes
Quais edições linguísticas da Wikipédia são compatíveis?
Qualquer edição linguística da Wikipédia é compatível — basta colar a URL do artigo a partir do subdomínio correspondente ao idioma (por exemplo, de.wikipedia.org, ja.wikipedia.org).
Por que um link ou modelo não aparece na minha saída?
Verifique as opções de conteúdo — links, modelos, categorias, imagens e referências podem ser ativados ou desativados individualmente, e alguns ficam desativados por padrão.
Esta ferramenta modifica ou salva o artigo da Wikipédia?
Não — ela apenas lê o conteúdo público do artigo para extração e exibição. Nada é enviado ou armazenado na Wikipédia.
Posso obter a marcação wiki original exata?
Sim — selecione "Wikitext bruto" como formato de saída para ver exatamente a marcação de origem não modificada, conforme armazenada na Wikipédia.