¿Qué es un extractor de artículos de Wikipedia?

Un extractor de artículos de Wikipedia obtiene el contenido de una página de Wikipedia y lo convierte en un formato limpio y estructurado, más fácil de reutilizar que la página wiki original: ya sea texto sin formato para leer sin conexión, Markdown para notas y documentación, HTML para insertar en otros sitios, o el marcado wikitext sin procesar utilizado internamente por MediaWiki. Esto resulta útil para investigadores, escritores y desarrolladores que necesitan el contenido de un artículo fuera de un navegador, sin elementos ajenos de la página, como menús de navegación, anuncios o enlaces de edición.

Descripción de la herramienta

Esta herramienta obtiene directamente un artículo de Wikipedia a partir de su URL y extrae su contenido en uno de seis formatos: texto sin formato, Markdown, HTML, wikitext sin procesar, una representación AST (JSON) de la estructura analizada o un PDF descargable. Puedes ajustar con precisión qué elementos incluir —encabezados, listas, tablas, enlaces, referencias, imágenes, plantillas y categorías— y luego copiar el resultado o descargarlo como archivo.

Funciones

  • Obtiene directamente cualquier artículo público de Wikipedia a partir de su URL, en todas las ediciones lingüísticas de Wikipedia
  • Seis formatos de salida: texto sin formato, Markdown, HTML, wikitext sin procesar, AST (JSON) y PDF
  • Opciones de contenido detalladas para incluir o excluir encabezados, listas, tablas, enlaces, referencias, imágenes, plantillas y categorías
  • Recuentos actualizados de caracteres y palabras del contenido extraído
  • Visor de salida con resaltado de sintaxis, números de línea y ajuste de línea
  • Descarga el resultado como archivo en el formato correspondiente (.txt, .md, .html, .wiki, .json o .pdf)

Cómo usarla

  1. Pega la URL de un artículo de Wikipedia, por ejemplo, https://en.wikipedia.org/wiki/Dog
  2. Haz clic en «Obtener artículo» para cargar el contenido de la página
  3. Elige un formato de salida: texto sin formato, Markdown, HTML, wikitext sin procesar, AST (JSON) o PDF
  4. Activa o desactiva las opciones de contenido (encabezados, listas, tablas, enlaces, referencias, imágenes, plantillas y categorías) para controlar qué se incluye
  5. Revisa el contenido extraído y los recuentos de caracteres y palabras, y descarga el resultado si es necesario

Consejos

  • El idioma y el título del artículo se leen directamente de la URL, por lo que funciona pegar un enlace de cualquier edición lingüística de Wikipedia, no solo de la edición en inglés
  • Las opciones de contenido solo se aplican a los formatos de texto, Markdown, HTML y PDF; el wikitext sin procesar y el AST siempre devuelven la fuente completa, sin filtrar
  • Desactiva «Referencias» y deja «Plantillas» desactivado (son las opciones predeterminadas) para obtener la copia más limpia y fácil de leer de un artículo, ya que estos elementos suelen añadir contenido innecesario que no forma parte del texto principal
  • Usa el formato AST (JSON) si necesitas inspeccionar o procesar mediante programación la estructura analizada del artículo

Preguntas frecuentes

¿Qué ediciones lingüísticas de Wikipedia son compatibles?
Cualquier edición lingüística de Wikipedia es compatible; solo tienes que pegar la URL del artículo correspondiente al subdominio de ese idioma (por ejemplo, de.wikipedia.org, ja.wikipedia.org).

¿Por qué falta un enlace o una plantilla en mi resultado?
Comprueba las opciones de contenido: los enlaces, las plantillas, las categorías, las imágenes y las referencias se pueden activar o desactivar individualmente, y algunos están desactivados de forma predeterminada.

¿Esta herramienta modifica o guarda el artículo de Wikipedia?
No: solo lee el contenido público del artículo para extraerlo y mostrarlo. No se sube ni se almacena nada en Wikipedia.

¿Puedo obtener exactamente el marcado wiki original?
Sí. Selecciona «Wikitext sin procesar» como formato de salida para ver exactamente el marcado de origen sin modificar, tal como está almacenado en Wikipedia.