Извлечение статей из Википедии
Вставьте URL статьи из Википедии и получите содержимое страницы в виде чистого обычного текста, Markdown, HTML, исходного викитекста или разобранного синтаксического дерева.
Ввод
Вывод
Документация
Что такое извлекатель статей Википедии?
Извлекатель статей Википедии получает содержимое страницы Википедии и преобразует его в чистый структурированный формат, который удобнее повторно использовать, чем исходную wiki-страницу: обычный текст для чтения офлайн, Markdown для заметок и документации, HTML для встраивания или исходную разметку wikitext, используемую внутри MediaWiki. Это полезно исследователям, авторам и разработчикам, которым нужен контент статей за пределами браузера, без лишних элементов интерфейса страницы, таких как меню навигации, рекламные блоки или ссылки для редактирования.
Описание инструмента
Этот инструмент получает статью Википедии непосредственно по её URL и извлекает содержимое в одном из шести форматов на выбор: обычный текст, Markdown, HTML, исходный wikitext, представление разобранной структуры в формате AST (JSON) или PDF для скачивания. Можно точно настроить включаемые элементы: заголовки, списки, таблицы, ссылки, примечания, изображения, шаблоны и категории, а затем скопировать результат или скачать его в виде файла.
Возможности
- Получение любой общедоступной статьи Википедии непосредственно по её URL во всех языковых версиях Википедии
- Шесть выходных форматов: обычный текст, Markdown, HTML, исходный wikitext, AST (JSON) и PDF
- Детальная настройка содержимого с возможностью включить или исключить заголовки, списки, таблицы, ссылки, примечания, изображения, шаблоны и категории
- Отображение количества символов и слов в извлечённом содержимом в реальном времени
- Просмотрщик результатов с подсветкой синтаксиса, номерами строк и переносом слов
- Скачивание результата в файле соответствующего формата (
.txt,.md,.html,.wiki,.jsonили.pdf)
Как использовать
- Вставьте URL статьи Википедии, например
https://en.wikipedia.org/wiki/Dog - Нажмите «Получить статью», чтобы загрузить содержимое страницы
- Выберите выходной формат: обычный текст, Markdown, HTML, исходный wikitext, AST (JSON) или PDF
- Переключите параметры содержимого (заголовки, списки, таблицы, ссылки, примечания, изображения, шаблоны и категории), чтобы управлять включаемыми элементами
- Просмотрите извлечённое содержимое, количество символов и слов и при необходимости скачайте результат
Советы
- Язык и заголовок статьи считываются непосредственно из URL, поэтому можно вставить ссылку на любую языковую версию Википедии, а не только на английскую
- Параметры содержимого применяются только к форматам «Обычный текст», Markdown, HTML и PDF — исходный wikitext и AST всегда возвращают полный исходный код без фильтрации
- Отключите «Примечания» и оставьте «Шаблоны» отключёнными (это параметры по умолчанию), чтобы получить максимально удобную для чтения копию статьи, поскольку эти элементы часто добавляют лишнюю информацию, не относящуюся к основному тексту
- Используйте формат AST (JSON), если нужно изучить разобранную структуру статьи или обработать её программно
Часто задаваемые вопросы
Какие языковые версии Википедии поддерживаются?
Поддерживаются любые языковые версии Википедии — просто вставьте URL статьи из субдомена нужного языка (например, de.wikipedia.org или ja.wikipedia.org).
Почему в моём результате отсутствует ссылка или шаблон?
Проверьте параметры содержимого: ссылки, шаблоны, категории, изображения и примечания можно включать и отключать независимо друг от друга, а некоторые из них по умолчанию отключены.
Изменяет ли этот инструмент статью Википедии или сохраняет её?
Нет — он только считывает общедоступное содержимое статьи для извлечения и отображения. Никакие данные не загружаются в Википедию и не сохраняются там.
Можно ли получить точную исходную wiki-разметку?
Да — выберите «Исходный wikitext» в качестве выходного формата, чтобы увидеть неизменённую исходную разметку в точности в том виде, в котором она хранится в Википедии.