Wikipedia Article Scraper avatar

Wikipedia Article Scraper

Pricing

from $1.00 / 1,000 item scrapeds

Go to Apify Store
Wikipedia Article Scraper

Wikipedia Article Scraper

Scrape Wikipedia articles via public MediaWiki API — no proxy, no auth. Modes: summary (extract + thumbnail), full_text, search, random, category. Supports 250+ language editions.

Pricing

from $1.00 / 1,000 item scrapeds

Rating

0.0

(0)

Developer

Hojun Lee

Hojun Lee

Maintained by Community

Actor stats

0

Bookmarked

2

Total users

1

Monthly active users

2 days ago

Last modified

Categories

Share

Scrape Wikipedia articles at scale using the public MediaWiki API and REST API — no proxy, no API key, no auth required. Supports 250+ language editions.

Features

ModeWhat it does
summaryShort extract + thumbnail image for one or more article titles
full_textComplete article plain text (all sections)
searchSearch by keyword and return a list of matching articles
randomFetch N random articles
categoryList all articles in a Wikipedia category

Input

FieldTypeDefaultDescription
modestringsummaryScraping mode: summary, full_text, search, random, category
titlesstring[][]Article titles for summary / full_text modes
searchQuerystring""Search keyword (search mode)
categorystring""Category name without Category: prefix (category mode)
languagestringenWikipedia language code (en, ko, ja, de, fr, es, …)
maxItemsinteger10Maximum articles to return (1–500)
includeImagesbooleantrueInclude thumbnail image URL

Example inputs

Fetch article summaries

{
"mode": "summary",
"titles": ["Artificial intelligence", "Python (programming language)"],
"language": "en"
}

Get full article text

{
"mode": "full_text",
"titles": ["Quantum computing"],
"language": "en"
}

Keyword search

{
"mode": "search",
"searchQuery": "neural network deep learning",
"maxItems": 20
}

Random articles

{
"mode": "random",
"maxItems": 5,
"language": "ko"
}

Category members

{
"mode": "category",
"category": "Machine_learning",
"maxItems": 50
}

Output

Each item in the dataset:

{
"title": "Artificial intelligence",
"url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
"language": "en",
"summary": "Artificial intelligence (AI) is intelligence demonstrated by machines…",
"text": "…full article text…",
"thumbnail": "https://upload.wikimedia.org/wikipedia/commons/thumb/…",
"categories": ["Artificial intelligence", "Computer science"],
"last_modified": "2026-09-01T00:00:00Z"
}

text is populated only in full_text mode. thumbnail is omitted when includeImages is false.

Pricing (Pay-Per-Event)

EventPrice
Actor start$0.005
Per article scraped$0.003

Scraping 100 articles costs ~$0.305 (start + 100 × $0.003).

Supported Languages

Any Wikipedia language edition: en, ko, ja, zh, de, fr, es, pt, it, ru, ar, hi, nl, pl, sv, vi, and 240+ more. Pass the two-letter (or longer) ISO language code as language.

Notes

  • Uses Wikipedia's REST API for summaries and the MediaWiki Action API for full text, search, random, and category queries.
  • No scraping of HTML pages — API responses only.
  • Respects Wikipedia's Terms of Use.
  • Rate-limited naturally by Wikipedia's API (no aggressive throttling needed).

Feedback

If this actor powers your knowledge extraction, a review helps others find it: Leave a review on Apify Store


Keywords: Wikipedia scraper, MediaWiki API extractor, Wikipedia article text scraper, Wikipedia summary API, multilingual Wikipedia data, Wikipedia full text extractor, Wikipedia category scraper, knowledge base automation, Wikipedia search API, encyclopedia data scraper, Wikipedia article metadata, no proxy required, 250 language Wikipedia, PPE per article