Wikipedia Article Scraper avatar

Wikipedia Article Scraper

Pricing

Pay per usage

Go to Apify Store
Wikipedia Article Scraper

Wikipedia Article Scraper

Scrape Wikipedia articles via public MediaWiki API — no proxy, no auth. Modes: summary (extract + thumbnail), full_text, search, random, category. Supports 250+ language editions.

Pricing

Pay per usage

Rating

0.0

(0)

Developer

Hojun Lee

Hojun Lee

Maintained by Community

Actor stats

0

Bookmarked

2

Total users

1

Monthly active users

a day ago

Last modified

Categories

Share

Scrape Wikipedia articles at scale using the public MediaWiki API and REST API — no proxy, no API key, no auth required. Supports 250+ language editions.

Features

ModeWhat it does
summaryShort extract + thumbnail image for one or more article titles
full_textComplete article plain text (all sections)
searchSearch by keyword and return a list of matching articles
randomFetch N random articles
categoryList all articles in a Wikipedia category

Input

FieldTypeDefaultDescription
modestringsummaryScraping mode: summary, full_text, search, random, category
titlesstring[][]Article titles for summary / full_text modes
searchQuerystring""Search keyword (search mode)
categorystring""Category name without Category: prefix (category mode)
languagestringenWikipedia language code (en, ko, ja, de, fr, es, …)
maxItemsinteger10Maximum articles to return (1–500)
includeImagesbooleantrueInclude thumbnail image URL

Example inputs

Fetch article summaries

{
"mode": "summary",
"titles": ["Artificial intelligence", "Python (programming language)"],
"language": "en"
}

Get full article text

{
"mode": "full_text",
"titles": ["Quantum computing"],
"language": "en"
}

Keyword search

{
"mode": "search",
"searchQuery": "neural network deep learning",
"maxItems": 20
}

Random articles

{
"mode": "random",
"maxItems": 5,
"language": "ko"
}

Category members

{
"mode": "category",
"category": "Machine_learning",
"maxItems": 50
}

Output

Each item in the dataset:

{
"title": "Artificial intelligence",
"url": "https://en.wikipedia.org/wiki/Artificial_intelligence",
"language": "en",
"summary": "Artificial intelligence (AI) is intelligence demonstrated by machines…",
"text": "…full article text…",
"thumbnail": "https://upload.wikimedia.org/wikipedia/commons/thumb/…",
"categories": ["Artificial intelligence", "Computer science"],
"last_modified": "2026-09-01T00:00:00Z"
}

text is populated only in full_text mode. thumbnail is omitted when includeImages is false.

Pricing (Pay-Per-Event)

EventPrice
Actor start$0.005
Per article scraped$0.003

Scraping 100 articles costs ~$0.305 (start + 100 × $0.003).

Supported Languages

Any Wikipedia language edition: en, ko, ja, zh, de, fr, es, pt, it, ru, ar, hi, nl, pl, sv, vi, and 240+ more. Pass the two-letter (or longer) ISO language code as language.

Notes

  • Uses Wikipedia's REST API for summaries and the MediaWiki Action API for full text, search, random, and category queries.
  • No scraping of HTML pages — API responses only.
  • Respects Wikipedia's Terms of Use.
  • Rate-limited naturally by Wikipedia's API (no aggressive throttling needed).