Startpage News Scraper
Under maintenancePricing
from $4.99 / 1,000 results
Startpage News Scraper
Under maintenanceScrapes news search results from Startpage.com. Extracts article title, URL, source, snippet, publication date, and thumbnail.
Pricing
from $4.99 / 1,000 results
Rating
0.0
(0)
Developer
Coding Frontned
Maintained by CommunityActor stats
0
Bookmarked
2
Total users
1
Monthly active users
4 days ago
Last modified
Categories
Share
Collects complete organic news cards from Startpage's public News results. It uses one ordinary Chromium session and only semantic public DOM plus the visible Next control. It never modifies browser identity, retries access controls, clicks verification, signs in, opens articles/Anonymous View, or calls private APIs.
Input
query(required): 2–200 characters.maxItems: 1–100 unique complete news cards; default 10.maxPages: 1–10 visible pages; default 3.proxyConfiguration: optional proxy for the public browser session.
{ "query": "artificial intelligence", "maxItems": 10, "maxPages": 2 }
Output and limits
Every dataset row requires sequential position, headline, external article URL, publisher and domain, non-empty snippet, Startpage's displayed publication text, query, page, exact source page, public-DOM provenance, and retrieval timestamp. URL fragments and common tracking parameters are removed; unsafe, credentialed, Startpage-owned, local, IP-address, incomplete, and duplicate article links are omitted.
The initial public “Verifying…” interstitial is allowed to resolve on its own for at most 20 seconds. If it persists or Startpage returns a CAPTCHA, access-denied, suspended, or HTTP 401/403/407/429 response, the Actor fails without retry or interaction and stores DIAGNOSTICS outside the dataset. Layout and news availability may change; displayed relative dates are preserved instead of guessed as exact timestamps.
Local validation
npm cinpm testapify run --purge --input-file .actor/input.json