AI Training Data Collector — Clean Web Datasets for LLMs
Pricing
Pay per event
Go to Apify Store
AI Training Data Collector — Clean Web Datasets for LLMs
Crawl websites and extract structured, clean text datasets perfect for fine-tuning LLMs and RAG pipelines. Removes boilerplate, deduplicates, and scores content quality.
AI Training Data Collector — Structured Web Datasets for LLMs
Crawl websites and extract structured, clean text datasets perfect for fine-tuning LLMs and RAG pipelines. This AI training data collector removes boilerplate, deduplicates content, and scores quality for AI training.
Features
- Smart content extraction: Removes navigation, ads, footers, and boilerplate
- Multi-format output: Markdown, plain text, or JSON-Lines
- Quality scoring: Each page scored 0-100 for training suitability
- Deduplication: Content hash-based deduplication across pages
- Configurable depth: 0-3 levels of crawl depth from start URLs
- Pattern exclusion: Skip unwanted URL patterns (tags, categories, etc.)
Input Parameters
| Parameter | Type | Default | Description |
|---|---|---|---|
urls | array | Wikipedia AI page | Start URLs to crawl |
crawlDepth | integer | 1 | Link follow depth (0-3) |
maxPages | integer | 5 | Max pages to process |
outputFormat | string | markdown | Content format |
excludePatterns | array | tags, categories | URL patterns to skip |
minWordCount | integer | 100 | Skip short pages |
proxyConfiguration | object | Apify Proxy | Proxy for reliable scraping |
Use Cases
- LLM fine-tuning: Build custom training datasets from any website
- RAG pipelines: Create knowledge base documents for retrieval-augmented generation
- Research datasets: Collect structured content for academic research
- Competitive analysis: Extract and analyze competitor website content
Cost Estimate
- 5 pages: ~$0.25
- 100 pages: ~$2.00
- 1000 pages: ~$15.00