⚡ Universal AI Web Markdown & Schema Extractor [MCP]
Pricing
from $0.01 / 1,000 results
Go to Apify Store![⚡ Universal AI Web Markdown & Schema Extractor [MCP]](https://apify.com/img/store/actor_picture.svg)

⚡ Universal AI Web Markdown & Schema Extractor [MCP]
Sub-200ms ultra-clean web content extractor for AI agents. Converts websites to token-dense Markdown, extracts JSON-LD schemas, meta data, and contacts.
Pricing
from $0.01 / 1,000 results
Rating
0.0
(0)
Developer
Jayshree Jain
Maintained by CommunityActor stats
0
Bookmarked
2
Total users
1
Monthly active users
4 days ago
Last modified
Categories
Share
⚡ Universal AI Web Markdown & Structured Data Extractor for LLMs & MCP
The Sub-200ms, Token-Dense Alternative to Heavy Headless Crawlers
Engineered specifically for Autonomous AI Agents (Claude Desktop, Cursor, LangChain, CrewAI, LlamaIndex, MCP) and High-Volume Data Pipelines.
🚀 Architectural Comparison: Token-Dense AI Extractor vs. Heavyweight Headless Crawlers
| Architectural Feature | Traditional Headless Browser Crawlers | Universal AI Markdown & Schema Extractor [MCP] |
|---|---|---|
| Extraction Architecture | Full Browser DOM / JavaScript Engine (High Compute & Memory Overhead) | ⚡ Async HTTP Stream Parser (Lightweight, Sub-Second Execution) |
| Output Payload | Raw HTML DOM, Inline CSS, Scripts, Navigation Boilerplate | 🎯 Token-Budgeted Clean Markdown (Noise & Ad Elements Stripped) |
| LLM Context Safeguard | Unbounded Payloads (Prone to Context Window Overflow) | 🛡️ Hard-Capped 8,000 Token Ceiling with Truncation Indicator |
| Structured Schema.org | ❌ None (Requires Custom Extraction Rules) | ✅ Auto-Extracted JSON-LD (Products, FAQs, Articles, Orgs) |
| B2B Contact Intelligence | ❌ None | ✅ Auto-Harvests Emails, Phone Numbers & Social Links |
| Token Usage Tracking | ❌ None | ✅ Integrated cl100k_base Token & Character Metrics |
| Model Context Protocol (MCP) | ⚠️ High Timeout & Memory Overhead Risk | ✅ Native MCP Support for Claude Desktop, Cursor & Agents |
| Pricing Model | Variable Compute Unit Charges | 💰 Pay-Per-Event: $0.01 / 1,000 Pages ($0.00001/page) |
🤖 1-Click AI Framework Integrations
1. Claude Desktop & Cursor (Model Context Protocol - MCP)
Add this directly to your claude_desktop_config.json:
{"mcpServers": {"web-markdown-extractor": {"command": "npx","args": ["-y", "@apify/mcp-server", "--token", "YOUR_APIFY_TOKEN"]}}}
2. LangChain (Python)
from apify_client import ApifyClientclient = ApifyClient("YOUR_APIFY_TOKEN")run = client.actor("datalabs/universal-ai-markdown-mcp-extractor").call(run_input={"startUrls": [{"url": "https://example.com"}]})dataset_items = client.dataset(run["defaultDatasetId"]).list_items().itemsclean_markdown = dataset_items[0]["markdown"]print(f"Extracted {dataset_items[0]['tokenMetrics']['cl100kTokenCount']} tokens.")
3. CrewAI Custom Tool
from crewai.tools import toolfrom apify_client import ApifyClient@tool("Web Content Extractor")def extract_web_content(url: str) -> str:"""Extracts ultra-clean markdown, JSON-LD schemas, and contact info from any URL."""client = ApifyClient("YOUR_APIFY_TOKEN")run = client.actor("datalabs/universal-ai-markdown-mcp-extractor").call(run_input={"startUrls": [{"url": url}]})items = client.dataset(run["defaultDatasetId"]).list_items().itemsreturn items[0]["markdown"] if items else "No content extracted."
🛠️ Input Parameters
{"startUrls": [{ "url": "https://news.ycombinator.com" },{ "url": "https://apify.com" }],"maxConcurrency": 10,"timeoutSecs": 15}
📊 Output Dataset Fields
url: Final resolved URL (after redirects)success:true/falsestatusCode: HTTP response code (e.g. 200)markdown: Clean, token-dense Markdown stripped of scripts, navs, footers, and cookie bannerstokenMetrics: Character count and estimatedcl100ktoken usagemeta: Title, description, OpenGraph image, canonical URL, languagejsonLd: Structured Schema.org JSON-LD objectscontacts: Verified emails, phone numbers, and social URLs (LinkedIn, Twitter, GitHub, etc.)