1from apify_client import ApifyClient
2
3
4
5client = ApifyClient("<YOUR_API_TOKEN>")
6
7
8run_input = {
9 "startUrls": [
10 { "url": "https://www.w3.org/WAI/ER/tests/xhtml/testfiles/resources/pdf/dummy.pdf" },
11 { "url": "https://raw.githubusercontent.com/naptha/tesseract.js/master/tests/assets/images/cosmic.png" },
12 { "url": "https://www.w3.org/WAI/standards-guidelines/wcag/" },
13 ],
14 "maxItems": 3,
15 "maxPdfOcrPages": 5,
16}
17
18
19run = client.actor("automation-lab/layout-aware-text-extractor").call(run_input=run_input)
20
21
22print(f"💾 Check your data here: https://console.apify.com/storage/datasets/{run.default_dataset_id}")
23for item in client.dataset(run.default_dataset_id).iterate_items():
24 print(item)
25
26