AI Content Pipeline (Universal RAG Bundle) avatar

AI Content Pipeline (Universal RAG Bundle)

Pricing

from $25.00 / 1,000 source ingested (auto-detected type)s

Go to Apify Store
AI Content Pipeline (Universal RAG Bundle)

AI Content Pipeline (Universal RAG Bundle)

Ingère une liste de sources mixtes (pages web, PDF, vidéos YouTube) en une seule fois, détecte automatiquement le type de chaque source, et retourne des chunks + embeddings prêts à indexer dans une base vectorielle — un seul Actor au lieu d'en orchestrer trois séparément.

Pricing

from $25.00 / 1,000 source ingested (auto-detected type)s

Rating

0.0

(0)

Developer

Oussema Toumi

Oussema Toumi

Maintained by Community

Actor stats

0

Bookmarked

2

Total users

1

Monthly active users

4 days ago

Last modified

Share

Ingère une liste de sources mixtes (pages web, PDF, vidéos YouTube) en une seule fois — le type de chaque source est détecté automatiquement à partir de l'URL, aucun champ sourceType à préciser manuellement. Retourne des chunks + embeddings prêts à indexer dans une base vectorielle. C'est le même moteur que les Actors web-to-markdown, rag-universal-ingestion, et youtube-transcript-extractor réunis dans un seul appel.

Pourquoi ce bundle plutôt que les 3 Actors séparés ?

Un utilisateur qui doit ingérer 50 sources mixtes (30 pages web, 15 PDF, 5 vidéos) devrait sinon trier ses sources par type et faire 3 appels différents. Ici il colle sa liste brute et l'Actor s'occupe du tri — c'est cette commodité qui justifie un prix légèrement plus élevé par source que rag-universal-ingestion seul.

Input

ChampTypeDescription
sourcesarrayURLs mixtes (web, PDF, YouTube)
chunkSizeintTaille des chunks en caractères (défaut: 1000)
chunkOverlapintChevauchement entre chunks (défaut: 150)
generateEmbeddingsboolGénérer les embeddings (défaut: true)
embeddingModelstringModèle OpenRouter (défaut: openai/text-embedding-3-small)
openrouterApiKeystringRequise si generateEmbeddings=true

Output (dataset)

Chaque enregistrement contient: source, sourceType (auto-détecté), chunkIndex, text, charCount, et si activé embedding + embeddingModel.

Facturation (pay-per-event)

  • source-ingested — 0,025 $ — par source traitée, tous types confondus (vs 0,02 $ pour l'extraction seule sur rag-universal-ingestion — la différence reflète la détection automatique du type)
  • chunk-embedded — 0,001 $ — par chunk avec embedding
  • chunk-only — 0,0002 $ — par chunk sans embedding

Exemple: 50 sources mixtes, ~10 chunks chacune avec embeddings ≈ (50 × 0,025 $) + (500 × 0,001 $) = 1,25 $ + 0,50 $ = 1,75 $ facturés.

Notes techniques

  • Détection de type basée uniquement sur le motif de l'URL (youtube.com/watch, .pdf, sinon page web) — pas de vérification du Content-Type HTTP, donc une URL PDF sans extension .pdf sera traitée comme une page web (limite connue, acceptable pour la majorité des cas).
  • Aucun GPU requis, mêmes garanties que rag-universal-ingestion : extraction et chunking en texte pur, embeddings délégués à OpenRouter.