Skip to main content
Parse convertit les documents en données propres, prêtes pour les LLM. Importez un fichier via /parse — ou utilisez /scrape avec l’URL d’un document public — et obtenez du markdown, du contenu par page, des blocs de mise en page typés ou du JSON structuré.
  • Respect de la mise en page : titres, paragraphes, tableaux et formules assemblés dans l’ordre de lecture
  • Documents numérisés pris en charge : extraction de texte natif avec OCR comme solution de repli pour les pages ne contenant que des images
  • Structure ancrée dans le document : blocs de mise en page typés avec boîtes englobantes et liens vers des plages de caractères du markdown (PDF)
  • Tous les formats courants : PDF, Word, Excel, PowerPoint, OpenDocument, EPUB, CSV, HTML
  • Prise en charge de Zero Data Retention

Démarrage rapide

Vous avez une URL publique vers un document plutôt qu’un fichier ? /scrape détecte le type de fichier et l’analyse de la même façon — mêmes options, même résultat : firecrawl.scrape("https://example.com/report.pdf").

Réponse

Les SDK renvoient directement l’objet document. cURL renvoie le payload JSON.
numPages est le nombre de pages réellement analysées ; totalPages correspond au nombre réel de pages du document. Ils correspondent sauf si maxPages a tronqué le résultat — p. ex. l’analyse d’un PDF de 100 pages avec maxPages: 10 renvoie numPages: 10 et totalPages: 100, donc totalPages > numPages indique que la sortie a été tronquée. totalPages est omis lorsque le nombre de pages ne peut pas être déterminé.
Au-delà du markdown du document, trois sorties couvrent les cas où une seule chaîne markdown ne suffit pas : le markdown par page et les blocs de mise en page pour les documents PDF, et le JSON structuré pour tous les formats.

Markdown par page (PDF)

Activez pages: true dans l’analyseur PDF pour que le document contienne également un tableau pages avec le markdown de chaque page — utile pour savoir de quelle page provient le contenu ou pour traiter les pages indépendamment. Sans coût supplémentaire.

Blocs de mise en page (PDF)

Définissez blocks: true dans l’analyseur PDF ; le document contient alors également un tableau blocks : pour chaque page, les blocs de mise en page typés détectés par le moteur d’analyse, avec leur géométrie et leur provenance. Il s’agit du pendant structuré du markdown : utilisez-le pour l’ancrage des citations, superposer des surlignages ou auditer le contenu d’un document. Sans coût supplémentaire.
Une page PDF analysée avec des boîtes englobantes colorées superposées sur chaque bloc de mise en page détecté : titre, texte, en-têtes de section, tableau, figure, légende, pied de page et numéro de page

Chaque bloc détecté par le moteur, typé et positionné — les mêmes régions qui deviennent du markdown.

Champs de bloc

Ancrage : d’une réponse à la page

markdownSpan lie chaque bloc à la sous-chaîne exacte du markdown qu’il a produit. L’ancrage des citations relève donc d’une recherche, et non d’une inférence : trouvez le texte cité dans le markdown, puis le bloc dont la plage couvre ce décalage, et vous obtenez le numéro de page et la boîte englobante — sans jamais demander de coordonnées à un modèle de langage.

Sortie JSON structurée

Fournissez un schéma JSON ou un prompt pour extraire des données structurées directement du document :

Options pour les PDF

Le comportement des PDF est entièrement contrôlé par l’option parsers, aussi bien pour /parse que pour /scrape :
Passer parsers: [] désactive entièrement l’analyse et renvoie le PDF en base64 (1 crédit forfaitaire).

Modes d’analyse

Formats pris en charge

Extensions : .html, .htm, .xhtml, .pdf, .docx, .doc, .docm, .odt, .ods, .odp, .rtf, .xlsx, .xls, .xlsm, .xlsb, .pptx, .ppt, .pptm, .epub, .csv. Voir Document Parsing pour savoir comment chaque format est converti.

Référence de la requête

La requête est au format multipart/form-data avec une partie file obligatoire et une partie JSON options facultative. options accepte un sous-ensemble des options de scrape :
  • formats : tableau de formats de sortie. Valeur par défaut : ["markdown"]. Pris en charge : markdown, html, rawHtml, links, images, summary et json (avec un schéma ou un prompt).
  • onlyMainContent : renvoie uniquement le contenu principal du document. Valeur par défaut : true.
  • includeTags / excludeTags : inclusion ou exclusion au niveau des balises (éléments HTML).
  • redactPII : masque les informations personnelles identifiables dans le markdown renvoyé.
  • timeout : délai d’expiration de la requête en millisecondes. Valeur par défaut : 30000, maximum 300000.
  • parsers : paramètres du parseur de fichiers — consultez les options PDF.
/parse ne prend pas en charge les options réservées au navigateur comme actions, waitFor, location, mobile ou le suivi des modifications.
Vous utilisez Firecrawl via MCP ? Utilisez firecrawl_parse pour les fichiers locaux. Le MCP local peut lire directement le fichier lorsqu’il est configuré avec FIRECRAWL_API_URL. Le MCP hébergé à distance renvoie d’abord une commande de téléversement à durée de vie limitée, puis analyse l’uploadRef renvoyé. Les URL de documents publics doivent toujours utiliser /scrape.

Considérations

  • La taille maximale de fichier est de 50 MB par requête.
  • L’analyse de PDF est facturée à 1 crédit par page ; les options pages et blocks n’entraînent aucun coût supplémentaire.
  • L’analyse de PDF très volumineux ou numérisés en mode ocr peut prendre plus de temps — augmentez timeout ou utilisez maxPages pour limiter le traitement.
  • Pour des lots de fichiers, appelez /parse pour chaque fichier en parallèle ; il n’existe pas d’option de téléversement par lot.
Êtes-vous un agent IA qui a besoin d’une clé API Firecrawl ? Consultez firecrawl.dev/agent-onboarding/SKILL.md pour obtenir des instructions d’intégration automatisée.