/parse — ou utilisez /scrape
avec l’URL d’un document public — et obtenez du markdown, du contenu par page, des
blocs de mise en page typés ou du JSON structuré.
- Respect de la mise en page : titres, paragraphes, tableaux et formules assemblés dans l’ordre de lecture
- Documents numérisés pris en charge : extraction de texte natif avec OCR comme solution de repli pour les pages ne contenant que des images
- Structure ancrée dans le document : blocs de mise en page typés avec boîtes englobantes et liens vers des plages de caractères du markdown (PDF)
- Tous les formats courants : PDF, Word, Excel, PowerPoint, OpenDocument, EPUB, CSV, HTML
- Prise en charge de Zero Data Retention
Démarrage rapide
Vous avez une URL publique vers un document plutôt qu’un fichier ?
/scrape
détecte le type de fichier et l’analyse de la même façon — mêmes options, même résultat :
firecrawl.scrape("https://example.com/report.pdf").Réponse
numPages est le nombre de pages réellement analysées ; totalPages correspond au nombre
réel de pages du document. Ils correspondent sauf si maxPages a tronqué le résultat — p. ex. l’analyse
d’un PDF de 100 pages avec maxPages: 10 renvoie numPages: 10 et totalPages: 100, donc
totalPages > numPages indique que la sortie a été tronquée. totalPages est omis
lorsque le nombre de pages ne peut pas être déterminé.Markdown par page (PDF)
pages: true dans l’analyseur PDF pour que le document contienne également
un tableau pages avec le markdown de chaque page — utile pour savoir de quelle page provient le contenu
ou pour traiter les pages indépendamment. Sans coût supplémentaire.
Blocs de mise en page (PDF)
blocks: true dans l’analyseur PDF ; le document contient alors également
un tableau blocks : pour chaque page, les blocs de mise en page typés détectés par le moteur d’analyse,
avec leur géométrie et leur provenance. Il s’agit du pendant structuré
du markdown : utilisez-le pour l’ancrage des citations, superposer des surlignages
ou auditer le contenu d’un document. Sans coût supplémentaire.

Chaque bloc détecté par le moteur, typé et positionné — les mêmes régions qui deviennent du markdown.
Champs de bloc
Ancrage : d’une réponse à la page
markdownSpan lie chaque bloc à la sous-chaîne exacte du markdown qu’il a
produit. L’ancrage des citations relève donc d’une recherche, et non d’une inférence : trouvez le
texte cité dans le markdown, puis le bloc dont la plage couvre ce décalage,
et vous obtenez le numéro de page et la boîte englobante — sans jamais demander de
coordonnées à un modèle de langage.
Sortie JSON structurée
Options pour les PDF
parsers, aussi bien pour /parse que pour
/scrape :
Passer
parsers: [] désactive entièrement l’analyse et renvoie le PDF en base64
(1 crédit forfaitaire).
Modes d’analyse
Formats pris en charge
.html, .htm, .xhtml, .pdf, .docx, .doc, .docm, .odt, .ods, .odp, .rtf, .xlsx, .xls, .xlsm, .xlsb, .pptx, .ppt, .pptm, .epub, .csv.
Voir Document Parsing pour savoir comment chaque format est
converti.
Référence de la requête
multipart/form-data avec une partie file obligatoire et une
partie JSON options facultative. options accepte un sous-ensemble des options de scrape :
formats: tableau de formats de sortie. Valeur par défaut :["markdown"]. Pris en charge :markdown,html,rawHtml,links,images,summaryetjson(avec un schéma ou un prompt).onlyMainContent: renvoie uniquement le contenu principal du document. Valeur par défaut :true.includeTags/excludeTags: inclusion ou exclusion au niveau des balises (éléments HTML).redactPII: masque les informations personnelles identifiables dans le markdown renvoyé.timeout: délai d’expiration de la requête en millisecondes. Valeur par défaut :30000, maximum300000.parsers: paramètres du parseur de fichiers — consultez les options PDF.
/parse ne prend pas en charge les options réservées au navigateur comme actions, waitFor, location, mobile ou le suivi des modifications.Considérations
- La taille maximale de fichier est de 50 MB par requête.
- L’analyse de PDF est facturée à 1 crédit par page ; les options
pagesetblocksn’entraînent aucun coût supplémentaire. - L’analyse de PDF très volumineux ou numérisés en mode
ocrpeut prendre plus de temps — augmenteztimeoutou utilisezmaxPagespour limiter le traitement. - Pour des lots de fichiers, appelez
/parsepour chaque fichier en parallèle ; il n’existe pas d’option de téléversement par lot.
Êtes-vous un agent IA qui a besoin d’une clé API Firecrawl ? Consultez firecrawl.dev/agent-onboarding/SKILL.md pour obtenir des instructions d’intégration automatisée.

