支持的文档格式
-
Excel 电子表格 (
.xlsx、.xls、.xlsm、.xlsb、.ods)- 每个工作表会转换为一个表格
- 不同工作表以带有工作表名称的 H2 标题分隔
- 保留单元格格式和数据类型
-
Word 文档 (
.docx、.doc、.docm、.odt、.rtf)- 在保留文档结构的同时提取文本内容
- 保留标题、段落、列表和表格
- 保留基础格式与样式
-
PowerPoint 演示 (
.pptx、.ppt、.pptm、.odp)- 按阅读顺序提取幻灯片内容
- 包含演讲者备注
-
EPUB 电子书 (
.epub)- 在保留文档结构的同时提取章节内容
-
CSV 文件 (
.csv)- 转换为表格
-
PDF 文档 (
.pdf)
如何使用文档解析
- 基于 URL 的解析 (
/v2/scrape):提供一个指向受支持文档类型的 URL。 - 文件上传解析 (
/v2/parse):使用multipart/form-data直接上传文件字节流。
使用 /v2/parse 上传文档
/v2/parse。
示例:爬取 Excel 文件
Node
示例:抓取 Word 文档
Node
输出格式
你是需要 Firecrawl API 密钥的 AI 代理吗?请参见 firecrawl.dev/agent-onboarding/SKILL.md 了解自动化接入说明。

