数据截至 (上游 commit 31522cf981bf)
Firecrawl — 这是什么 · 全景 · 阅读地图
30 秒导读: Firecrawl 是一套开源的 web 数据 API:你给它一个 URL(网页、 也可以是 PDF/DOCX),它替你处理代理轮换、JS 渲染、反爬这些脏活,把页面变成 干净的 Markdown 或结构化 JSON——正好是喂给大模型的格式。它主要给 AI agent 当"眼睛和手":需要实时网页内容时调它。
1. 这是什么(零基础也能懂)
一句话定义
Firecrawl = 把"网页"变成"LLM 能直接吃的数据"的 API。 输入一个网址,输出一段 干净 Markdown 或一份符合你 schema 的 JSON。
解决什么问题 / 给谁用
假设你在写一个 AI agent,要它"读一下这个产品页,告诉我价格方案"。你会立刻撞上一堆 和 AI 无关的苦活:
- 页面是 JS 渲染的,
curl拿到的是空壳; - 网站有反爬 / 需要轮换代理 / 有速率限制;
- 拿到的 HTML 里全是导航栏、广告、脚本,真正的正文淹在噪声里;
- 你要的其实是结构化字段(价格、标题),不是一大坨 HTML。
Firecrawl 就是把这些苦活打包成一次 API 调用。README 的 "Why Firecrawl" 一节把卖点 列成:覆盖 96% 的网页(含 JS 重页面)、P95 延迟 3.4s、直接输出 LLM-ready 的 Markdown/JSON、 自动处理代理与反爬(README.md:52-62)。它给谁用:AI agent、RAG 管线、任何要"实时网页 上下文"的应用。
它能做什么(核心端点)
| 端点 | 干什么 | 同步/异步 |
|---|---|---|
| scrape | 单个 URL → Markdown / HTML / 截图 / JSON | 同步(等结果) |
| search | 搜索网页,并抓回结果页正文 | 同步 |
| map | 秒级发现一个站点的所有 URL | 同步 |
| crawl | 顺着链接爬完整站,抓所有页面 | 异步(返回 job id) |
| batch scrape | 一次异步抓成千上万个 URL | 异步 |
| extract / agent | 用自然语言 + schema 让 AI 跨页取数 | 异步 |
端点清单见 README.md:67-83;各端点的请求示例见 README.md:90-506。