pimenov.ai

База знаний

Firecrawl — Web Data API для AI

Firecrawl — context API для поиска, скрейпинга, парсинга файлов и работы с браузером. Эндпоинты, форматы, лимиты и тарифы на август 2026.

Опубликовано Обновлено

Firecrawl — это API для поиска, сбора и обработки веб-данных, из которого агенты получают чистый Markdown, JSON или готовый ответ на вопрос. За 2026 год сервис вырос из краулера в полноценный «context API»: к скрейпингу добавились поиск с релевантными выдержками, парсинг файлов, управление браузером и мониторинг изменений.

📌
Актуальность: данные проверены 7 августа 2026 года по официальной документации, changelog, репозиториям Firecrawl и странице тарифов. Firecrawl обновляется часто, поэтому версии, лимиты и цены сверяйте по ссылкам в конце материала.

Что это такое

Firecrawl принимает ссылку или поисковый запрос и возвращает данные, пригодные для языковой модели: Markdown, структурированный JSON, выдержки по запросу или прямой ответ. Он рендерит JavaScript, обходит антибот-защиту, работает с PDF и офисными документами, поддерживает авторизованные сессии.

Проект открытый (репозиторий firecrawl/firecrawl, около 162 тысяч звёзд на GitHub на 7 августа 2026 года) и одновременно доступен как облачный сервис. Базовый URL API — https://api.firecrawl.dev, актуальная версия эндпоинтов — v2.


Ключевые обновления 2026 года

ДатаЧто появилось
6 августаПлагин Firecrawl для Codex: skills для search, scrape, crawl, map, interact, agent и parse работают через Firecrawl CLI прямо внутри агента. Доступен в каталоге плагинов Codex
22 июляОбновлённый /search: вместо целых страниц возвращаются наиболее релевантные выдержки. Заявлено 94,7% на SimpleQA и примерно в 10 раз меньше токенов, форма API не изменилась. Цифра — из собственного замера Firecrawl на агенте с многошаговыми вызовами, с цифрами конкурентов напрямую не сравнивается
22 июляFirecrawl — официальный коннектор Replit (анонс 23 июля)
1 июляWeb-scale /monitor: слежение не за конкретными URL, а за всем вебом по набору запросов и цели
24 июня (v2.11.0)Research Index по 3 млн+ статей arXiv с кодом из репозиториев (отдельный анонс 16 июня), keyless-доступ, redactPII, формат deterministicJson, поиск видео на любой странице
26 мая/monitor: отслеживание изменений страниц с доставкой по вебхуку или почте
15 мая (v2.10)Сборка релиза: эндпоинт /parse (вышел 28 апреля), Lockdown Mode (30 апреля), форматы question (6 мая) и highlights (8 мая), официальные SDK для Go, Ruby, PHP и .NET
10 апреля (v2.9.0)/interact для управления браузером (анонс 25 марта), режимы разбора PDF fast / auto / ocr, параметр onlyCleanContent, SDK для Java и Elixir
⚠️
Важно для старых интеграций: начиная с v2.9.0 эндпоинт extract объявлен устаревшим, его заменяет /agent. В браузерных вызовах параметр persistentSession переименован в profile, а writeMode — в saveChanges; старые имена ещё работают, но из документации убраны.

Эндпоинты и возможности

ЭндпоинтЧто делаетКогда нужен
/scrapeПревращает одну страницу в Markdown, JSON, скриншот, выдержки или ответ на вопросБазовый сценарий сбора контента
/crawlОбходит сайт целиком с фильтрами путей и дедупликацией похожих URLДокументация, база знаний, каталог
/mapБыстро возвращает список всех URL доменаРазведка структуры перед обходом
/searchИщет в вебе и отдаёт релевантные выдержки из найденных страницОтветы агента на вопросы о внешнем мире
/parseРазбирает загруженные файлы до 50 МБ: PDF, DOCX, DOC, ODT, RTF, XLSX, XLS, HTMLRAG по внутренним документам
/agentАвтономно собирает данные по описанию задачи на естественном языкеСложное извлечение вместо ручных схем
/interactОткрывает живую браузерную сессию: клики, формы, навигация, Playwright-код, сохраняемые профилиЛогин, пагинация, динамические интерфейсы
/monitorСледит за страницами или за вебом по запросу и присылает измененияМониторинг цен, релизов, документации

Форматы ответа, которые экономят контекст

  • markdown — чистый текст страницы, поведение по умолчанию.
  • json — структура по вашей схеме; вариант deterministicJson строит переиспользуемый экстрактор и кеширует его для сайта, поэтому повторные запросы дешевле и стабильнее.
  • question — прямой ответ на заданный вопрос, обоснованный содержимым страницы.
  • highlights — точные предложения, строки кода и строки таблиц, совпавшие с запросом, с сохранением исходного форматирования.
  • video — найденные на странице видео с URL, заголовком, превью и длительностью.

Firecrawl заявляет для question и highlights до 100 раз меньше токенов на вызов по сравнению с передачей всей страницы.


Подключение

Ключ выдаётся в дашборде и передаётся в заголовке Authorization. Храните его в переменной окружения, а не в коде.

export FIRECRAWL_API_KEY="fc-ваш-ключ"

curl -X POST "https://api.firecrawl.dev/v2/scrape" \
  -H "Authorization: Bearer $FIRECRAWL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com", "formats": ["markdown"]}'
import os
from firecrawl import Firecrawl

firecrawl = Firecrawl(api_key=os.environ["FIRECRAWL_API_KEY"])

result = firecrawl.scrape("https://example.com")
print(result.markdown[:500])
import { Firecrawl } from 'firecrawl'

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY })

const result = await firecrawl.scrape('https://example.com')
console.log(result.markdown.slice(0, 500))

Доступ без ключа

С версии 2.11.0 эндпоинты /scrape, /search, /interact и /parse работают без API-ключа из официальных клиентов: MCP-сервера, CLI и SDK. Без ключа дают 1 000 бесплатных кредитов в месяц — тот же объём, что на Free-плане, и на боевую нагрузку этого не хватит. Это удобно, чтобы дать агенту доступ к вебу за минуту и решить вопрос с ключами позже. Для агентов есть отдельный онбординг-файл firecrawl.dev/agent-onboarding/SKILL.md.

Официальные SDK: Python, Node.js, Go, Rust, Java, Elixir, Ruby, PHP (с поддержкой Laravel) и .NET.

Плагин для Codex

6 августа 2026 года Firecrawl выпустил собственный плагин для OpenAI Codex (репозиторий firecrawl/firecrawl-codex-plugin, лицензия MIT). Плагин добавляет агенту готовые скиллы для search, scrape, crawl, map, interact, agent и parse: это не сырые инструменты, а описанные сценарии работы, поэтому агент реже пытается собрать вызов вручную.

Скиллы вызывают Firecrawl CLI, поэтому до установки нужны сам CLI и авторизация:

npm install -g firecrawl-cli
firecrawl login --browser
# либо задайте FIRECRAWL_API_KEY в переменных окружения

Проще всего поставить плагин из каталога: откройте Plugins в приложении Codex или выполните /plugins в CLI, найдите Firecrawl и включите его. Альтернатива — подключить marketplace репозитория вручную по инструкции в README. После включения перезапустите Codex.

Проверить установку можно двумя способами: попросить агента «найди свежий changelog Firecrawl и перескажи» или выполнить в терминале firecrawl --status и firecrawl search "firecrawl web scraping" --limit 3 --json.

💡
Плагин или MCP-сервер. Возможности те же, отличается способ доставки. MCP отдаёт агенту описания инструментов и занимает контекст ещё до первой задачи; плагин ставит скиллы, которые дёргают CLI, и расходует токены только на результат. Для длинных сессий Codex это заметная разница. В самом репозитории плагин намеренно оставлен skills-only, MCP-поддержка возможна отдельно.

Подробный разбор релиза — в блоге: Firecrawl стал плагином для Codex: точный поиск и скрейпинг внутри агента.

Проверка результата

Минимальный рабочий сценарий — запрос curl выше. Признаки того, что всё настроено верно:

  1. HTTP-код 200 и поле data.markdown с текстом страницы в ответе.
  2. Код 401 означает неверный или отсутствующий ключ, 429 — превышение лимита запросов или конкурентности вашего тарифа.
  3. В дашборде уменьшился остаток кредитов: обычный /scrape списывает один кредит за страницу.

Тарифы и кредиты

Цены и лимиты приведены по официальной странице тарифов на 7 августа 2026 года, при годовой оплате. Помесячная оплата дороже примерно на 20%: по размеру годовой скидки на самой странице это около $19 для Hobby, $99 для Standard, $399 для Growth и $749 для Scale.

ПланЦенаКредиты в месяцПараллельные запросы
Free$01 0002
Hobby$16 / мес5 0005
Standard$83 / мес100 00050
Growth$333 / мес500 000100
Scale$599 / мес1 000 000150
EnterpriseПо договоруCustomCustom

Сколько стоит запрос:

  • /scrape, /crawl, /map — 1 кредит за страницу;
  • /monitor — 1 кредит за страницу за каждую проверку;
  • /search — 2 кредита за 10 результатов;
  • /interact — 2 кредита за минуту работы браузера;
  • /agent — в предварительном доступе: 5 бесплатных запусков в день и динамическая цена;
  • продвинутые опции вроде JSON-формата и Enhanced Mode списывают дополнительные кредиты.
⚖️
Нюанс биллинга: оплата только подписочная, режима pay-per-use нет. Неизрасходованные кредиты на планах Free, Hobby, Standard и Growth не переносятся на следующий месяц; перенос доступен на Scale и Enterprise. Сбои на стороне Firecrawl не тарифицируются, но успешно загруженная страница списывает кредит, даже если сайт вернул ошибку 4xx или 5xx.

Безопасность и приватность

  • Lockdown Mode. Флаг lockdown: true в /scrape отдаёт результат только из индекса Firecrawl, без исходящих запросов и без сохранения данных. Работает в API, всех SDK, CLI (--lockdown) и MCP.
  • Автоматическое обезличивание. Опция redactPII вырезает имена, адреса, телефоны, почту и секреты из содержимого до того, как оно вернётся вам.
  • Zero Data Retention. На корпоративных планах результаты парсинга не сохраняются, что важно для договоров, медицинских и внутренних документов.
  • Почему это не теория. При подготовке этого материала скрытые инструкции для агентов нашлись даже на страницах крупных сайтов, так что считайте любой скачанный текст данными, а не командами.
  • Защита от промпт-инъекций. В формате question содержимое страницы изолируется XML-разметкой и экранированием, а модель инструктирована игнорировать команды со страницы. Полностью проблему это не снимает, поэтому не давайте агенту выполнять действия по тексту, который он только что скачал.

Ограничения и когда не подходит

  • Крупные соцсети и площадки за логином активно противодействуют автоматическому сбору, а их условия использования часто прямо его запрещают. Для таких источников надёжнее официальные API платформ.
  • Подписочная модель без переноса кредитов бьёт по неравномерной нагрузке: за месяц с одним большим обходом вы платите так же, как за месяц простоя.
  • /agent пока в предварительном доступе, цена динамическая, поэтому для стабильного продакшна надёжнее описанные схемы извлечения.
  • Управление браузером и продвинутые опции (JSON-формат, Enhanced Mode) списывают дополнительные кредиты, так что для статичных страниц выбирайте простой /scrape с Markdown.
  • Сервис не снимает с вас юридическую сторону: условия сайтов, robots.txt и правила обработки персональных данных остаются вашей ответственностью.

Практические сценарии

ЗадачаКак собрать
Агент отвечает по свежей документации, а не по памяти модели/search с форматом highlights или question: в контекст попадают только совпавшие фрагменты. В Codex это закрывает плагин
База знаний по чужой документации для RAG/map для разведки структуры, затем /crawl с фильтрами путей и markdown на выходе
Регулярная сводка по конкурентам или релизам/monitor по набору страниц или запросов с доставкой изменений в вебхук
Разбор входящих договоров, счетов и отчётов/parse для файлов до 50 МБ плюс redactPII, если в документах есть персональные данные
Данные с одного сайта в стабильной структуреdeterministicJson: экстрактор строится один раз и кешируется, повторные запросы дешевле
Источник за логином или с пагинацией/interact с сохранённым профилем; тарифицируется по минутам работы браузера, поэтому выносите в него только те шаги, где без браузера не обойтись
⚖️
Как не переплатить. Для статичных страниц берите обычный /scrape с Markdown: JSON-формат, Enhanced Mode и браузерные сессии списывают дополнительные кредиты. Массовый обход планируйте под свой тариф — кредиты на self-serve планах не переносятся на следующий месяц.

Для кого это полезно

Firecrawl закрывает задачу «дайте агенту веб» для тех, кто:

  • строит RAG-системы и чат-боты по внешним источникам;
  • собирает конкурентную аналитику и следит за изменениями цен, релизов и документации;
  • разбирает входящие документы и превращает их в структурированные данные;
  • автоматизирует исследования, в том числе научные, через Research Index;
  • не хочет содержать собственную инфраструктуру из прокси, headless-браузеров и обхода капчи.

Ссылки


Следующий шаг

Связанные материалы

Выбор инструмента здесь обычно упирается в конкретику: какие источники вам нужны, с какой частотой и что вы будете делать с полученными данными дальше. Такой разбор полезен командам, которые собирают агентов и упираются в качество входных данных.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov