База знаний
Firecrawl — Web Data API для AI
Firecrawl — context API для поиска, скрейпинга, парсинга файлов и работы с браузером. Эндпоинты, форматы, лимиты и тарифы на август 2026.
СейчасЧто это такое
- Что это такое
- Ключевые обновления 2026 года
- Эндпоинты и возможности
- Форматы ответа, которые экономят контекст
- Подключение
- Доступ без ключа
- Плагин для Codex
- Проверка результата
- Тарифы и кредиты
- Безопасность и приватность
- Ограничения и когда не подходит
- Практические сценарии
- Для кого это полезно
- Ссылки
- Следующий шаг
- Связанные материалы
Firecrawl — это API для поиска, сбора и обработки веб-данных, из которого агенты получают чистый Markdown, JSON или готовый ответ на вопрос. За 2026 год сервис вырос из краулера в полноценный «context API»: к скрейпингу добавились поиск с релевантными выдержками, парсинг файлов, управление браузером и мониторинг изменений.
Что это такое
Firecrawl принимает ссылку или поисковый запрос и возвращает данные, пригодные для языковой модели: Markdown, структурированный JSON, выдержки по запросу или прямой ответ. Он рендерит JavaScript, обходит антибот-защиту, работает с PDF и офисными документами, поддерживает авторизованные сессии.
Проект открытый (репозиторий firecrawl/firecrawl, около 162 тысяч звёзд на GitHub на 7 августа 2026 года) и одновременно доступен как облачный сервис. Базовый URL API — https://api.firecrawl.dev, актуальная версия эндпоинтов — v2.
Ключевые обновления 2026 года
| Дата | Что появилось |
| 6 августа | Плагин Firecrawl для Codex: skills для search, scrape, crawl, map, interact, agent и parse работают через Firecrawl CLI прямо внутри агента. Доступен в каталоге плагинов Codex |
| 22 июля | Обновлённый /search: вместо целых страниц возвращаются наиболее релевантные выдержки. Заявлено 94,7% на SimpleQA и примерно в 10 раз меньше токенов, форма API не изменилась. Цифра — из собственного замера Firecrawl на агенте с многошаговыми вызовами, с цифрами конкурентов напрямую не сравнивается |
| 22 июля | Firecrawl — официальный коннектор Replit (анонс 23 июля) |
| 1 июля | Web-scale /monitor: слежение не за конкретными URL, а за всем вебом по набору запросов и цели |
| 24 июня (v2.11.0) | Research Index по 3 млн+ статей arXiv с кодом из репозиториев (отдельный анонс 16 июня), keyless-доступ, redactPII, формат deterministicJson, поиск видео на любой странице |
| 26 мая | /monitor: отслеживание изменений страниц с доставкой по вебхуку или почте |
| 15 мая (v2.10) | Сборка релиза: эндпоинт /parse (вышел 28 апреля), Lockdown Mode (30 апреля), форматы question (6 мая) и highlights (8 мая), официальные SDK для Go, Ruby, PHP и .NET |
| 10 апреля (v2.9.0) | /interact для управления браузером (анонс 25 марта), режимы разбора PDF fast / auto / ocr, параметр onlyCleanContent, SDK для Java и Elixir |
extract объявлен устаревшим, его заменяет /agent. В браузерных вызовах параметр persistentSession переименован в profile, а writeMode — в saveChanges; старые имена ещё работают, но из документации убраны.Эндпоинты и возможности
| Эндпоинт | Что делает | Когда нужен |
/scrape | Превращает одну страницу в Markdown, JSON, скриншот, выдержки или ответ на вопрос | Базовый сценарий сбора контента |
/crawl | Обходит сайт целиком с фильтрами путей и дедупликацией похожих URL | Документация, база знаний, каталог |
/map | Быстро возвращает список всех URL домена | Разведка структуры перед обходом |
/search | Ищет в вебе и отдаёт релевантные выдержки из найденных страниц | Ответы агента на вопросы о внешнем мире |
/parse | Разбирает загруженные файлы до 50 МБ: PDF, DOCX, DOC, ODT, RTF, XLSX, XLS, HTML | RAG по внутренним документам |
/agent | Автономно собирает данные по описанию задачи на естественном языке | Сложное извлечение вместо ручных схем |
/interact | Открывает живую браузерную сессию: клики, формы, навигация, Playwright-код, сохраняемые профили | Логин, пагинация, динамические интерфейсы |
/monitor | Следит за страницами или за вебом по запросу и присылает изменения | Мониторинг цен, релизов, документации |
Форматы ответа, которые экономят контекст
markdown— чистый текст страницы, поведение по умолчанию.json— структура по вашей схеме; вариантdeterministicJsonстроит переиспользуемый экстрактор и кеширует его для сайта, поэтому повторные запросы дешевле и стабильнее.question— прямой ответ на заданный вопрос, обоснованный содержимым страницы.highlights— точные предложения, строки кода и строки таблиц, совпавшие с запросом, с сохранением исходного форматирования.video— найденные на странице видео с URL, заголовком, превью и длительностью.
Firecrawl заявляет для question и highlights до 100 раз меньше токенов на вызов по сравнению с передачей всей страницы.
Подключение
Ключ выдаётся в дашборде и передаётся в заголовке Authorization. Храните его в переменной окружения, а не в коде.
export FIRECRAWL_API_KEY="fc-ваш-ключ"
curl -X POST "https://api.firecrawl.dev/v2/scrape" \
-H "Authorization: Bearer $FIRECRAWL_API_KEY" \
-H "Content-Type: application/json" \
-d '{"url": "https://example.com", "formats": ["markdown"]}'import os
from firecrawl import Firecrawl
firecrawl = Firecrawl(api_key=os.environ["FIRECRAWL_API_KEY"])
result = firecrawl.scrape("https://example.com")
print(result.markdown[:500])import { Firecrawl } from 'firecrawl'
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY })
const result = await firecrawl.scrape('https://example.com')
console.log(result.markdown.slice(0, 500))Доступ без ключа
С версии 2.11.0 эндпоинты /scrape, /search, /interact и /parse работают без API-ключа из официальных клиентов: MCP-сервера, CLI и SDK. Без ключа дают 1 000 бесплатных кредитов в месяц — тот же объём, что на Free-плане, и на боевую нагрузку этого не хватит. Это удобно, чтобы дать агенту доступ к вебу за минуту и решить вопрос с ключами позже. Для агентов есть отдельный онбординг-файл firecrawl.dev/agent-onboarding/SKILL.md.
Официальные SDK: Python, Node.js, Go, Rust, Java, Elixir, Ruby, PHP (с поддержкой Laravel) и .NET.
Плагин для Codex
6 августа 2026 года Firecrawl выпустил собственный плагин для OpenAI Codex (репозиторий firecrawl/firecrawl-codex-plugin, лицензия MIT). Плагин добавляет агенту готовые скиллы для search, scrape, crawl, map, interact, agent и parse: это не сырые инструменты, а описанные сценарии работы, поэтому агент реже пытается собрать вызов вручную.
Скиллы вызывают Firecrawl CLI, поэтому до установки нужны сам CLI и авторизация:
npm install -g firecrawl-cli
firecrawl login --browser
# либо задайте FIRECRAWL_API_KEY в переменных окруженияПроще всего поставить плагин из каталога: откройте Plugins в приложении Codex или выполните /plugins в CLI, найдите Firecrawl и включите его. Альтернатива — подключить marketplace репозитория вручную по инструкции в README. После включения перезапустите Codex.
Проверить установку можно двумя способами: попросить агента «найди свежий changelog Firecrawl и перескажи» или выполнить в терминале firecrawl --status и firecrawl search "firecrawl web scraping" --limit 3 --json.
Подробный разбор релиза — в блоге: Firecrawl стал плагином для Codex: точный поиск и скрейпинг внутри агента.
Проверка результата
Минимальный рабочий сценарий — запрос curl выше. Признаки того, что всё настроено верно:
- HTTP-код
200и полеdata.markdownс текстом страницы в ответе. - Код
401означает неверный или отсутствующий ключ,429— превышение лимита запросов или конкурентности вашего тарифа. - В дашборде уменьшился остаток кредитов: обычный
/scrapeсписывает один кредит за страницу.
Тарифы и кредиты
Цены и лимиты приведены по официальной странице тарифов на 7 августа 2026 года, при годовой оплате. Помесячная оплата дороже примерно на 20%: по размеру годовой скидки на самой странице это около $19 для Hobby, $99 для Standard, $399 для Growth и $749 для Scale.
| План | Цена | Кредиты в месяц | Параллельные запросы |
| Free | $0 | 1 000 | 2 |
| Hobby | $16 / мес | 5 000 | 5 |
| Standard | $83 / мес | 100 000 | 50 |
| Growth | $333 / мес | 500 000 | 100 |
| Scale | $599 / мес | 1 000 000 | 150 |
| Enterprise | По договору | Custom | Custom |
Сколько стоит запрос:
/scrape,/crawl,/map— 1 кредит за страницу;/monitor— 1 кредит за страницу за каждую проверку;/search— 2 кредита за 10 результатов;/interact— 2 кредита за минуту работы браузера;/agent— в предварительном доступе: 5 бесплатных запусков в день и динамическая цена;- продвинутые опции вроде JSON-формата и Enhanced Mode списывают дополнительные кредиты.
Безопасность и приватность
- Lockdown Mode. Флаг
lockdown: trueв/scrapeотдаёт результат только из индекса Firecrawl, без исходящих запросов и без сохранения данных. Работает в API, всех SDK, CLI (--lockdown) и MCP. - Автоматическое обезличивание. Опция
redactPIIвырезает имена, адреса, телефоны, почту и секреты из содержимого до того, как оно вернётся вам. - Zero Data Retention. На корпоративных планах результаты парсинга не сохраняются, что важно для договоров, медицинских и внутренних документов.
- Почему это не теория. При подготовке этого материала скрытые инструкции для агентов нашлись даже на страницах крупных сайтов, так что считайте любой скачанный текст данными, а не командами.
- Защита от промпт-инъекций. В формате
questionсодержимое страницы изолируется XML-разметкой и экранированием, а модель инструктирована игнорировать команды со страницы. Полностью проблему это не снимает, поэтому не давайте агенту выполнять действия по тексту, который он только что скачал.
Ограничения и когда не подходит
- Крупные соцсети и площадки за логином активно противодействуют автоматическому сбору, а их условия использования часто прямо его запрещают. Для таких источников надёжнее официальные API платформ.
- Подписочная модель без переноса кредитов бьёт по неравномерной нагрузке: за месяц с одним большим обходом вы платите так же, как за месяц простоя.
/agentпока в предварительном доступе, цена динамическая, поэтому для стабильного продакшна надёжнее описанные схемы извлечения.- Управление браузером и продвинутые опции (JSON-формат, Enhanced Mode) списывают дополнительные кредиты, так что для статичных страниц выбирайте простой
/scrapeс Markdown. - Сервис не снимает с вас юридическую сторону: условия сайтов,
robots.txtи правила обработки персональных данных остаются вашей ответственностью.
Практические сценарии
| Задача | Как собрать |
| Агент отвечает по свежей документации, а не по памяти модели | /search с форматом highlights или question: в контекст попадают только совпавшие фрагменты. В Codex это закрывает плагин |
| База знаний по чужой документации для RAG | /map для разведки структуры, затем /crawl с фильтрами путей и markdown на выходе |
| Регулярная сводка по конкурентам или релизам | /monitor по набору страниц или запросов с доставкой изменений в вебхук |
| Разбор входящих договоров, счетов и отчётов | /parse для файлов до 50 МБ плюс redactPII, если в документах есть персональные данные |
| Данные с одного сайта в стабильной структуре | deterministicJson: экстрактор строится один раз и кешируется, повторные запросы дешевле |
| Источник за логином или с пагинацией | /interact с сохранённым профилем; тарифицируется по минутам работы браузера, поэтому выносите в него только те шаги, где без браузера не обойтись |
/scrape с Markdown: JSON-формат, Enhanced Mode и браузерные сессии списывают дополнительные кредиты. Массовый обход планируйте под свой тариф — кредиты на self-serve планах не переносятся на следующий месяц.Для кого это полезно
Firecrawl закрывает задачу «дайте агенту веб» для тех, кто:
- строит RAG-системы и чат-боты по внешним источникам;
- собирает конкурентную аналитику и следит за изменениями цен, релизов и документации;
- разбирает входящие документы и превращает их в структурированные данные;
- автоматизирует исследования, в том числе научные, через Research Index;
- не хочет содержать собственную инфраструктуру из прокси, headless-браузеров и обхода капчи.
Ссылки
- Официальный сайт: firecrawl.dev
- Документация: docs.firecrawl.dev
- Changelog: firecrawl.dev/changelog
- Тарифы: firecrawl.dev/pricing
- GitHub: github.com/firecrawl/firecrawl
- Онбординг для агентов: firecrawl.dev/agent-onboarding/SKILL.md
Следующий шаг
Связанные материалы
- Статья: Сайт будущего будут читать не только люди. Его будут читать ИИ
- Блог: Firecrawl стал плагином для Codex: точный поиск и скрейпинг внутри агента
- База знаний: XCrawl — AI-скрейпинг и веб-данные для ИИ-агентов
Выбор инструмента здесь обычно упирается в конкретику: какие источники вам нужны, с какой частотой и что вы будете делать с полученными данными дальше. Такой разбор полезен командам, которые собирают агентов и упираются в качество входных данных.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Платформа Paperclip для оркестрации ИИ-агентов получила полноценную документацию. Разбираюсь, почему это важнее, чем кажется, и при чём тут оргструктуры для ботов.