GcrawlAI: открытый API для скрапинга и краулинга сайтов в данные для LLM
Открытый API, который превращает сайты в чистый Markdown и JSON для ИИ-агентов, RAG-конвейеров и аналитики.
- Можно попробовать бесплатно
- Да
- Без регистрации
- Нет
- Русский интерфейс
- Не выяснено
- Работает с русским языком
- Не выяснено
- Российская карта
- Не выяснено
- Цена от
- Не выяснено
- Разработчик
- GramosoftAI
- Страна
- Индия
GcrawlAI — открытый сервис для сбора данных с сайтов под лицензией MIT. Он загружает страницы, отрисовывает JavaScript и возвращает содержимое в виде очищенного Markdown, структурированного JSON, HTML или скриншотов. Подходит для ИИ-агентов, RAG-конвейеров и команд, которые собирают данные из веба. Для сайтов с защитой от ботов есть стелс-режим с маскировкой браузера и ротация прокси с выбором страны. Сервис можно использовать как облачный API или развернуть у себя: бэкенд на Python с FastAPI, Celery, Redis и PostgreSQL. Для Python есть пакет gcrawl-sdk. Разрабатывает команда GramosoftAI.
Возможности
Скрапинг одной страницы
Запрос возвращает страницу в виде Markdown, HTML, скриншота и SEO-данных: заголовок, описание, Open Graph, структура ссылок.
Распределённый краулинг
Обход сайта идёт асинхронно через очередь задач на Celery и Redis. Статус и результаты задачи запрашиваются отдельными методами.
Стелс и прокси
Маскировка автоматизации и отпечатков WebGL и canvas помогает обходить анти-бот защиту. Ротация residential-прокси позволяет выбрать страну.
Fit-Markdown
Из страницы убираются меню, футеры и реклама, остаётся основной текст, удобный для подачи в языковую модель.
Скриншоты всей страницы
Сервис прокручивает страницу, чтобы подгрузить отложенный контент, и делает снимок целиком.
Офлайн-архив страницы
Страница вместе со стилями, картинками и ресурсами сохраняется одним ZIP-файлом.
Поиск и карта ссылок
Методы search и links ищут в Google с откатом на другие поисковики и собирают ссылки домена.
REST API и Python SDK
Методы scrape, crawl, links, screenshot и search доступны по HTTP и через пакет gcrawl-sdk. Есть API-ключи и ограничение частоты запросов.
Кому подойдёт
- Разработчики
Получают из любого сайта чистые данные через API или SDK, не поддерживая собственную инфраструктуру браузеров и прокси.
- Аналитики
Собирают данные с сайтов в структурированном виде для анализа и пополнения баз.
- Исследователи и учёные
Обходят сайты целиком и выгружают тексты в Markdown для последующей обработки.
- SEO-специалисты
Извлекают SEO-данные страниц и структуру ссылок, делают скриншоты для проверки.
Как начать
- Зарегистрироваться на gcrawlai.com и получить API-ключ.
- Установить пакет gcrawl-sdk командой pip install gcrawl-sdk или обращаться к REST API напрямую.
- Вызвать метод scrape с адресом страницы и выбрать формат: Markdown, HTML или скриншот.
- Для обхода сайта запустить crawl и забрать результат по номеру задачи.
- При необходимости развернуть сервис у себя из репозитория с PostgreSQL и Redis.
Тарифы
Есть бесплатный тариф без банковской карты и платные подписки с разным уровнем параллельности. Часть готовых экстракторов для маркетплейсов закрыта и входит в платные планы.
Ограничения
- На бесплатном тарифе действует месячный лимит запросов
- Готовые экстракторы для Amazon, Walmart, Flipkart и других площадок платные и закрытые
- Для самостоятельной установки нужны Python 3.9+, PostgreSQL и Redis
- Официальный SDK только для Python
Платформы и интеграции
Ещё в созвездии «Automation & Agents»
за последний месяц