К содержимому

GcrawlAI: открытый API для скрапинга и краулинга сайтов в данные для LLM

Открытый API, который превращает сайты в чистый Markdown и JSON для ИИ-агентов, RAG-конвейеров и аналитики.

Перейти на сайт Условно бесплатно Можно бесплатно
Можно попробовать бесплатно
Да
Без регистрации
Нет
Русский интерфейс
Не выяснено
Работает с русским языком
Не выяснено
Российская карта
Не выяснено
Цена от
Не выяснено
Разработчик
GramosoftAI
Страна
Индия
Данные проверены 9 октября 2026

GcrawlAI — открытый сервис для сбора данных с сайтов под лицензией MIT. Он загружает страницы, отрисовывает JavaScript и возвращает содержимое в виде очищенного Markdown, структурированного JSON, HTML или скриншотов. Подходит для ИИ-агентов, RAG-конвейеров и команд, которые собирают данные из веба. Для сайтов с защитой от ботов есть стелс-режим с маскировкой браузера и ротация прокси с выбором страны. Сервис можно использовать как облачный API или развернуть у себя: бэкенд на Python с FastAPI, Celery, Redis и PostgreSQL. Для Python есть пакет gcrawl-sdk. Разрабатывает команда GramosoftAI.

Возможности

Скрапинг одной страницы

Запрос возвращает страницу в виде Markdown, HTML, скриншота и SEO-данных: заголовок, описание, Open Graph, структура ссылок.

Распределённый краулинг

Обход сайта идёт асинхронно через очередь задач на Celery и Redis. Статус и результаты задачи запрашиваются отдельными методами.

Стелс и прокси

Маскировка автоматизации и отпечатков WebGL и canvas помогает обходить анти-бот защиту. Ротация residential-прокси позволяет выбрать страну.

Fit-Markdown

Из страницы убираются меню, футеры и реклама, остаётся основной текст, удобный для подачи в языковую модель.

Скриншоты всей страницы

Сервис прокручивает страницу, чтобы подгрузить отложенный контент, и делает снимок целиком.

Офлайн-архив страницы

Страница вместе со стилями, картинками и ресурсами сохраняется одним ZIP-файлом.

Поиск и карта ссылок

Методы search и links ищут в Google с откатом на другие поисковики и собирают ссылки домена.

REST API и Python SDK

Методы scrape, crawl, links, screenshot и search доступны по HTTP и через пакет gcrawl-sdk. Есть API-ключи и ограничение частоты запросов.

Кому подойдёт

  • Разработчики

    Получают из любого сайта чистые данные через API или SDK, не поддерживая собственную инфраструктуру браузеров и прокси.

  • Аналитики

    Собирают данные с сайтов в структурированном виде для анализа и пополнения баз.

  • Исследователи и учёные

    Обходят сайты целиком и выгружают тексты в Markdown для последующей обработки.

  • SEO-специалисты

    Извлекают SEO-данные страниц и структуру ссылок, делают скриншоты для проверки.

Как начать

  1. Зарегистрироваться на gcrawlai.com и получить API-ключ.
  2. Установить пакет gcrawl-sdk командой pip install gcrawl-sdk или обращаться к REST API напрямую.
  3. Вызвать метод scrape с адресом страницы и выбрать формат: Markdown, HTML или скриншот.
  4. Для обхода сайта запустить crawl и забрать результат по номеру задачи.
  5. При необходимости развернуть сервис у себя из репозитория с PostgreSQL и Redis.

Тарифы

Есть бесплатный тариф без банковской карты и платные подписки с разным уровнем параллельности. Часть готовых экстракторов для маркетплейсов закрыта и входит в платные планы.

Ограничения

  • На бесплатном тарифе действует месячный лимит запросов
  • Готовые экстракторы для Amazon, Walmart, Flipkart и других площадок платные и закрытые
  • Для самостоятельной установки нужны Python 3.9+, PostgreSQL и Redis
  • Официальный SDK только для Python

Платформы и интеграции

Веб API Самостоятельная установка Расширение браузера
Playwright PostgreSQL Redis Docker

Ещё в созвездии «Automation & Agents»

Botobo дайджест
+111новых сервисов
за последний месяц
раз в день · 53 подписчика
Подписаться на обновления