Что показано
Автор показывает карточку GitHub-репозитория ScrapeGraphAI, терминал с командой claude "find plumbing business owners" и лог из трёх шагов: поиск по шести каталогам, обход 3412 компаний, извлечение полей company/owner/email. Дальше идёт готовая таблица с именами, компаниями и почтами (roofing и HVAC по Канаде и США), сравнение цены с платным Apify и кадр с расписанием: запуск каждый будний день в 7 утра.
Почему это работает
ScrapeGraphAI не сервис, а Python-библиотека: она строит граф скрапинга, где LLM сама решает, куда идти дальше по сайту и как вытащить нужные поля из неструктурированной страницы, вместо того чтобы писать селекторы руками под каждый источник. Кстати, Claude Code в этой связке не какая-то секретная фича Anthropic, а обычный coding-агент: он умеет клонировать репозиторий, поставить зависимости и написать обвязку под конкретный запрос. Ровно то же самое, в общем, можно сделать с любым другим агентом, у которого есть доступ к shell.
Здесь работает не «Клод», а связка любого coding-агента с чужой open-source библиотекой, Claude просто умеет её поставить и запустить.
Как повторить
- Открыть https://github.com/ScrapeGraphAI/Scrapegraph-ai, посмотреть README. На кадре ролика адрес прочитался с опечаткой (
ScrapeGraphAl, последняя буква «l» вместо «I»), по такому адресу GitHub отдаёт 404, а с заглавной «I» всё открывается. - Проверить, что у вас Python 3.12 или новее (
python3 --version): на более старом пакет не поставится. Дальше в Claude Code (или Cursor/Codex с доступом к терминалу) дать ссылку на репозиторий и попросить:поставь ScrapeGraphAI в отдельное виртуальное окружение по README. Под капотом этоpip install scrapegraphaiи затемplaywright install(скачивает браузер для страниц с JavaScript). Про Playwright лучше сказать агенту сразу, чтобы не споткнулся на первой установке. - Выбрать бэкенд для LLM-экстракции. Вариант без денег: поставить Ollama (https://ollama.com), скачать модель командой
ollama pull llama3.2и в конфиге библиотеки указать"model": "ollama/llama3.2"с"model_tokens": 8192(иначе длинную страницу модель увидит обрезанной). Вариант точнее, но платный: ключ OpenAI или Gemini, тогда счёт растёт вместе с числом страниц. Локальная модель медленнее и чаще ошибается на сложных страницах, так что сначала замерьте скорость и качество на 10 компаниях, а не на тысяче. - Сформулировать задачу под нишу и гео, например: «найди владельцев сантехнических компаний в Ванкувере и Калгари, собери company, owner, email в CSV». Важно понимать, что в самой библиотеке есть только кирпичи:
SearchGraph(ищет в поиске и вытаскивает данные из первых n результатов),SmartScraperGraph(одна страница) иSmartScraperMultiGraph(список адресов). Готовой команды «пройди каталог на три тысячи компаний» там нет: агент должен сам написать цикл (страницы каталога → адреса компаний → извлечение полей) и сложить результат в файл. Проще просить CSV, запись в Google Sheets требует отдельного доступа, это ещё один шаг настройки. (Реконструировано по кадрам: сам промпт и список из шести каталогов-источников в ролике не показаны, агенту почти наверняка пришлось давать несколько уточнений, а не одну короткую команду.) - Проверить, что агент реально выстроил пайплайн (поиск → обход → извлечение), а не выдумал структуру ответа по паре примеров. Заодно проверьте, что каталоги вас пускают: крупные каталоги бизнеса часто режут ботов и запрещают автоматический сбор в условиях использования, а прокси и обход защиты в открытой библиотеке остаются на вас.
- Поставить повтор по расписанию:
cron(Linux/Mac) или Планировщик заданий (Windows), а можно попросить агента настроить это самому. Компьютер в 7:00 должен быть включён и не спать, иначе запуск пропустится; для надёжности такой скрипт переносят на VPS. Дедуп по домену компании лучше заложить сразу, иначе каждое утро в таблицу будут падать те же строки.
Ссылки и ресурсы
- ScrapeGraphAI/Scrapegraph-ai - сама библиотека: LLM строит граф скрапинга и вытаскивает поля со страниц, поддерживает Ollama, OpenAI, Groq, Azure, Gemini. MIT, около 31,3 тысяч звёзд, последний релиз 2.2.4 от 07.09.2026. Адрес с кадра 6 ролика распознался с опечаткой (
ScrapeGraphAl), правильный с заглавной «I» открыл, всё работает. Бесплатно. - scrapegraphai на PyPI - пакет для
pip install scrapegraphai, требует Python 3.12 или новее. Поставил в чистое окружение на Python 3.12,SearchGraphиSmartScraperMultiGraphимпортируются. Бесплатно. По умолчанию библиотека шлёт анонимную телеметрию, отключается переменнойSCRAPEGRAPHAI_TELEMETRY_ENABLED=false. - Ollama - запуск открытых моделей на своём компьютере, бэкенд для варианта «без платных токенов»; модель
llama3.2берётся командойollama pull llama3.2(страница модели). Ссылка нашлась по названию из ролика («локальные модели»), открыл. Локальный запуск бесплатно, облачные тарифы Ollama от $20 в месяц для этого приёма не нужны. - ScrapeGraphAI Cloud и цены - управляемое облако той же команды, платная альтернатива Ollama. Тариф Free даёт 500 кредитов один раз, Starter $20 в месяц за 10 000 кредитов, Growth $100 за 100 000; scrape стоит 1 кредит, extract 5, режим обхода защиты ещё +5. Из ролика прямо не следует, нашёл поиском, открыл. Платно.
- scrapegraph-mcp - MCP-сервер, чтобы подключить ScrapeGraphAI к Claude или Cursor. Это отдельный путь: сервер ходит в облако и требует API-ключ, работать локально с Ollama он не умеет. Для приёма из ролика не нужен, но в поиске по «ScrapeGraphAI Claude» вы наткнётесь именно на него. Открыл. Сервер бесплатный (MIT), но расход идёт по кредитам облака.
- Apify - платформа готовых скраперов, платная альтернатива из сравнения на кадре 5. Free даёт $5 на счёт в месяц, Starter $19; акторы берут по событию или по расходу, поэтому цену «$0.004 за компанию» из ролика нужно смотреть у конкретного актора, я её не проверял. Открыл тарифы. Платно, есть бесплатный лимит.
- Скрытые ссылки: автор просит написать «Claude» в комментариях и обещает прислать ссылку. Судя по кадру 6 и по тексту ролика («скопируй ссылку на репозиторий»), речь об адресе репозитория выше, так что слово в комментариях писать не нужно. Что именно приходит в директ, проверить не удалось. Других адресов в ролике нет.
Где это пригодится
Ложится, если вы сами наполняете таблицу лидов для узкой ниши, локальный сервис, франшиза, любой B2B, где компании сидят в открытых каталогах, а не за платным LinkedIn Sales Navigator. Если у вас уже есть coding-агент с доступом к терминалу, это буквально следующий шаг после «хватит копировать сайты в табличку руками». Для холодных рассылок с нуля эффект слабее: ScrapeGraphAI решает задачу «где взять контакты», а не задачу «захотят ли эти люди купить». Прежде чем тащить связку в рабочий процесс, прогоните её на одной нише, как в «Проверочном прогоне» выше: заявленная разница в цене с Apify достаточно большая, чтобы стоило проверить руками.