№57

8 октября 2026

агенты · данные · инструменты · бизнес

Агент сам ставит скрапер и собирает лиды с почтами

Если коротко

Что даёт
одна фраза агенту вроде find plumbing business owners, и на выходе таблица компаний, владельцев и email, собранная из нескольких каталогов бизнеса.
Зачем
снимает самую тупую часть лидогена, ручной обход директорий и копипаст в табличку, и её же можно поставить на ежедневный автозапуск.
Как сделать
дать Claude Code (или любому coding-агенту с доступом к терминалу) ссылку на open-source библиотеку ScrapeGraphAI, попросить установить, дальше формулировать задачи на нужную нишу и гео.
Профит
библиотека бесплатная (MIT), а с локальной моделью через Ollama и токены ничего не стоят. Автор сравнивает с Apify по $0.004 за компанию: на 1705 компаний у него выходит $6.82 против «$0.00». Экономия есть на объёме в тысячи строк, но $0 это только деньги за токены: своё время на настройку, электричество и прокси вы всё равно платите. Если гнать экстракцию через облако ScrapeGraphAI, выйдет около $0.01 за страницу ($20 за 10 000 кредитов, один extract стоит 5 кредитов), то есть дороже, чем цифра Apify из ролика.
Где подвох
ролик - приманка для комментариев (ссылку раздают за слово «Claude», хотя это открытый репозиторий), а кадры с таблицей и логом склеены из разных прогонов и выглядят как заготовленная графика. Реальные ограничения: нужен Python 3.12 или новее, готового «обхода каталога на 3412 компаний» в библиотеке нет (обвязку под ваши источники пишет агент), прокси и защиту от ботов библиотека оставляет вам, а у локальных моделей выше шанс ошибиться в извлечении. Плюс массовый сбор почт упирается в закон (см. «Оговорки»).

Что показано

Автор показывает карточку GitHub-репозитория ScrapeGraphAI, терминал с командой claude "find plumbing business owners" и лог из трёх шагов: поиск по шести каталогам, обход 3412 компаний, извлечение полей company/owner/email. Дальше идёт готовая таблица с именами, компаниями и почтами (roofing и HVAC по Канаде и США), сравнение цены с платным Apify и кадр с расписанием: запуск каждый будний день в 7 утра.

Почему это работает

ScrapeGraphAI не сервис, а Python-библиотека: она строит граф скрапинга, где LLM сама решает, куда идти дальше по сайту и как вытащить нужные поля из неструктурированной страницы, вместо того чтобы писать селекторы руками под каждый источник. Кстати, Claude Code в этой связке не какая-то секретная фича Anthropic, а обычный coding-агент: он умеет клонировать репозиторий, поставить зависимости и написать обвязку под конкретный запрос. Ровно то же самое, в общем, можно сделать с любым другим агентом, у которого есть доступ к shell.

Здесь работает не «Клод», а связка любого coding-агента с чужой open-source библиотекой, Claude просто умеет её поставить и запустить.

Как повторить

  1. Открыть https://github.com/ScrapeGraphAI/Scrapegraph-ai, посмотреть README. На кадре ролика адрес прочитался с опечаткой (ScrapeGraphAl, последняя буква «l» вместо «I»), по такому адресу GitHub отдаёт 404, а с заглавной «I» всё открывается.
  2. Проверить, что у вас Python 3.12 или новее (python3 --version): на более старом пакет не поставится. Дальше в Claude Code (или Cursor/Codex с доступом к терминалу) дать ссылку на репозиторий и попросить: поставь ScrapeGraphAI в отдельное виртуальное окружение по README. Под капотом это pip install scrapegraphai и затем playwright install (скачивает браузер для страниц с JavaScript). Про Playwright лучше сказать агенту сразу, чтобы не споткнулся на первой установке.
  3. Выбрать бэкенд для LLM-экстракции. Вариант без денег: поставить Ollama (https://ollama.com), скачать модель командой ollama pull llama3.2 и в конфиге библиотеки указать "model": "ollama/llama3.2" с "model_tokens": 8192 (иначе длинную страницу модель увидит обрезанной). Вариант точнее, но платный: ключ OpenAI или Gemini, тогда счёт растёт вместе с числом страниц. Локальная модель медленнее и чаще ошибается на сложных страницах, так что сначала замерьте скорость и качество на 10 компаниях, а не на тысяче.
  4. Сформулировать задачу под нишу и гео, например: «найди владельцев сантехнических компаний в Ванкувере и Калгари, собери company, owner, email в CSV». Важно понимать, что в самой библиотеке есть только кирпичи: SearchGraph (ищет в поиске и вытаскивает данные из первых n результатов), SmartScraperGraph (одна страница) и SmartScraperMultiGraph (список адресов). Готовой команды «пройди каталог на три тысячи компаний» там нет: агент должен сам написать цикл (страницы каталога → адреса компаний → извлечение полей) и сложить результат в файл. Проще просить CSV, запись в Google Sheets требует отдельного доступа, это ещё один шаг настройки. (Реконструировано по кадрам: сам промпт и список из шести каталогов-источников в ролике не показаны, агенту почти наверняка пришлось давать несколько уточнений, а не одну короткую команду.)
  5. Проверить, что агент реально выстроил пайплайн (поиск → обход → извлечение), а не выдумал структуру ответа по паре примеров. Заодно проверьте, что каталоги вас пускают: крупные каталоги бизнеса часто режут ботов и запрещают автоматический сбор в условиях использования, а прокси и обход защиты в открытой библиотеке остаются на вас.
  6. Поставить повтор по расписанию: cron (Linux/Mac) или Планировщик заданий (Windows), а можно попросить агента настроить это самому. Компьютер в 7:00 должен быть включён и не спать, иначе запуск пропустится; для надёжности такой скрипт переносят на VPS. Дедуп по домену компании лучше заложить сразу, иначе каждое утро в таблицу будут падать те же строки.

Ссылки и ресурсы

  • ScrapeGraphAI/Scrapegraph-ai - сама библиотека: LLM строит граф скрапинга и вытаскивает поля со страниц, поддерживает Ollama, OpenAI, Groq, Azure, Gemini. MIT, около 31,3 тысяч звёзд, последний релиз 2.2.4 от 07.09.2026. Адрес с кадра 6 ролика распознался с опечаткой (ScrapeGraphAl), правильный с заглавной «I» открыл, всё работает. Бесплатно.
  • scrapegraphai на PyPI - пакет для pip install scrapegraphai, требует Python 3.12 или новее. Поставил в чистое окружение на Python 3.12, SearchGraph и SmartScraperMultiGraph импортируются. Бесплатно. По умолчанию библиотека шлёт анонимную телеметрию, отключается переменной SCRAPEGRAPHAI_TELEMETRY_ENABLED=false.
  • Ollama - запуск открытых моделей на своём компьютере, бэкенд для варианта «без платных токенов»; модель llama3.2 берётся командой ollama pull llama3.2 (страница модели). Ссылка нашлась по названию из ролика («локальные модели»), открыл. Локальный запуск бесплатно, облачные тарифы Ollama от $20 в месяц для этого приёма не нужны.
  • ScrapeGraphAI Cloud и цены - управляемое облако той же команды, платная альтернатива Ollama. Тариф Free даёт 500 кредитов один раз, Starter $20 в месяц за 10 000 кредитов, Growth $100 за 100 000; scrape стоит 1 кредит, extract 5, режим обхода защиты ещё +5. Из ролика прямо не следует, нашёл поиском, открыл. Платно.
  • scrapegraph-mcp - MCP-сервер, чтобы подключить ScrapeGraphAI к Claude или Cursor. Это отдельный путь: сервер ходит в облако и требует API-ключ, работать локально с Ollama он не умеет. Для приёма из ролика не нужен, но в поиске по «ScrapeGraphAI Claude» вы наткнётесь именно на него. Открыл. Сервер бесплатный (MIT), но расход идёт по кредитам облака.
  • Apify - платформа готовых скраперов, платная альтернатива из сравнения на кадре 5. Free даёт $5 на счёт в месяц, Starter $19; акторы берут по событию или по расходу, поэтому цену «$0.004 за компанию» из ролика нужно смотреть у конкретного актора, я её не проверял. Открыл тарифы. Платно, есть бесплатный лимит.
  • Скрытые ссылки: автор просит написать «Claude» в комментариях и обещает прислать ссылку. Судя по кадру 6 и по тексту ролика («скопируй ссылку на репозиторий»), речь об адресе репозитория выше, так что слово в комментариях писать не нужно. Что именно приходит в директ, проверить не удалось. Других адресов в ролике нет.

Где это пригодится

Ложится, если вы сами наполняете таблицу лидов для узкой ниши, локальный сервис, франшиза, любой B2B, где компании сидят в открытых каталогах, а не за платным LinkedIn Sales Navigator. Если у вас уже есть coding-агент с доступом к терминалу, это буквально следующий шаг после «хватит копировать сайты в табличку руками». Для холодных рассылок с нуля эффект слабее: ScrapeGraphAI решает задачу «где взять контакты», а не задачу «захотят ли эти люди купить». Прежде чем тащить связку в рабочий процесс, прогоните её на одной нише, как в «Проверочном прогоне» выше: заявленная разница в цене с Apify достаточно большая, чтобы стоило проверить руками.

Больше подобного

Разбираю по находке в день и складываю сюда. Свежее и то, что до сайта не доехало, выходит в канале «Евдокимов как обычно».