Перейти к основному содержимому

Scrapling

Веб-скрапинг с Scrapling — HTTP-запросы, скрытая автоматизация браузера, обход Cloudflare и паутинный краулинг через CLI и Python.

Метаданные навыка​

ИсточникОпционально — установка через vibeos skills install official/research/scrapling
Путьoptional-skills/research/scrapling
Версия1.0.0
АвторFEUAZUR
ЛицензияMIT
Платформыlinux, macos, windows
ТегиWeb Scraping, Browser, Cloudflare, Stealth, Crawling, Spider
Связанные навыкиduckduckgo-search, domain-intel

Справочник: полный SKILL.md​

к сведению

Ниже приведено полное описание навыка, которое VibeOS загружает при его активации. Агент видит эти инструкции, когда навык активен.

Scrapling

Scrapling — это фреймворк для веб-скрапинга с обходом антибот-защиты, скрытой автоматизацией браузера и паутинным краулингом. Он предоставляет три стратегии получения данных (HTTP, динамический JS, скрытый режим/Cloudflare) и полноценный CLI.

Этот навык предназначен только для образовательных и исследовательских целей. Пользователи обязаны соблюдать местные и международные законы о сборе данных и уважать условия использования веб-сайтов.

Когда использовать​

  • Скрапинг статических HTML-страниц (быстрее, чем браузерные инструменты)
  • Скрапинг страниц с JS-рендерингом, требующих реального браузера
  • Обход Cloudflare Turnstile или бот-детекции
  • Краулинг нескольких страниц с помощью паука
  • Когда встроенный инструмент web_extract не возвращает нужные данные

Установка​

pip install "scrapling[all]"
scrapling install

Минимальная установка (только HTTP, без браузера):

pip install scrapling

Только с автоматизацией браузера:

pip install "scrapling[fetchers]"
scrapling install

Краткая справка​

ПодходКлассИспользовать когда
HTTPFetcher / FetcherSessionСтатические страницы, API, быстрые массовые запросы
ДинамическийDynamicFetcher / DynamicSessionКонтент с JS-рендерингом, SPA
СкрытыйStealthyFetcher / StealthySessionCloudflare, сайты с антибот-защитой
ПаукSpiderМногостраничный краулинг с переходом по ссылкам

Использование CLI​

Извлечение статической страницы​

scrapling extract get 'https://example.com' output.md

С CSS-селектором и имитацией браузера:

scrapling extract get 'https://example.com' output.md \
--css-selector '.content' \
--impersonate 'chrome'

Извлечение страницы с JS-рендерингом​

scrapling extract fetch 'https://example.com' output.md \
--css-selector '.dynamic-content' \
--disable-resources \
--network-idle

Извлечение страницы, защищённой Cloudflare​

scrapling extract stealthy-fetch 'https://protected-site.com' output.html \
--solve-cloudflare \
--block-webrtc \
--hide-canvas

POST-запрос​

scrapling extract post 'https://example.com/api' output.json \
--json '{"query": "search term"}'

Форматы вывода​

Формат вывода определяется расширением файла:

  • .html — сырой HTML
  • .md — преобразование в Markdown
  • .txt — обычный текст
  • .json / .jsonl — JSON

Python: HTTP-скрапинг​

Одиночный запрос​

from scrapling.fetchers import Fetcher

page = Fetcher.get('https://quotes.toscrape.com/')
quotes = page.css('.quote .text::text').getall()
for q in quotes:
print(q)

Сессия (постоянные куки)​

from scrapling.fetchers import FetcherSession

with FetcherSession(impersonate='chrome') as session:
page = session.get('https://example.com/', stealthy_headers=True)
links = page.css('a::attr(href)').getall()
for link in links[:5]:
sub = session.get(link)
print(sub.css('h1::text').get())

POST / PUT / DELETE​

page = Fetcher.post('https://api.example.com/data', json={"key": "value"})
page = Fetcher.put('https://api.example.com/item/1', data={"name": "updated"})
page = Fetcher.delete('https://api.example.com/item/1')

С прокси​

page = Fetcher.get('https://example.com', proxy='http://user:pass@proxy:8080')

Python: Динамические страницы (JS-рендеринг)​

Для страниц, требующих выполнения JavaScript (SPA, контент с ленивой загрузкой):

from scrapling.fetchers import DynamicFetcher

page = DynamicFetcher.fetch('https://example.com', headless=True)
data = page.css('.js-loaded-content::text').getall()

Ожидание конкретного элемента​

page = DynamicFetcher.fetch(
'https://example.com',
wait_selector=('.results', 'visible'),
network_idle=True,
)

Отключение ресурсов для ускорения​

Блокирует шрифты, изображения, медиа, таблицы стилей (~на 25% быстрее):

from scrapling.fetchers import DynamicSession

with DynamicSession(headless=True, disable_resources=True, network_idle=True) as session:
page = session.fetch('https://example.com')
items = page.css('.item::text').getall()

Пользовательская автоматизация страницы​

from playwright.sync_api import Page
from scrapling.fetchers import DynamicFetcher

def scroll_and_click(page: Page):
page.mouse.wheel(0, 3000)
page.wait_for_timeout(1000)
page.click('button.load-more')
page.wait_for_selector('.extra-results')

page = DynamicFetcher.fetch('https://example.com', page_action=scroll_and_click)
results = page.css('.extra-results .item::text').getall()

Python: Скрытый режим (обход антибот-защиты)​

Для сайтов, защищённых Cloudflare или с активной фингерпринтинг-защитой:

from scrapling.fetchers import StealthyFetcher

page = StealthyFetcher.fetch(
'https://protected-site.com',
headless=True,
solve_cloudflare=True,
block_webrtc=True,
hide_canvas=True,
)
content = page.css('.protected-content::text').getall()

Скрытая сессия​

from scrapling.fetchers import StealthySession

with StealthySession(headless=True, solve_cloudflare=True) as session:
page1 = session.fetch('https://protected-site.com/page1')
page2 = session.fetch('https://protected-site.com/page2')

Выбор элементов​

Все загрузчики возвращают объект Selector со следующими методами:

CSS-селекторы​

page.css('h1::text').get()              # Текст первого h1
page.css('a::attr(href)').getall() # Все href ссылок
page.css('.quote .text::text').getall() # Вложенный выбор

XPath​

page.xpath('//div[@class="content"]/text()').getall()
page.xpath('//a/@href').getall()

Методы поиска​

page.find_all('div', class_='quote')       # По тегу + атрибуту
page.find_by_text('Read more', tag='a') # По текстовому содержимому
page.find_by_regex(r'\$\d+\.\d{2}') # По регулярному выражению

Похожие элементы​

Поиск элементов со схожей структурой (полезно для списков товаров и т.д.):

first_product = page.css('.product')[0]
all_similar = first_product.find_similar()

Навигация​

el = page.css('.target')[0]
el.parent # Родительский элемент
el.children # Дочерние элементы
el.next_sibling # Следующий соседний элемент
el.prev_sibling # Предыдущий соседний элемент

Python: Паутинный краулинг​

Для многостраничного краулинга с переходом по ссылкам:

from scrapling.spiders import Spider, Request, Response

class QuotesSpider(Spider):
name = "quotes"
start_urls = ["https://quotes.toscrape.com/"]
concurrent_requests = 10
download_delay = 1

async def parse(self, response: Response):
for quote in response.css('.quote'):
yield {
"text": quote.css('.text::text').get(),
"author": quote.css('.author::text').get(),
"tags": quote.css('.tag::text').getall(),
}

next_page = response.css('.next a::attr(href)').get()
if next_page:
yield response.follow(next_page)

result = QuotesSpider().start()
print(f"Scraped {len(result.items)} quotes")
result.items.to_json("quotes.json")

Многосессионный паук​

Маршрутизация запросов к разным типам загрузчиков:

from scrapling.fetchers import FetcherSession, AsyncStealthySession

class SmartSpider(Spider):
name = "smart"
start_urls = ["https://example.com/"]

def configure_sessions(self, manager):
manager.add("fast", FetcherSession(impersonate="chrome"))
manager.add("stealth", AsyncStealthySession(headless=True), lazy=True)

async def parse(self, response: Response):
for link in response.css('a::attr(href)').getall():
if "protected" in link:
yield Request(link, sid="stealth")
else:
yield Request(link, sid="fast", callback=self.parse)

Пауза/возобновление краулинга​

spider = QuotesSpider(crawldir="./crawl_checkpoint")
spider.start() # Ctrl+C для паузы, повторный запуск для возобновления с контрольной точки

Подводные камни​

  • Требуется установка браузера: выполните scrapling install после pip install — без этого DynamicFetcher и StealthyFetcher не будут работать
  • Тайм-ауты: тайм-аут DynamicFetcher/StealthyFetcher указывается в миллисекундах (по умолчанию 30000), тайм-аут Fetcher — в секундах
  • Обход Cloudflare: solve_cloudflare=True добавляет 5–15 секунд к времени загрузки — включайте только при необходимости
  • Использование ресурсов: StealthyFetcher запускает реальный браузер — ограничивайте одновременное использование
  • Юридические аспекты: всегда проверяйте robots.txt и условия использования сайта перед скрапингом. Эта библиотека предназначена для образовательных и исследовательских целей
  • Версия Python: требуется Python 3.10+