web-scraper

Solid

Вежливый скраппинг HTML-страниц в Markdown/JSON. Скрипт scrape.py читает страницу по URL, применяет простой CSS-селектор (tag, tag#id, tag.class) для выбора строк/секций, извлекает текст, ссылки и таблицы и отдаёт результат в Markdown или JSON. Легальные guardrails встроены в код: проверка robots.txt, честный User-Agent, задержка между запросами (по умолчанию 1.0 с), лимит размера страницы 10 МБ. Триггеры: 'web scraping', 'скраппинг', 'скачать данные с сайта', 'парсинг сайта', 'парсер html', 'извлечь данные', 'scrape', 'scraping'.

AI & Automation 6 stars 0 forks Updated 2 weeks ago MIT

Install

View on GitHub

Quality Score: 82/100

Stars 20%
28
Recency 20%
90
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

# Web Scraper > Вежливый скраппинг HTML-страниц в Markdown/JSON на чистом Python 3 stdlib. Загружай этот скилл когда нужно **извлечь д��нные с веб-страницы**: текст, ссылки и таблицы из выбранных секций — для анализа, отчётов или датасетов. ## 🎯 When to use Use this skill when: - Нужно скачать данные с сайта: текст, ссылки, таблицы из выбранных блоков - Просят «скраппинг», «парсинг сайта», «парсер html», «извлечь данные» - Нужен быстрый дамп страницы в Markdown или JSON без установки библиотек - Нужен вежливый сбор данных с учётом robots.txt и rate limit Do NOT use when: - Нужен полноценный CSS/XPath-парсер с вложенными селекторами — это `BeautifulSoup`/`lxml` - Нужен обход JS-рендеринга (SPA) — stdlib не исполняет JavaScript - Нужен массовый сбор тысяч страниц — согласуй с владельцем сайта и ToS - Нужны данные из API — используй прямой HTTP-запрос к API ## 📦 Files - `SKILL.md` — этот файл - `scripts/scrape.py` — скрапер (Python 3 stdlib: `urllib.request`, `html.parser`) ## 🧰 Usage ```bash # Markdown (по умолчанию), селектор по классу: python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "div.item" # JSON, селектор по id: python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "div#list" --output json # Все абзацы страницы: python3 skills/web-scraper/scripts/scrape.py --url https://example.com --selector "p" # Локальный файл (без сети, для теста): python3 skills/web-scraper/scripts/scrape.py --url file:///t...

Details

Author
bestdeejay-design
Repository
bestdeejay-design/agent-skills
Created
1 months ago
Last Updated
2 weeks ago
Language
Python
License
MIT

Similar Skills

Semantically similar based on skill content — not just same category