← ClaudeAtlas

scrapling-web-fetchlisted

使用 Scrapling 抓取、清洗、分析网页并生成结构化数据或中文报告。适用于 scrape / crawl / fetch / extract / summarize 网站内容、profile/activity feed、回答/文章/帖子列表、近 1 年动态、批量网页调研,以及用户明确提到 401/403、反爬、Cloudflare、登录受限、signin/login、need_force_login、需要 cookies/token、动态渲染、滚动加载、批量抓取、站点主题分析、网页证据收集等场景。特别适合知乎、专栏、公众号、博客、列表页+详情页链路。核心使用场景:批量采集多页/多站内容、突破访问受限(403/Cloudflare/反爬屏蔽)、抓取需要鉴权(login/cookie/token)的页面。
Linearl/reasonix_skill_repo · ★ 2 · Web & Frontend · score 65
Install: claude install-skill Linearl/reasonix_skill_repo
## Scrapling 网页抓取与分析技能 使用 Scrapling 框架完成**网页抓取 → 内容清洗 → 结构化提取 → 主题分析 → 报告撰写**的完整流程。当 VS Code 内置抓取能力遇到 403、Cloudflare、登录限制或动态页面时,优先切换到本技能。 **重要:** 本技能的目标不只是“抓到网页”,而是交付**可复用过程资产、结构化数据和最终报告**。除非用户明确只要原始网页内容,否则不要在“抓取完成”后停下。 **重要:** 执行完本技能后,请检查 [LESSONS.md](./LESSONS.md) 经验教训文档,看是否需要补充新的经验。 ## 何时使用本技能 ### 触发词覆盖(中英关键词) - 中文关键词:抓取网页、批量抓取、网页采集、反爬、403、风控、登录后可见、动态渲染、滚动加载、活动流、主页动态、近一年动态、回答汇总、文章汇总、站点调研、网页证据、专题分析、结构化提取、列表页详情页、内容聚类、用户画像。 - English keywords: scrape website, web crawl, fetch page, extract content, summarize posts, recent activity, profile timeline, activity feed, article list, answer list, protected site, anti-bot, blocked by 403, Cloudflare, login required, cookies, dynamic rendering, infinite scroll, evidence collection, topic clustering. - 站点/对象信号:知乎、专栏、公众号、博客、门户站、profile、people、column、org、feed、posts、answers、articles、thoughts、activity。 ### 可判定触发条件 满足以下任一组合时,应该唤醒本技能: 1. **站点 + 动作**:用户给出 URL / 站点名,并要求抓取、采集、提取、汇总、分析、总结、追踪动态。 2. **抓取 + 阻断**:用户提到 403、被拦截、需要登录、Cloudflare、反爬、验证码、只有骨架屏、内容空白。 3. **列表页 + 详情页**:用户要先抓取列表,再递归抓取回答/文章/帖子详情并汇总。 4. **时间范围 + 内容总结**:用户要最近 1 周、1 个月、1 年、季度动态、近期文章、历史行为变化。 5. **需要证据链**:用户不仅要结论,还要 URL、抓取结果、结构化样本、证据等级或不确定性说明。 6. **需要过程资产**:用户要求保存 HTML、Markdown、JSON、CSV、报告或中间数据。 ### When NOT to use 以下情况**不要**优先使用本技能: - 只是读取一个完全可公开访问的静态网页,且无需批量抓取、结构化提取或总结。 - 用户只要一段代码示例,不需要真实抓取执行。 - 任务与网页抓取无关,例如本地文件处理、数据库查询、纯代码重构。 - 任务核心是浏览器 UI 测试、截图、交互回放,而不是内容采集与分析。 - 用户只要求“看看这个网页大概写了什么”,内置抓取已可满足且没有 403 / 登录限制。 ### 快速判定口诀 - **有 URL + 要内容/总结** → 倾向使用。 - **有 403 / 登录 /