scrapling-web-fetchlisted
Install: claude install-skill Linearl/reasonix_skill_repo
## Scrapling 网页抓取与分析技能
使用 Scrapling 框架完成**网页抓取 → 内容清洗 → 结构化提取 → 主题分析 → 报告撰写**的完整流程。当 VS Code 内置抓取能力遇到 403、Cloudflare、登录限制或动态页面时,优先切换到本技能。
**重要:** 本技能的目标不只是“抓到网页”,而是交付**可复用过程资产、结构化数据和最终报告**。除非用户明确只要原始网页内容,否则不要在“抓取完成”后停下。
**重要:** 执行完本技能后,请检查 [LESSONS.md](./LESSONS.md) 经验教训文档,看是否需要补充新的经验。
## 何时使用本技能
### 触发词覆盖(中英关键词)
- 中文关键词:抓取网页、批量抓取、网页采集、反爬、403、风控、登录后可见、动态渲染、滚动加载、活动流、主页动态、近一年动态、回答汇总、文章汇总、站点调研、网页证据、专题分析、结构化提取、列表页详情页、内容聚类、用户画像。
- English keywords: scrape website, web crawl, fetch page, extract content, summarize posts, recent activity, profile timeline, activity feed, article list, answer list, protected site, anti-bot, blocked by 403, Cloudflare, login required, cookies, dynamic rendering, infinite scroll, evidence collection, topic clustering.
- 站点/对象信号:知乎、专栏、公众号、博客、门户站、profile、people、column、org、feed、posts、answers、articles、thoughts、activity。
### 可判定触发条件
满足以下任一组合时,应该唤醒本技能:
1. **站点 + 动作**:用户给出 URL / 站点名,并要求抓取、采集、提取、汇总、分析、总结、追踪动态。
2. **抓取 + 阻断**:用户提到 403、被拦截、需要登录、Cloudflare、反爬、验证码、只有骨架屏、内容空白。
3. **列表页 + 详情页**:用户要先抓取列表,再递归抓取回答/文章/帖子详情并汇总。
4. **时间范围 + 内容总结**:用户要最近 1 周、1 个月、1 年、季度动态、近期文章、历史行为变化。
5. **需要证据链**:用户不仅要结论,还要 URL、抓取结果、结构化样本、证据等级或不确定性说明。
6. **需要过程资产**:用户要求保存 HTML、Markdown、JSON、CSV、报告或中间数据。
### When NOT to use
以下情况**不要**优先使用本技能:
- 只是读取一个完全可公开访问的静态网页,且无需批量抓取、结构化提取或总结。
- 用户只要一段代码示例,不需要真实抓取执行。
- 任务与网页抓取无关,例如本地文件处理、数据库查询、纯代码重构。
- 任务核心是浏览器 UI 测试、截图、交互回放,而不是内容采集与分析。
- 用户只要求“看看这个网页大概写了什么”,内置抓取已可满足且没有 403 / 登录限制。
### 快速判定口诀
- **有 URL + 要内容/总结** → 倾向使用。
- **有 403 / 登录 /