media-crawler-easy

Solid

多平台社媒评论数据采集爬虫工具。覆盖 B站(bilibili)/小红书/抖音(douyin)/快手/微博/贴吧/知乎 7大平台。 当用户提到"爬评论""采集评论""下载评论""爬数据""批量采集""舆情分析""评论分析""社媒数据" "抓取评论""导出评论""获取评论""视频评论""帖子评论""笔记评论""UP主评论""博主评论" "关键词搜索爬取""社交媒体数据采集""爬虫""数据爬取""评论数据""用户评论"时自动触发。 支持按关键词搜索、指定链接采集、创作者主页三种模式。生成交互式 HTML 报告 + 数据文件。

Web & Frontend 11 stars 0 forks Updated yesterday MIT

Install

View on GitHub

Quality Score: 85/100

Stars 20%
36
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

# MediaCrawler 多平台采集助手 基于 [MediaCrawler](https://github.com/NanmiCoder/MediaCrawler) (上游 65K+ star),7 大平台社媒数据采集。 > 目录约定:下文 `<skill>` 指本 SKILL.md 所在的目录。 > 插件方式安装时它等于 `${CLAUDE_PLUGIN_ROOT}`;手动 clone 安装时它等于 `~/.claude/skills/media-crawler-easy`。 > 脚本内部路径是相对自身解析的,不依赖具体安装位置。 ## ⚠️ 关键约束 1. **严格 3 轮问答**,每轮只问一个问题,不提前列出所有选项。 2. **参考材料仅排查时查阅**,不主动展示给用户。 3. **每次不超过 4 个选项**。 4. **环境检测只报结论**:"X 项通过,Y 项修复,可以继续"。 ## 执行流程 ``` ① 配置问答(3轮)→ ② 环境搭建 → ③ 写入配置 → ④ 执行爬取 → ⑤ 生成报告+验证 → ⑥ 汇报+清理 ``` --- ## ① 配置问答(严格 3 轮,不可合并) ### 第 1 轮:只问平台 ``` 要爬哪个平台? B站(bili) / 小红书(xhs) / 抖音(dy) / 快手(ks) / 微博(wb) / 贴吧(tieba) / 知乎(zhihu) ``` 用户回答后再问模式: ``` 用什么方式爬? A. 关键词搜索 B. 指定链接 C. 创作者主页 ``` ### 第 2 轮:只问具体参数 根据第 1 轮回答: - **选 A**:问「关键词是什么?每个关键词爬多少条?(默认20)」 - **选 B**:问「把链接发给我」 - **选 C**:问「把创作者主页链接或 UID 发给我」 ### 第 3 轮:只问评论设置 ``` 每条内容爬多少评论?(默认30) 要楼中楼吗?(默认不要) 要词云图吗?(默认不要) 爬取间隔设几秒?(默认2秒) ``` 用户回复"默认"即全部用默认值。 --- ## ② 环境搭建 ```bash cd <skill> && python scripts/env_setup.py ``` 报结论即可。有 FAIL 先修再继续;不确定错误查 `references/env-troubleshooting.md`。 --- ## ③ 写入配置 Edit 修改 `config/base_config.py`:`PLATFORM`, `KEYWORDS`, `CRAWLER_TYPE`, `CRAWLER_MAX_NOTES_COUNT`, `CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES`, `ENABLE_GET_SUB_COMMENTS`, `ENABLE_GET_WORDCLOUD`, `CRAWLER_MAX_SLEEP_SEC`。 平台专属 config 只改当前平台对应的文件(如抖音改 `dy_config.py`)。 **重要**:`AUTO_CLOSE_BROWSER` 默认为 `False`(保持浏览器打开)。**永远不要把它改成 True**——否则爬虫结束/出错时 Chrome 会立刻关闭,用户看不到状态。 --- ## ④ 执行爬取 用 `run_in_background: true` 启动,每 20-30 秒检查日志。 ```bash cd <skill>/Medi...

Details

Author
isheng-eqi
Repository
isheng-eqi/media-crawler-easy
Created
3 months ago
Last Updated
yesterday
Language
Python
License
MIT

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Solid

laohan-xiazai

从互联网拿内容一站式——视频下载、音频提取+转文字、字幕下载、评论采集、博主数据、网页抓取、搜索聚合、跨平台发布与数据分析,覆盖 30+ 平台(抖音/TikTok/YouTube/B站/小红书/知乎/公众号/视频号/微博/Reddit/HackerNews/即刻/知识星球/雪球/贴吧/头条/Twitter等),按降级链自动选择最优工具。Use when 用户说"下载""下个视频""帮我抓""抓一下""爬""爬取""读一下""读这个链接""看看这个网址""搜一下""搜索""查一下""帮我查""转文字""转录""听写字幕""评论""看看评论""抓评论""博主数据""博主更新""up主""谁谁最近发了什么""封面""发抖音""发小红书""定时发布""草稿""账号数据""粉丝数""给我截图""网页正文""这个页面讲了啥",或给出任意 URL / 短链接 / BV号 / 视频号链接 / 公众号文章链接 要求获取内容,或提到抖音/TikTok/YouTube/B站/小红书/知乎/公众号/视频号/微博 等具体平台名要求下内容、搜内容、读评论、抓数据,以及任何涉及从互联网拿内容的操作。优先按降级链选工具:搜索走 anysearch→opencli→agent-reach;下载按平台路由;抓取走 Scrapling→browser-use→web-access。

11 Updated 5 days ago
hanzhcn
AI & Automation Featured

media-crawler

Install, authenticate, configure, operate, and troubleshoot the external MediaCrawler client shared by Xiaohongshu, Douyin, Kuaishou, Bilibili, Weibo, Tieba, and Zhihu collectors. Use when auditing this client, onboarding a platform account, selecting search/detail/creator modes, enabling comments or media, locating outputs, or diagnosing crawler failures. Do not use it as the platform research methodology; hand that work to the matching media-crawler-* collector skill.

1,993 Updated 1 months ago
tsingyuai
AI & Automation Featured

onboard-growth-lab

通过自然语言完成 Growth Lab 的统一依赖审计与配置。检查所有能力所需的 API key、可直接安装的第三方 CLI/Client、浏览器与登录态;拒绝隐含的外部 Skill 或脚本依赖,告诉用户哪些已配置、哪些缺失、从哪里获取,并允许本轮绕过。需要首次配置、检查环境、修复依赖或询问“还缺什么”时使用。

1,993 Updated 1 months ago
tsingyuai