← ClaudeAtlas

web-table-paylisted

把一个网址上的数据整理成一张能直接用的 Excel——一次付费 7 天不限次,期内重复使用不再计费。凡遇到"这个页面的数据要导成表""榜单/列表/报表只能一条条复制""网页上的数字要拿去做统计""数据在页面上但导不出来""这份名单每天都要重新取一遍"时主动使用。**本 Skill 依赖在线授权服务**:执行提取前会先取一份授权凭证(未付费会返回 402 账单),拿到授权后在**你本机**完成取数与成表,授权本身**离线可校验**;诊断(probe)**免费**——先看清楚数据在哪、能不能取,再决定要不要提取。能力:页面自带表格的直接读;数据由脚本渲染的页面 → 先定位它真正读取的数据地址再取;只有重复区块的页面 → 按块成表。产出规范 xlsx + 一份带前后对比计数的**提取报告**(适合直接转发)。上游声明总数与实收不一致时**拒绝写出**(不交半份数据)。只读公开可读页面:不带登录凭据、不做身份伪装,站点拒绝或要求验证码即停止并说明。
Mao-jh/web-table · ★ 0 · Data & Documents · score 76
Install: claude install-skill Mao-jh/web-table
# 网页数据变表格(一次付费 7 天不限次) 把一个网址上的数据,变成一张能直接拿去用的 Excel。本 Skill 分两段: **先免费诊断**(只读,不取数据),**再取授权执行提取**(按次计费,在你本机完成)。 > **为什么需要授权**:提取动作需要一份由服务方签发的凭证。 > 授权**在你本机离线校验**(不联网即可验证真伪与有效期), > 但**没有有效授权就不执行提取**——这是服务的一部分,不是限制。 **这个工具解决的是"看得见、导不出"**:页面上的榜单、列表、报表、名单明明在那儿,却没有"导出"按钮; 或者数据是页面脚本加载出来的,把页面源码存下来只有空壳。工具会先判断数据到底在哪儿, 再把它取回来展开成行列。 --- ## 第 0 步 · 前置检查(必做,先判值不值得用这个工具) 在调用任何服务之前先确认: | 检查项 | 判定 | |---|---| | **不登录**能看到这些数据吗 | 看不到 → **先劝退**:本工具不带登录凭据、也不做身份伪装,需要登录的内容它拿不到。请先用你已登录的方式在页面上导出 | | 页面上的内容是不是「行列」结构 | 文章 / 表单 / 单条详情 → **先劝退**:这不是表格数据,本工具帮不上 | | 数据量是不是一屏就看完 | 十来条、手工复制更快 → **先劝退**:直接在页面上选中复制更省事,不必花钱 | | 数据是不是**每天/每周要重新取一遍** | 是 → 值得用;取一次就完事的,也请先掂量一下值不值 | | 站点是否明确拒绝(403 / 要求验证码) | 是 → **本工具立即停止并说明原因**,不做任何变通 | **只有第 0 步谈过,才进入第 1 步。** --- ## 第 1 步 · 免费诊断(probe,只读,不收费) ```bash python scripts/webtable.py probe <网址> --plan 方案.json --report 诊断.md ``` 诊断只回答三个问题:**数据在哪、能不能取、大概多少条**。三种结论: | 结论 | 含义 | 接下来 | |---|---|---| | **可以取** | 页面自带表格 / 找到了它真正读取的数据地址 / 页面有重复区块 | 把结论给用户看,确认后再进第 2 步 | | **本工具做不了** | 需要登录、要验证码、页面是空壳且找不到数据地址、或那张表根本不像数据表(例如页面角落的日历) | **把原因原样告诉用户,不要硬试**(硬导会把排版表当数据交出去,比报错更糟) | | **读不到这个地址** | 网络不通 / 404 | 检查网址 | 诊断**不会取走任何数据、不会产出任何表格**;结论是**此刻**的页面状态,源站改版后可能失效。 --- ## 第 2 步 · 请求授权(未付费会返回 402) ``` POST https://skills-gate.airpriv.com/api/web-table-license Content-Type: application/json {"machine_fp":"<本机指纹串,8–128 位字母数字/连字符,可省略>"} ``` **首次调用一定拿到 `402 Payment Required`** —— 这是设计,不是错误。响应里带: - HTTP 头 `Payment-Needed`(base64url 编码的账单) - 响应体 `payment_needed` / `payment