← ClaudeAtlas

blog-checklisted

技术博客与公开技术输出的原创性核验:整段正文逐字检索比对来源、全量标题批量筛查、分层抽样给出可复现的命中率,判断内容是原创实践还是未标注的搬运,并与简历经历做时间与内容交叉印证。凡是要评估某人技术写作的真实性或含金量就使用本技能——包括用户说"他博客写得怎么样""这些文章是不是抄的""原创 200 篇是真的吗""公众号/掘金/CSDN 这些内容可信吗"时。
shaokeyibb/anti-asu-skills · ★ 26 · Web & Frontend · score 80
Install: claude install-skill shaokeyibb/anti-asu-skills
# /blog-check:技术输出原创性核验 候选人在简历里放博客链接,是在主动提供一份"技术深度的样本"。核验它的价值在于:**博客比简历更难包装**——简历可以逐字打磨,而一篇技术文章要在几千字里持续伪装出不存在的理解,成本高得多。 反过来说,博客也是交叉印证简历的好材料:文章里提到的踩坑、时间、技术栈,可以和简历上的经历互相验证。 ## 边界 - 只读候选人主动提供的链接。**不搜索候选人在其他平台的账号**,不追踪其网络身份。 - 只核验**技术内容**。博客里的生活记录、观点表达、个人心情、政治或宗教内容——一律跳过,不读、不记、不写入报告。看到时主动忽略。 - 抄袭判定门槛要高。技术写作中大量内容天然相似(同一个 API 的用法、同一份官方文档的翻译、同一个经典算法的讲解),**相似不等于抄袭**。 - 博客更新少、写得浅、停更多年——**都不是负面信号**。写博客是额外付出,不写是常态。这一维度只在候选人主动展示时才核验。 ## 核验流程 ### 第零步:先核验形容词,不是数量 **这是最容易跳过、也最致命的一步。** 当 claim 形如「**原创** 200+ 博客」「**独立完成** N 个项目」「**主导** X 次重构」时——**修饰语才是承载分量的部分,数量只是陪衬**。 > 核验"384 > 200"**不等于**核验了这条 claim。 > 如果 384 篇里大量是转述而被标为原创,那么「原创 200+」这条 claim 就是**不成立的**,哪怕数字远超。 **纪律**:拆开每条复合 claim,**先判修饰语,再看数量**。修饰语不成立时,数量成立不能挽救该 claim。 ### 第一步:抽样(样本量必须随语料规模缩放) **绝不能对任何规模的博客都只抽 3—5 篇。** #### 样本量下限 | 文章总数 | 首轮最小样本 | | --- | --- | | < 30 | 5 | | 30–100 | 10 | | 100–300 | 15 | | > 300 | **20,且必须覆盖每个内容板块** | #### 分层抽样(关键:必须抽到"大宗") 抽样最容易犯的错,是只抽**亮点**而漏掉**主体**。以下四层**缺一不可**: | 层 | 抽法 | 为什么必须抽 | | --- | --- | --- | | **A. 大宗连载**(占比最高的系列) | 从最大的 1—2 个系列中**随机**抽 5—8 篇 | **这是判断整体性质的唯一依据。**大宗决定博客的真实构成 | | **B. 高流量篇** | 阅读量最高的 3—5 篇 | 高流量常来自热门八股题,也是搬运高发区 | | **C. 项目复盘篇** | 与其自有项目对应的 2—3 篇 | 最可能原创,用于确认"确有原创部分" | | **D. 随机对照** | 全量列表中**纯随机**抽 3—5 篇 | 对冲前三层的选择偏差 | > ⚠️ **原先的抽样标准(最相关 / 最长最硬 / 最新)系统性偏向 C 层**——也就是最可能原创的那批。只按那三条抽,等于把视线从大宗上移开。**C 层现在只占四层之一。** #### 升级规则(强制) > **首轮样本中若有 ≥2 篇命中搬运特征,必须扩大样本至 2 倍并重抽,不得直接下结论。** > > 扩样后若命中率仍 ≥30%,结论应指向**系统性**而非"偶发",并在报告中给出**命中率**("扩样 N 篇,M 篇命中,命中率 X%"),而不是笼统的定性词。