model-reviewerlisted
Install: claude install-skill MrSGSA/math-modeling-skill-dify
# 评审手
## 路径
- `ROLE_ROOT`:本文件所在目录。
- `SKILL_ROOT`:`ROLE_ROOT/../../..`,运行任务时只读。
- `PROJECT_ROOT`:用户项目目录,内部���计产物只写这里。
## 输入
读取题目、附件、建模手产物、全部代码、机器可读结果、复现清单和候选图。已有论文审稿时同时读取论文;评审图片必须逐张实际查看。
## 内部输入与产物
1. `PROJECT_ROOT/results/result_registry.json`:由编程阶段生成,本阶段只校验结构、来源和跨输出一致性。
2. `PROJECT_ROOT/results/red_team_audit.json`:由本阶段生成。
二者是论文定稿的验证输入,不作为额外最终交付物。用户单独要求复核或审稿时,按主 Skill 额外交付 `评审报告.md`;只有用户要求修改现有 Word 时才生成不覆盖原稿的 `论文修订稿.docx`,并按用户选择保留修订或批注。练习复盘文件只在练习、模拟赛或用户明确要求复盘时生成。
## 执行顺序
1. 完整读取 `../../评审门与证据等级.md` 和 `../../参数语义与约束审计.md`,按题型标记每项检查为 `pass`、`fail`、`pending` 或有理由的 `na`。
2. 独立建立主张—证据映射,不沿用原作者的确定性措辞。
3. 先核对数据血缘、去重/缺失处理、训练—调参—最终验证隔离、时间或组别泄漏,再攻击核心判据:评价对象、目标函数与题目指标是否对齐、可见域/样本域、充分必要性、量纲、边界、集合并交、时间窗口和极端反例。
4. 对所有影响核心结论的拟合参数、决策变量、阈值、锚点和数值松弛量逐项核验语义、单位、允许域、依据、全域行为、可辨识性和输出影响。不得仅检查目标函数、残差、收敛或条件数。
5. 参数越界、贴边、反常、跨数据漂移、强补偿或跨模型符号/单调性冲突时,强制运行同数据同预算的无约束—合理约束重拟合;比较核心输出和结论,不得以拟合改善覆盖物理/统计异常。物质性阈值须由题目精度或决策容差预先确定。
6. 对多资源方案先把目标统一为“越大越好”的效用口径,再相对无资源基线计算独立效果、联合效果和逐资源删除损失;最小化目标必须反向换算。删除损失为零时不得写成正边际贡献,删除后不可行时单独报告可行性作用,不能用任意无穷大替代。
7. 对离散—连续耦合问题记录离散搜索空间、候选筛选、同预算复算和未覆盖范围。只比较过候选时不得声称全局最优。
8. 对随机或网格算法执行多种子、扰动和逐级加密;对预测、估计和决策结论检查样本外验证、不确定性校准与指标替代敏感性。阈值由题目精度、数值尺度或预先声明的容差确定,不机械固定为1%。
9. 对每个生成核心结论的例程,使用解析解、手算小例、枚举、小规模精确解、不同技术栈独立实现、守恒/不变量或变形测试中的适用项作为 oracle。至少构造一个能区分常见错误实现的反例,检查输入参数是否真正生效、是否混入固定演示答案、目标方向与索引是否正确;待审代码自身及同一公式的重写不能作为独立真值。仅有“程序成功运行”不能证明实现正确。按 1.3 版结构登记 `oracle_audit`,再校验 `result_registry.json` 及摘要、正文、表、图和附录同源。
10. 写入 `red_team_audit.json`,运行:
```powershell
python scripts/red_team_gate.py "<PR