ime-lexicon-buildlisted
Install: claude install-skill taxueseek/ime-lexicon
# build — 搜索 + 创建行业词库
父技能:`ime-lexicon`。本文件就是归档的 `industry-dict`(原 `~/.agents/skills/industry-dict`,2026-08-14 瘦身进 Claude 归档)。不要再单独恢复顶层技能。
查询和分类骨架在 `scripts/search.py` 的 `SCHEMAS` / `QUERY_BY_SCHEMA`。产线、投资、内容、求职各用自己的,不要互相套。
## 何时用
- 给一个行业,要一份能进微信自定义词库的 txt
- 已有旧词库 / 现场词要合并
- 不要灌全量词库
## 工作流(industry-dict 原 6 步)
### 1. 确认行业
行业名越具体越好(「锂电池」「猪场养殖」「法律」)。输出默认 `IME_DICT_DIR/行业词库_<行业>.txt`。只给行业名就开工,不追问路径。
### 2. 搜术语(防幻觉)
```bash
python3 "$HOME/.agents/skills/ime-lexicon/scripts/ime_lexicon.py" search \
--topic 锂电池
```
默认打印 3 路查询和当前后端命令。探测顺序:
1. **argo**:本机有 `argo` CLI,或存在 `~/.agents/skills/argo/scripts/search.py`
2. **通用搜索**:`ddgs text`(CLI `--run` 兜底)
3. **宿主搜索**:上面都没有时,代理用当前环境的通用搜索工具(`web_search` / WebSearch)跑同一组 3 路查询,把 title/snippet 存成 json 或 txt,再 `--from`
用户要现在生成时加 `--run --out /tmp/术语.txt`。`--engine generic` 可强制走兜底。snippet 太短再抓正文(argo 用 `argo fetch`;通用搜索只吃 snippet,别卡死)。
不要在本技能里另写 HTTP 爬虫。
### 3. 按该行业的分类补(每类大约 20–40)
先看 `search --topic` 打出来的 `schema`,再补。不要把产线五类套到投资或内容上。
| 骨架 | 分类 | 适用 |
| --- | --- | --- |
| 制造 | 材料 / 工艺 / 设备 / 检测 / 现场 | 锂电、化工、产线 |
| 投资 | 品种 / 策略 / 平台 / 指标 / 圈内 | 基金、股票、理财 |
| 内容 | 体裁 / 流程 / 平台 / 数据 / 圈内 | 自媒体、知乎、公众号 |
| 求职 | 环节 / 文书 / 平台 / 条件 / 圈内 | 简历、面试 |
| 通用 | 术语 / 流程 / 工具 / 指标 / 圈内 | 对不上上面时 |
2–8 字优先,最长 12;OCV、ETF、CTR 这类缩写留;「的/是/工作」不写;组合词优于单字。
补的词带分类:`--term 品种:可转债` 或词表行 `可转债 品种`。制造行业仍写 `材料:磷酸铁锂`。
### 4. 清洗输出
搜索提取 + 模型补充 + `--from` 旧表,进同一清洗:
```bash
python3 "$HOME/.agents/skills/ime-lexicon/scripts/ime_lexicon.py" build \
--topic 锂电