← ClaudeAtlas

ime-lexicon-buildlisted

搜索并生成行业/专业/定制词库。真源是归档 industry-dict: 3 路搜术语(有 argo 用 argo,否则通用搜索)→ 按该行业自己的分类补 → clean_dict 清洗 → txt。产线才用材料/工艺/设备/检测/现场。 触发:生成行业词库、做词库、行业术语、XX行业的词、定制词库、 industry-dict、导入微信输入法、给我做个XX行业的词库。
taxueseek/ime-lexicon · ★ 0 · Web & Frontend · score 70
Install: claude install-skill taxueseek/ime-lexicon
# build — 搜索 + 创建行业词库 父技能:`ime-lexicon`。本文件就是归档的 `industry-dict`(原 `~/.agents/skills/industry-dict`,2026-08-14 瘦身进 Claude 归档)。不要再单独恢复顶层技能。 查询和分类骨架在 `scripts/search.py` 的 `SCHEMAS` / `QUERY_BY_SCHEMA`。产线、投资、内容、求职各用自己的,不要互相套。 ## 何时用 - 给一个行业,要一份能进微信自定义词库的 txt - 已有旧词库 / 现场词要合并 - 不要灌全量词库 ## 工作流(industry-dict 原 6 步) ### 1. 确认行业 行业名越具体越好(「锂电池」「猪场养殖」「法律」)。输出默认 `IME_DICT_DIR/行业词库_<行业>.txt`。只给行业名就开工,不追问路径。 ### 2. 搜术语(防幻觉) ```bash python3 "$HOME/.agents/skills/ime-lexicon/scripts/ime_lexicon.py" search \ --topic 锂电池 ``` 默认打印 3 路查询和当前后端命令。探测顺序: 1. **argo**:本机有 `argo` CLI,或存在 `~/.agents/skills/argo/scripts/search.py` 2. **通用搜索**:`ddgs text`(CLI `--run` 兜底) 3. **宿主搜索**:上面都没有时,代理用当前环境的通用搜索工具(`web_search` / WebSearch)跑同一组 3 路查询,把 title/snippet 存成 json 或 txt,再 `--from` 用户要现在生成时加 `--run --out /tmp/术语.txt`。`--engine generic` 可强制走兜底。snippet 太短再抓正文(argo 用 `argo fetch`;通用搜索只吃 snippet,别卡死)。 不要在本技能里另写 HTTP 爬虫。 ### 3. 按该行业的分类补(每类大约 20–40) 先看 `search --topic` 打出来的 `schema`,再补。不要把产线五类套到投资或内容上。 | 骨架 | 分类 | 适用 | | --- | --- | --- | | 制造 | 材料 / 工艺 / 设备 / 检测 / 现场 | 锂电、化工、产线 | | 投资 | 品种 / 策略 / 平台 / 指标 / 圈内 | 基金、股票、理财 | | 内容 | 体裁 / 流程 / 平台 / 数据 / 圈内 | 自媒体、知乎、公众号 | | 求职 | 环节 / 文书 / 平台 / 条件 / 圈内 | 简历、面试 | | 通用 | 术语 / 流程 / 工具 / 指标 / 圈内 | 对不上上面时 | 2–8 字优先,最长 12;OCV、ETF、CTR 这类缩写留;「的/是/工作」不写;组合词优于单字。 补的词带分类:`--term 品种:可转债` 或词表行 `可转债 品种`。制造行业仍写 `材料:磷酸铁锂`。 ### 4. 清洗输出 搜索提取 + 模型补充 + `--from` 旧表,进同一清洗: ```bash python3 "$HOME/.agents/skills/ime-lexicon/scripts/ime_lexicon.py" build \ --topic 锂电