extract-textlisted
Install: claude install-skill masa-san-jp/Agent-Aiko
# /extract-text
PDF と Google Workspace ファイルからテキストを抜き出す統合エントリ。入力の種類を判定し、専用ツールへ振り分ける。実装本体は持たず、`pdf-extract` と `gws-read` をオーケストレーションするだけの薄いラッパー。
ツール群は `{{ORG_REPO_PATH}}/Agent-team/tools/` 配下に配置する前提。環境に合わせてパスは読み替える。
| 入力 | 振り分け先 |
|---|---|
| ローカル PDF / Drive 上の PDF(`application/pdf`) | `{{ORG_REPO_PATH}}/Agent-team/tools/pdf-extract/` |
| Google ドキュメント / スプレッドシート / スライド(ネイティブ Google 形式) | `{{ORG_REPO_PATH}}/Agent-team/tools/gws-read/`(Slides は `gslides-read`) |
## 引数
| 引数 | 必須 | 意味 |
|---|---|---|
| `<input>` | ○ | ローカルパス、Drive の ID または URL |
| `-o <path>` | × | 出力先ファイル。省略時は標準出力 |
| `--pages <範囲>` | × | PDF のページ指定(例:`1-5,8`) |
| `--page-markers` | × | PDF のページ境界マーカーを付与 |
## 入力の判定手順
1. 入力がローカルに存在するパスか? → **ローカルファイル**
- 拡張子 `.pdf` → `pdf-extract` に `--local` で渡す
- それ以外のローカルファイル(`.docx` 等)は対象外。別ツールを案内する
2. 入力が Drive の ID / URL か? → **Drive ファイル**
- URL に `/document/` `/spreadsheets/` `/presentation/` が含まれる → それぞれ Docs / Sheets / Slides。`gws-read`(Slides はノート必要なら `gslides-read`)へ
- 上記が判別できない(生 ID や `/file/d/` の汎用 URL)→ まず `pdf-extract` に渡す。中で mimeType を確認し、PDF でなければ終了コード 4 で gws-read へ誘導されるので、その案内に従って `gws-read` を実行する
迷ったら `pdf-extract` を先に叩いてよい。PDF 以外の Google ファイルは自動で gws-read へ誘導される。
## 実行手順
### setup(初回のみ)
```bash
bash {{ORG_REPO_PATH}}/Agent-team/tools/pdf-extract/setup.sh
bash {{ORG_REPO_PATH}}/Agent-team/tools/gws-read/setup.sh # Google ファイルを扱う場合
```
ローカル PDF だけなら認証不要。Drive 上のファイルを扱う場合は ADC(Application Default Credentials)が必要:
```bash
bash {{ORG_RE