← ClaudeAtlas

extract-textlisted

TRIGGER: PDF または Google ドキュメント/スプレッドシート/スライドからプレーンテキストを抜き出したい場合(ローカルファイル・Drive 上のファイルどちらも)。入力の種類で適切な抽出ツールへ自動振り分けする。SKIP: スキャン画像のみの PDF(OCR が必要で非対応)・テキストではなく画像/表/レイアウトそのものが目的の場合・このセッションで直接読めば十分な単発の小さいファイルの場合。Examples - /extract-text /path/to/file.pdf, /extract-text <drive-url>, /extract-text <gdoc-id> -o out.md.
masa-san-jp/Agent-Aiko · ★ 3 · Data & Documents · score 64
Install: claude install-skill masa-san-jp/Agent-Aiko
# /extract-text PDF と Google Workspace ファイルからテキストを抜き出す統合エントリ。入力の種類を判定し、専用ツールへ振り分ける。実装本体は持たず、`pdf-extract` と `gws-read` をオーケストレーションするだけの薄いラッパー。 ツール群は `{{ORG_REPO_PATH}}/Agent-team/tools/` 配下に配置する前提。環境に合わせてパスは読み替える。 | 入力 | 振り分け先 | |---|---| | ローカル PDF / Drive 上の PDF(`application/pdf`) | `{{ORG_REPO_PATH}}/Agent-team/tools/pdf-extract/` | | Google ドキュメント / スプレッドシート / スライド(ネイティブ Google 形式) | `{{ORG_REPO_PATH}}/Agent-team/tools/gws-read/`(Slides は `gslides-read`) | ## 引数 | 引数 | 必須 | 意味 | |---|---|---| | `<input>` | ○ | ローカルパス、Drive の ID または URL | | `-o <path>` | × | 出力先ファイル。省略時は標準出力 | | `--pages <範囲>` | × | PDF のページ指定(例:`1-5,8`) | | `--page-markers` | × | PDF のページ境界マーカーを付与 | ## 入力の判定手順 1. 入力がローカルに存在するパスか? → **ローカルファイル** - 拡張子 `.pdf` → `pdf-extract` に `--local` で渡す - それ以外のローカルファイル(`.docx` 等)は対象外。別ツールを案内する 2. 入力が Drive の ID / URL か? → **Drive ファイル** - URL に `/document/` `/spreadsheets/` `/presentation/` が含まれる → それぞれ Docs / Sheets / Slides。`gws-read`(Slides はノート必要なら `gslides-read`)へ - 上記が判別できない(生 ID や `/file/d/` の汎用 URL)→ まず `pdf-extract` に渡す。中で mimeType を確認し、PDF でなければ終了コード 4 で gws-read へ誘導されるので、その案内に従って `gws-read` を実行する 迷ったら `pdf-extract` を先に叩いてよい。PDF 以外の Google ファイルは自動で gws-read へ誘導される。 ## 実行手順 ### setup(初回のみ) ```bash bash {{ORG_REPO_PATH}}/Agent-team/tools/pdf-extract/setup.sh bash {{ORG_REPO_PATH}}/Agent-team/tools/gws-read/setup.sh # Google ファイルを扱う場合 ``` ローカル PDF だけなら認証不要。Drive 上のファイルを扱う場合は ADC(Application Default Credentials)が必要: ```bash bash {{ORG_RE