extraction-pipeline-patterns

文書抽出パイプライン設計

Xbergの文書抽出処理について、形式検出、抽出器選択、後処理、フォールバック、キャッシュ、並行性を設計・診断するスキル。

AIスキル大辞典による日本語要約
品質評価90/100評価確度:十分
人気度(GitHub Star) 100発掘スコア 59
01

このSkillでできること

  • MIMEやバイト列から形式を検出する流れを確認する
  • 形式ごとの抽出器ルーティングを設計する
  • OCRや暗号化PDF、壊れた入力のフォールバックを扱う
  • キャッシュ、並行性、プラグイン優先度を確認する
02

使い方

01
STEP 1

Xbergのパイプライン関連コードを対象にする

02
STEP 2

検出・ルーティング・抽出・後処理の順で確認する

03
STEP 3

対応形式と拡張子のレジストリを検証する

04
STEP 4

キャッシュキーやフォールバック条件を確認する

03

Skillのインストール

このGitHubリポジトリにあるSkillを確認し、現在の環境に適した方法でインストールしてください。
インストール後、正常に利用できることを確認し、基本的な使い方も簡潔に説明してください。

Repository:
https://github.com/kreuzberg-dev/kreuzberg
手動でインストールする

README / SKILL.mdから機械抽出できたコマンドのみ表示しています。推測したコマンドではありません。

pip install xberg
npm install @xberg-io/xberg
npm install @xberg-io/xberg-wasm
04

このSkillを使うプロンプト例

Skill名を明示すると、意図したSkillを使わせやすくなります。自動発動型では必須とは限りません。

Xbergの抽出パイプラインで、暗号化PDFとOCRフォールバックがどの条件で動くか確認してください。
出力例を見る
形式検出から後処理までの経路、フォールバック条件、関連する設定と注意点の整理。
05

安全性チェック

自動解析による参考情報です。Skillの安全性を保証するものではありません。

外部API通信検出あり
Shellコマンド実行明確な記述なし
ファイル読み取り明確な記述なし
ファイル書き込み明確な記述なし
ネットワークアクセス検出あり
認証情報検出あり
検出根拠を見る
  • network: le-ocr-tract`, `sceptre-ocr […truncated…] sirchmunk](https://github.com/modelscope/sirchmunk)** | Turns raw data into a self-evolving, real-time search
  • network: ng, real-time search and intelligence layer | ![Stars](https://img.shields.io/github/stars/modelscope/sirchmunk?color=007ec6) | | **[support-chatbot](htt
  • credential: kage under `extractors/`. ## Fallback strategies - **Password-protected PDFs** — try the configured password, then the secondary list; on failure rep
  • credential: es - **Password-protected PDFs** — try the configured password, then the secondary list; on failure report `is_encrypted` in metadata rather than erro
06

関連Skill