01
このSkillでできること
- ✓evaluatorqで評価ジョブとカスタムスコアラーを書く
- ✓データセットに対して出力を評価する
- ✓組み込み評価器や独自評価器を利用する
- ✓CLIのレッドチーム・エージェントシミュレーションへ案内する
02
使い方
01
STEP 1
既存データセットがあればdataset_idまたはdatasetIdを優先する
02
STEP 2
評価器IDはユーザーまたは検索ツールから取得する
03
STEP 3
本番評価前に1つのDataPointでジョブ関数を単独テストする
04
STEP 4
CLI操作ではORQ_API_KEYの設定状態を確認する
03
Skillのインストール
初心者におすすめ
AIにこのSkillを追加してもらう
GitHub URLごとCodexやClaude Codeへ渡し、現在の環境に合う方法を判断してもらいます。
このGitHubリポジトリにあるSkillを確認し、現在の環境に適した方法でインストールしてください。
インストール後、正常に利用できることを確認し、基本的な使い方も簡潔に説明してください。
Repository:
https://github.com/orq-ai/orq-cli手動でインストールする
README / SKILL.mdから機械抽出できたコマンドのみ表示しています。推測したコマンドではありません。
npm install -g @orq-ai/clicurl -fsSL https://cli.orq.ai/install.sh | shcurl -fsSL .../install.sh | sh -s -- --version v0.1.0
curl -fsSL .../install.sh | sh -s -- --install-dir /usr/local/bin
curl -fsSL .../install.sh | sh -s -- --no-modify-path --no-setup
curl -fsSL .../install.sh | sh -s -- --channel rcgit clone https://github.com/orq-ai/orq-cli.git
cd orq-cli
make build
./bin/orq --version04
このSkillを使うプロンプト例
Skill名を明示すると、意図したSkillを使わせやすくなります。自動発動型では必須とは限りません。
単一エージェントの回答を評価するPythonスクリプトを作り、既存データセットと文字列一致評価器を使ってください。出力例を見る
評価ジョブの定義、使用データセット、スコア結果、実行済みの単体確認を報告します。05
安全性チェック
自動解析による参考情報です。Skillの安全性を保証するものではありません。
外部API通信検出あり
Shellコマンド実行明確な記述なし
ファイル読み取り明確な記述なし
ファイル書き込み明確な記述なし
ネットワークアクセス検出あり
認証情報検出あり
検出根拠を見る
- network: is the open-source evaluation runner from [evaluatorq](https://github.com/orq-ai/evaluatorq). It runs jobs against datasets, scores outputs, and — when `
- network: -g @orq-ai/cli [large code block omitted]sh git clone https://github.com/orq-ai/orq-cli.git cd orq-cli make build ./bin/orq --version [large code block
- credential: jobs against datasets, scores outputs, and — when `ORQ_API_KEY` is set — automatically reports results to the orq.ai Experiment UI. ## Constraints - *
- credential: a platform dataset exists. - **CLI only:** Check `ORQ_API_KEY` is set before running `eq redteam` or `eq sim`. **Why these constraints:** Tiny inline
06