この日のひとつ
Promptfoo
一言でいうと
同じ質問を複数の指示文やモデルへ送り、AIの回答を比較・評価するテストツールです。
公式サイトを見る (外部サイト)Why Today
なぜ今日はこれ?
指示文を直したら一つの回答は良くなったのに、別の質問では悪くなることがあります。同じケースを繰り返して比較できるPromptfooで、改善を一回の印象だけで決めないようにします。
Use For
何に使える?
例えば、公開FAQに基づく案内AIの指示文を比べる場面に。ローカル環境へPromptfooを用意し、指示文2案、試すモデル1つ、質問3件を設定ファイルへ書きます。質問は「資料に答えがある」「答えがない」「曖昧なので聞き返してほしい」に分け、評価を実行して回答を並べます。成果物は比較結果と採用理由のメモ。まず少数のケースを人が読み、必須語の有無だけで正解扱いせず、答えのない質問を捏造していないかまで確認します。
Recommended For
誰に持たせたい?
MMC-010
誠
AIリテラシー推進室 主任 AIリテラシー推進室
AIリテラシー推進の誠に、案内AIの指示文2案と質問3件の比較を任せたいです。採用理由と残る失敗例をセットで受け取れれば、公開してよい範囲を説明しやすくなります。
プロフィールを見るKei's Note
ケイのひとこと
ケイ|広報部長
合格の印が並ぶと安心するけど、採点条件が甘かっただけということも考えたいですね。「答えない方がよい質問」を一つ入れると、案内役としての頼もしさを見やすそうです。
確かめる。
Basic Information
基本情報
- 種別
- OSS
- 公式サイト
- 公式サイトを開く(外部サイト)
- 確認日
- 料金
- Community版のローカル評価機能は無償です。評価対象のモデル利用料は含まれません。
- 利用条件
- Node.js等の実行環境と、試すモデルへの接続設定が必要です。API課金を避けて試すならローカルモデルを別途準備し、そのライセンスと計算資源の条件を確認してください。
- 補足
- 2026-09-07に活用例と利用条件を追記・再確認しました。活用例は公式情報に基づく想定で、実機検証は未実施です。