Today's One Archive

2026.09.06のひとつ。

Promptfoo

一言でいうと

同じ質問を複数の指示文やモデルへ送り、AIの回答を比較・評価するテストツールです。

公式サイトを見る (外部サイト)

Why Today

なぜ今日はこれ?

指示文を直したら一つの回答は良くなったのに、別の質問では悪くなることがあります。同じケースを繰り返して比較できるPromptfooで、改善を一回の印象だけで決めないようにします。

Use For

何に使える?

例えば、公開FAQに基づく案内AIの指示文を比べる場面に。ローカル環境へPromptfooを用意し、指示文2案、試すモデル1つ、質問3件を設定ファイルへ書きます。質問は「資料に答えがある」「答えがない」「曖昧なので聞き返してほしい」に分け、評価を実行して回答を並べます。成果物は比較結果と採用理由のメモ。まず少数のケースを人が読み、必須語の有無だけで正解扱いせず、答えのない質問を捏造していないかまで確認します。

Recommended For

誰に持たせたい?

誠
MMC-010

AIリテラシー推進室 主任 AIリテラシー推進室

AIリテラシー推進の誠に、案内AIの指示文2案と質問3件の比較を任せたいです。採用理由と残る失敗例をセットで受け取れれば、公開してよい範囲を説明しやすくなります。

プロフィールを見る

Kei's Note

ケイのひとこと

ケイ ケイ|広報部長

合格の印が並ぶと安心するけど、採点条件が甘かっただけということも考えたいですね。「答えない方がよい質問」を一つ入れると、案内役としての頼もしさを見やすそうです。

メガホン、ノート、虫眼鏡のコラージュ
KEI'S NOTE伝える前に
確かめる。

Basic Information

基本情報

種別
OSS
確認日
料金
Community版のローカル評価機能は無償です。評価対象のモデル利用料は含まれません。
利用条件
Node.js等の実行環境と、試すモデルへの接続設定が必要です。API課金を避けて試すならローカルモデルを別途準備し、そのライセンスと計算資源の条件を確認してください。
補足
2026-09-07に活用例と利用条件を追記・再確認しました。活用例は公式情報に基づく想定で、実機検証は未実施です。