G検定
G検定|報酬がまばらで行動の良し悪しを学びにくい
QUESTION
報酬がまばらで行動の良し悪しを学びにくい
報酬がまばらで行動の良し悪しを学びにくい。最も適切なものはどれですか。
ANSWER & EXPLANATION
正解:B
有益な結果が少なく学習信号が不足することです。観測と行動の関係を目的に合わせて選びます。
選択肢のポイント
- A行動空間の安全制約は許可する行動の範囲を制限することです。この設問で求めるものとは異なります。
- B正解です。有益な結果が少なく学習信号が不足することです。
- Cインスタンス分割は個別の物体ごとに画素領域を分ける課題です。この設問で求めるものとは異なります。
- D探索と活用の両立は新しい行動の試行と既知の良策を使う調整です。この設問で求めるものとは異なります。
関連キーワード
- 疎な報酬の問題
- 視覚と強化学習
参考にした公式情報:日本ディープラーニング協会 G検定の試験範囲 / 確認日:2026年9月29日