AI活用
RAGの評価方法|検索と回答を分けて測る20問テストの作り方
RAGを検索と回答に分けて評価する方法を解説。Recall@k、根拠への忠実性、回答の完全性、拒否精度を測る20問データセット雛形と改善記録表を紹介します。
AIとつくる、実践プログラミング・コーディングメディア
ARCHIVE
RAGを検索と回答に分けて評価する方法を解説。Recall@k、根拠への忠実性、回答の完全性、拒否精度を測る20問データセット雛形と改善記録表を紹介します。
LLM評価の目的、30件の評価データ雛形、5段階rubric、人とLLM judgeの役割、失敗分類、回帰テストの運用方法を解説します。