これは何?
- 人間が実際にどちらのLLMの回答を好むのかを、大規模なペアワイズ比較によって評価する Chatbot Arena を提案した論文
- Arena に集まったプロンプトでモデル間の能力差を識別できた
- Arena内で収集されたプロンプトには十分な多様性があり、プラットフォーム上での投票には一定の品質があることを確認できた
なぜこの研究をした?
LLM の性能評価のために、さまざまなベンチマークが提案されてきました。これらは次の表に示すような2つの観点で分類することができます。
- 質問の供給源
- 静的(static)かライブ(live)か
- 評価指標
- 正解(ground truth)に基づくものか、人間の選好(human preference)に基づくものか
これらの観点をもとに各種ベンチマークを4つのカテゴリーに分類した結果が次の表です。

現在もっとも一般的なLLM評価方法は「静的」「正解に基づく」ものです。評価が低コストかつ再現しやすいことが理由です。
しかし、この種類のベンチマークには以下のような課題があり、人間の選好を評価するという点では不十分です。
- LLMの利用方法として一般的な、自由回答形式の性能評価においては不十分
- テストセットが固定化されており、学習データに混入する可能性がある。その結果評価結果の信頼性を損ねる
- 多くの複雑なタスクでは、明確な正解を定めること自体が難しい
これらの課題を解決するためには、リアルタイムで新鮮かつ多様なユーザーからの質問を収集する必要があります。
何をやった?
この論文ではモデル同士の対戦を行う LLMベンチマークプラットフォーム「Chatbot Arena」を提案しています。
webサイトで質問をすると匿名化された 2つのLLMからそれぞれ回答が返され、ユーザーはより好ましい回答を生成したモデルに投票します。この評価をもとにモデルのランキングを作成するプラットフォームになっています。

ユーザーからの質問を随時受け付けることでリアルタイムで質問を収集できます。さらに多くのユーザーに利用してもらうことで、多様なユーザーの評価を集めることが可能です。
2023年4月にデータ収集を開始し、2024年1月時点で 9万人を超えるユーザーから約24万件の投票を収集しました。
何が分かった?
Arena のプロンプトで、モデル間の能力差を識別できることが示されました。
Llama-2-70b-chatとGPT-4の性能を比較し、GPT-4 の勝率は
- 問題解決能力をあまり必要としないプロンプトでは 60 % 未満
- コーディングや推論能力を必要とするプロンプトでは最大 97 %
となりました。これは Arena で集めたプロンプトによって各モデルの強みを識別できたということになります。
モデルの評価にあたり、「Arena内で収集されたプロンプトには十分な多様性があるか」「プラットフォーム上での投票には一定の品質があるか」を検証しています。
プロンプトをトピックごとに分類したところ600のクラスタに分かれ、最大のクラスタでも全体の1%にとどまることから、Arena内のプロンプトが多様な分布を持つことを確認しています。
後者に関しては、一般ユーザーと専門家による評価を比較しています。一般ユーザーと専門家の評価の一致率は 72~83% でした。一方、専門家同士でも一致率は 79~90 % 程度で、完全には一致していませんでした。そもそも質問に明確な答えが存在しないものもあったためと考察しています。

ただし、Arena の利用者は LLM 好きや研究者に偏っているのでバイアスが発生していることを論文中で認めています。
読んでいて気になったこと
- そもそも人間の選好ってなんだろう
- 人間が好む回答と、事実として正しい回答が食い違った場合、Arena では前者を高く評価してしまう可能性があるのでは?
