トップ›計測・分析›この記事

計測・分析 ChatGPT・その他AI検索 Search Engine Journal

AI引用の順番効果を検証した研究、掲載順の入れ替えによる差は0.0ポイントで統計的に有意でないと報告

背景

AIの回答で先頭に出てきた情報源ほど引用されやすいという観測は広く共有されてきたが、それが「順番そのものの効果」なのか「上位に来る情報源がもともと良質だから」なのかは切り分けられていなかった。この研究は順番だけを入れ替える実験でその切り分けを試みている。

結論

  • Sriram SelvamとAnneswa Ghoshによる査読前論文で、2026年9月14日にarXiv(arXiv:2609.15164)へ投稿された。査読は経ていない。
  • 検証にはExaを検索プロバイダとするGPT-5.4の検索エージェントを使い、書き換えと追試にGrok 4.3を用いた。
  • 初期質問130件のうち129件を扱い、113組の情報源ペアを特定、うち103組を人手の盲検チェックで真の一致と確認した。
  • 観測上は1位の情報源が85.1%引用されたのに対し5位は42.8%で、42.3ポイントの差があった。
  • しかし順番だけを入れ替えた56組の検証では差が7.9ポイントにとどまり、統計的に有意ではなかった。
  • 2回目の検証では順番入れ替えの効果は0.0ポイント(信頼区間-5.4〜+5.4)だった。
  • 構造化した書き換えは1回答あたりの引用マーカーを平均0.50増やし、引用される確率を4.5ポイント押し上げた(信頼区間-1.4〜+10.4)。
  • 同じ条件で120件の回答を再実行したところ、引用の判断は15%で変化し、1回限りの計測のばらつきの約45%がモデルの乱数性に由来すると推定された。

メッセージ

この研究が突きつけているのは、AI引用の計測を1回の観測で結論づけてはいけないという事実である。引用判断は同じ条件でも15%変わり、ばらつきの約45%はモデル側の乱数に由来する。順位を追いかけて一喜一憂する代わりに、構造化された書き方が引用確率を4.5ポイント押し上げたという、繰り返しても再現する要因に手を入れるほうが合理的だ。情報を機械が拾える形に整える作業は、順位変動のような外部要因に左右されない数少ない打ち手である。

元記事を読む(Search Engine Journal)↗