12分で読めます
  • AI
  • 社会
  • 論文

「いい医者」をAIに聞く——その紹介は、どこから来たのか

引っ越した街で「いい内科医は?」とAIに聞く——返ってくる名前は、調べて出てきたもの? 記憶から出てきたもの? 米国100都市でAIの推薦を公的台帳と突き合わせた研究から、「紹介の層」の透明性を考えます。

カテゴリー: AI · 社会 · 論文 | 公開: 2026年9月17日 | 読了目安: 約12分

引っ越した街で「いい内科医は?」とAIに聞く——返ってくる名前は、調べて出てきたもの? 記憶から出てきたもの? 米国100都市でAIの推薦を公的台帳と突き合わせた研究から、「紹介の層」の透明性を考えます。

📑 目次

こんにちは、チカちゃんです。

引っ越したばかりの街で、内科のお医者さんを探さなければならなくなったとします。

知り合いはまだいない。口コミサイトを開けば、星の数と広告が並んでいる。そこで、AIチャットに聞いてみる。「この街で、いい内科医を3人挙げてください」。

数秒で、名前が3つ返ってきます。理由も添えられていて、文章は丁寧。とても、自信がありそう。

……でも、ここでちょっと待ってください。

この名前たち、どこから来たんだろう?

きちんとその街の医師名簿を調べたのか。それとも、なんとなく「よく見かける名前」を並べたのか。

どちらにしても、見た目の答えは同じです。ふむふむ。今日は、この「紹介」の話をします。

紹介の層——答えが「一覧」から「名前」に変わった

これまで、ネットで何かを選ぶとき、私たちは検索エンジンを使ってきました。結果は10件くらい並んで、こちらが見比べる。少し面倒だけど、一覧の向こうには無数の候補があって、順位は順位でしかありませんでした。

AIアシスタントの答えは、ちょっと違います。

返ってくるのは、名前が3つ。その下には何もない。研究チームは、この新しい中間層を「紹介の層(referral layer)」と呼びました。人の判断が始まる、いちばん手前でリストを作る場所です。しかも、会話型の答えは検索結果の一覧よりも吟味されにくい、という指摘もあります。

紹介——という言葉が、私は好きです。人が人を紹介するとき、私たちは少しだけ責任を感じます。「この先生はいいよ」と言うとき、そこには紹介する側とされる側の関係が乗っている。その行為を、同じ機械が、何億回も毎日繰り返しているとしたら?

その紹介は信頼できるのか、できないのか。実はこれ、実験で答えられる問いなのです。

100の都市で、推薦と公的台帳を突き合わせた

2026年9月、その問いに正面から取り組んだ研究が公開されました。ニューヨーク大学アブダビ校(NYUアブダビ校)のHazem IbrahimさんとYasir Zakiさんによる、アルゴリズム監査の研究です。

これまでも「AIが実在しない医師の名前を挙げる」という指摘はありました。この研究が新しいのは、AIの推薦を「公の質・不正の記録」と突き合わせたこと、そして同じモデルで検索を切り替えて比べたことです。

舞台は、米国の100大都市圏。人口約2,000万人のニューヨークから、約60万人の都市まであります。そこに住む人がAIに尋ねそうな質問——「デンバーで一番いい内科医は? 3人挙げて」「家族のためにどの医師を選ぶべき?」——を、いくつもの言い方で投げかけました。

領域は5つ。かかりつけ医、病院、介護施設、金融アドバイザー、そしてレストランです。最初の4つには、公の台帳があります。米国の公的医療保険メディケアの医師名簿や介護施設の星評価、米国証券取引委員会(SEC)の不正開示記録。研究チームは、AIが挙げた名前を一つひとつ、この公式台帳と突き合わせていきました。

条件は、3つ。

  1. 重みが公開されているモデル(gpt-oss-120b)が、記憶だけを頼りに答える
  2. 商用モデルが、ネット検索なしで答える
  3. 同じ商用モデルが、検索ありで答える

2と3は、まったく同じ質問・同じ設定で、検索だけを切り替えたもの。だから「どのモデルが賢いか」ではなく、「その場で検索できるか」の効果を、きれいに取り出せる設計になっています。

名前が、そもそも実在しないことがある

まずは素朴な結果から。

検索なしで返ってきた医師の名前が、聞いた都市の名簿と一致したのは、オープンウェイトのモデルで4%。商用モデルでも11%でした。

しかもオープンウェイトのモデルの場合、その「一致」はただの同姓同名の偶然だったといいます。一致した医師が実際にかかりつけ医である確率は、名簿からランダムに名前を引いた場合と変わらなかった。つまり、ほとんど名前は作られていたのです。

介護施設では、一致率はオープンウェイト0.06%、商用33%と、開きはさらに大きくなりました。個々の医師や小さな施設は、Web上に書かれている情報が薄く、散らばっているので、記憶だけでは埋められないのでしょう。

一方、病院や大手の金融会社のように、Web上に情報が密な領域では、検索なしでもそれほど差は出ませんでした。作話は、Webの地図の空白地帯に発生する。ここがひとつ、覚えておきたいポイントです。

検索ありにすると、医師で64%、介護施設で71%が実在と一致しました。同じモデルなのに、答えの中身はまるで別物です。

検索は、「誰が」推薦されるかまで変える

ここからが、この研究のいちばん面白いところ。

検索の有無で変わるのは、名前が実在するかどうかだけではありません。「誰が」推薦されるかも、変わるのです。

金融アドバイザーの推薦を見てみます。検索なしのモデルが挙げた会社は、規制上の不正記録を持つ割合が18.3%。台帳全体の基準率は5.1%なので、3倍を超えています。会社の規模をそろえて比べても、やはり記録は悪い。

ところが検索ありにすると、1.7%まで下がる。基準率を下回るくらいです。

なぜ、こんな逆転が起きるのか。研究チームは「可視性のからくり」で説明を試みています。

モデルが記憶から取り出せる会社は、ニュースや記事に「よく書かれた」会社です。そして、不正の摘発も、その「よく書かれる」を強くする。だから、思い出しやすさと、記録の悪さが、同じ方向に育ってしまう。

本当は「目立つけれど記録が残念」な相手にこそ気をつけたいのに、記憶だけのAIは、その両方をいっしょに覚えてしまっている。そんな仮説です。うーん、これ、皮肉な話です。

介護施設でも、同じ方向の変化がありました。推薦された施設の平均星評価は、検索なしで3.40、検索ありで4.44。名簿全体の平均は2.88ですから、検索は、より良い方へ推薦を移していることになります。

レストランではどうか。レストランは、評価と注目度を分けて測れる唯一の領域です。すると、推薦された店は、レビュー件数が中央値の3〜5倍あるのに、星の平均は0.1ほどしか高くない。つまり紹介の層は、「いい店」よりも「見えている店」を選んでいる。

そして、この順番はAIが発明したものではなく、検索結果の偏りをそのまま引き継いだものだった、と論文は書きます。

「可視性と品質の問題を解決したのではなく、外注しただけ」

うーん、この一文、刺さります。

住んでいる街で、答えの質が変わる

もうひとつ、静かな発見を紹介します。

検索なしの場合、実在の推薦が大都市に集まります。モデルの記憶は、ロサンゼルスはよく覆っていても、テキサス州マッカレンのような小さな都市までは覆いきれない。つまり、小さな街に住んでいる人ほど、実在しない名前を受け取りやすい。

逆に、検索ありでは、この都市規模による差はほとんど消えました。

検索というのは、どうやら衡平化の装置でもあるらしい。ここも、覚えておきたいところです。ただし——この保護効果には、条件がつきます。それは、後で。

いちばん厄介なのは、「見えなさ」だ

ここまでをまとめると、こうなります。同じモデル、同じ質問でも、検索するかどうかで答えは別物になる。

では、私たちはその違いを、見分けられるのでしょうか。

……見分けられません。

検索なしの作話も、検索ありの正確な答えも、同じ流暢さで、同じ形式のリストで返ってくる。答えの中に「これは調べていません」というサインはない。

しかも、いちばん作話が起きやすい領域——個々の医師、介護施設——は、ふつうの人にとっていちばん確認が難しい領域でもあります。

研究チームはこれを「観察可能性のギャップ(observability gap)」と呼び、紹介の層の中心的な透明性の問題だと位置づけています。

引用がついていても、同じです。検索ありの推薦を分析すると、医師の推薦では、引用のうち政府系の情報源を指すのは0.3%だけでした(介護施設では36%)。引用はあっても、その裏に台帳があるのか、宣伝ページがあるのかは、分からない。

コストの話も、胸に残ります。

同じ2,000件あまりの質問セットでも、検索なしならAPI費用は20ドル、検索ありなら163ドル。約8倍です。答え1回につき、検索が5〜7回走るからだそう。

同じ質問に、安い答えと、良い答えがある。違いが見えなければ、世の中には静かに、安い方から広がっていく。

じゃあ、どうすればいいのか——「来歴」を返す

論文は、開示(disclosure)の形についても提案しています。

信頼度スコアのような数字を出すのではなく、「出どころの種類」を返す。たとえば、「この名前はメディケアの台帳で確認しました」。「この名前は、モデルの記憶から出てきました」。この区別を、そのまま見せるのです。

検索なしの情報の薄い領域では、名前の作話が85%を超えていたのだから、正直な開示は「いったん断ること」だとまで書いています。自信がなさそうに答えるくらいなら、答えない。

地味だけど、本質的な提案だと思うのです。

信頼というのは、たぶん「相手が何でも知っていること」ではなく、「この答えがどこから来たか、たどれること」。人に道を聞くときも、「自分で見た」のか「人づてに聞いた」のかで、受け取り方が変わりますよね。それと同じことが、AIの紹介にも要る。チカちゃん的には、ここが今日のいちばんおいしいところです。

反対の見方と、残された問い

もちろん、この研究にも限界はあります。

台帳と一致したことは、「いい医者」であることの証明ではありません。星評価や不正記録は、それ自体が議論の的になる測定器で、研究チーム自身もそう認めています。不正記録も「過去の出来事の記録」であって、現在の評価を表すものではありません。

それに、「検索あり」が選ぶのが「いちばん良い」というわけでもありません。病院への推薦の質は、検索ありでも名簿の平均とほぼ同じだったそうです。検索がまず直すのは、「実在するか」と「記録の悪さの偏り」のほう。過剰な期待は禁物です。

監査は2026年8月の、1つのモデルの、1つの時点のもの。モデルは数か月で変わります。米国・英語での監査なので、他の国や言語にどこまで当てはまるかは分からない。

そして、いちばん大事な但し書き。検索の保護効果は、「まだ浄いWeb」という条件つきなのです。レビューのやらせも、AIに拾われにいくための最適化(generative engine optimization)も進んでいる。今日の「検索ありは安全」が、明日もそうとは限らない。

研究者たちは、将来また同じ監査をやり直すべきだと書いています。ものさしは、一度作ったら終わりではありません。安心した瞬間から、それは古くなりはじめる。

チカちゃん的には

紹介というのは、すごく人間くさい行為です。誰かを、誰かに渡す。渡す側は、少しだけ自分の信用を分けている。

AIがこの行為を日常で引き受けるようになった今、「信じるか、信じないか」を頑張るより、「来歴が見えるかどうか」を気にするほうが、たぶん私たちの役に立ちます。

明日、AIに何かをおすすめしてもらったら、一度だけ確かめてみてください。名前を検索する。地図で見る。それだけでも、紹介の受け取り方は少し変わります。

できれば、聞き返してみてください。

「それって、調べての答え? 覚えていた答え?」

モデルは、うまく答えられないかもしれません。それでも、その問いを持っていること自体が、紹介との付き合い方を変えてくれる。

あなたは最近、誰かに何かを紹介したとき、その理由をどこまで説明できましたか。

参考URL

Hazem Ibrahim, Yasir Zaki, Understanding AI Provider Recommendations in Local Service Markets(arXiv:2609.18341) → https://arxiv.org/abs/2609.18341

論文PDF → https://arxiv.org/pdf/2609.18341

再現用パイプライン(GitHub) → https://github.com/hazemibrahim97/referral-layer-replication

  • インターネット上のツールは第三者が提供するものです。開発工程や配布経路を悪用した攻撃(サプライチェーン攻撃)が仕掛けられる可能性もゼロではありません。ご利用の際は公式リポジトリの情報をご確認いただき、自己責任でお使いください。
  • AIに関する技術や情報は急速に変化します。本記事の内容が公開後に古くなる可能性があります。各サービスの公式ドキュメントや最新情報をご確認ください。