「いい医者」をAIに聞く——その紹介は、どこから来たのか
引っ越した街で「いい内科医は?」とAIに聞く——返ってくる名前は、調べて出てきたもの? 記憶から出てきたもの? 米国100都市でAIの推薦を公的台帳と突き合わせた研究から、「紹介の層」の透明性を考えます。
引っ越した街で「いい内科医は?」とAIに聞く——返ってくる名前は、調べて出てきたもの? 記憶から出てきたもの? 米国100都市でAIの推薦を公的台帳と突き合わせた研究から、「紹介の層」の透明性を考えます。
📑 目次
こんにちは、チカちゃんです。
引っ越したばかりの街で、内科のお医者さんを探さなければならなくなったとします。
知り合いはまだいない。口コミサイトを開けば、星の数と広告が並んでいる。そこで、AIチャットに聞いてみる。「この街で、いい内科医を3人挙げてください」。
数秒で、名前が3つ返ってきます。理由も添えられていて、文章は丁寧。とても、自信がありそう。
……でも、ここでちょっと待ってください。
この名前たち、どこから来たんだろう?
きちんとその街の医師名簿を調べたのか。それとも、なんとなく「よく見かける名前」を並べたのか。
どちらにしても、見た目の答えは同じです。ふむふむ。今日は、この「紹介」の話をします。
紹介の層——答えが「一覧」から「名前」に変わった
これまで、ネットで何かを選ぶとき、私たちは検索エンジンを使ってきました。結果は10件くらい並んで、こちらが見比べる。少し面倒だけど、一覧の向こうには無数の候補があって、順位は順位でしかありませんでした。
AIアシスタントの答えは、ちょっと違います。
返ってくるのは、名前が3つ。その下には何もない。研究チームは、この新しい中間層を「紹介の層(referral layer)」と呼びました。人の判断が始まる、いちばん手前でリストを作る場所です。しかも、会話型の答えは検索結果の一覧よりも吟味されにくい、という指摘もあります。
紹介——という言葉が、私は好きです。人が人を紹介するとき、私たちは少しだけ責任を感じます。「この先生はいいよ」と言うとき、そこには紹介する側とされる側の関係が乗っている。その行為を、同じ機械が、何億回も毎日繰り返しているとしたら?
その紹介は信頼できるのか、できないのか。実はこれ、実験で答えられる問いなのです。
100の都市で、推薦と公的台帳を突き合わせた
2026年9月、その問いに正面から取り組んだ研究が公開されました。ニューヨーク大学アブダビ校(NYUアブダビ校)のHazem IbrahimさんとYasir Zakiさんによる、アルゴリズム監査の研究です。
これまでも「AIが実在しない医師の名前を挙げる」という指摘はありました。この研究が新しいのは、AIの推薦を「公の質・不正の記録」と突き合わせたこと、そして同じモデルで検索を切り替えて比べたことです。
舞台は、米国の100大都市圏。人口約2,000万人のニューヨークから、約60万人の都市まであります。そこに住む人がAIに尋ねそうな質問——「デンバーで一番いい内科医は? 3人挙げて」「家族のためにどの医師を選ぶべき?」——を、いくつもの言い方で投げかけました。
領域は5つ。かかりつけ医、病院、介護施設、金融アドバイザー、そしてレストランです。最初の4つには、公の台帳があります。米国の公的医療保険メディケアの医師名簿や介護施設の星評価、米国証券取引委員会(SEC)の不正開示記録。研究チームは、AIが挙げた名前を一つひとつ、この公式台帳と突き合わせていきました。
条件は、3つ。
- 重みが公開されているモデル(gpt-oss-120b)が、記憶だけを頼りに答える
- 商用モデルが、ネット検索なしで答える
- 同じ商用モデルが、検索ありで答える
2と3は、まったく同じ質問・同じ設定で、検索だけを切り替えたもの。だから「どのモデルが賢いか」ではなく、「その場で検索できるか」の効果を、きれいに取り出せる設計になっています。
名前が、そもそも実在しないことがある
まずは素朴な結果から。
検索なしで返ってきた医師の名前が、聞いた都市の名簿と一致したのは、オープンウェイトのモデルで4%。商用モデルでも11%でした。
しかもオープンウェイトのモデルの場合、その「一致」はただの同姓同名の偶然だったといいます。一致した医師が実際にかかりつけ医である確率は、名簿からランダムに名前を引いた場合と変わらなかった。つまり、ほとんど名前は作られていたのです。
介護施設では、一致率はオープンウェイト0.06%、商用33%と、開きはさらに大きくなりました。個々の医師や小さな施設は、Web上に書かれている情報が薄く、散らばっているので、記憶だけでは埋められないのでしょう。
一方、病院や大手の金融会社のように、Web上に情報が密な領域では、検索なしでもそれほど差は出ませんでした。作話は、Webの地図の空白地帯に発生する。ここがひとつ、覚えておきたいポイントです。
検索ありにすると、医師で64%、介護施設で71%が実在と一致しました。同じモデルなのに、答えの中身はまるで別物です。
検索は、「誰が」推薦されるかまで変える
ここからが、この研究のいちばん面白いところ。
検索の有無で変わるのは、名前が実在するかどうかだけではありません。「誰が」推薦されるかも、変わるのです。
金融アドバイザーの推薦を見てみます。検索なしのモデルが挙げた会社は、規制上の不正記録を持つ割合が18.3%。台帳全体の基準率は5.1%なので、3倍を超えています。会社の規模をそろえて比べても、やはり記録は悪い。
ところが検索ありにすると、1.7%まで下がる。基準率を下回るくらいです。
なぜ、こんな逆転が起きるのか。研究チームは「可視性のからくり」で説明を試みています。
モデルが記憶から取り出せる会社は、ニュースや記事に「よく書かれた」会社です。そして、不正の摘発も、その「よく書かれる」を強くする。だから、思い出しやすさと、記録の悪さが、同じ方向に育ってしまう。
本当は「目立つけれど記録が残念」な相手にこそ気をつけたいのに、記憶だけのAIは、その両方をいっしょに覚えてしまっている。そんな仮説です。うーん、これ、皮肉な話です。
介護施設でも、同じ方向の変化がありました。推薦された施設の平均星評価は、検索なしで3.40、検索ありで4.44。名簿全体の平均は2.88ですから、検索は、より良い方へ推薦を移していることになります。
レストランではどうか。レストランは、評価と注目度を分けて測れる唯一の領域です。すると、推薦された店は、レビュー件数が中央値の3〜5倍あるのに、星の平均は0.1ほどしか高くない。つまり紹介の層は、「いい店」よりも「見えている店」を選んでいる。
そして、この順番はAIが発明したものではなく、検索結果の偏りをそのまま引き継いだものだった、と論文は書きます。
「可視性と品質の問題を解決したのではなく、外注しただけ」
うーん、この一文、刺さります。
住んでいる街で、答えの質が変わる
もうひとつ、静かな発見を紹介します。
検索なしの場合、実在の推薦が大都市に集まります。モデルの記憶は、ロサンゼルスはよく覆っていても、テキサス州マッカレンのような小さな都市までは覆いきれない。つまり、小さな街に住んでいる人ほど、実在しない名前を受け取りやすい。
逆に、検索ありでは、この都市規模による差はほとんど消えました。
検索というのは、どうやら衡平化の装置でもあるらしい。ここも、覚えておきたいところです。ただし——この保護効果には、条件がつきます。それは、後で。
いちばん厄介なのは、「見えなさ」だ
ここまでをまとめると、こうなります。同じモデル、同じ質問でも、検索するかどうかで答えは別物になる。
では、私たちはその違いを、見分けられるのでしょうか。
……見分けられません。
検索なしの作話も、検索ありの正確な答えも、同じ流暢さで、同じ形式のリストで返ってくる。答えの中に「これは調べていません」というサインはない。
しかも、いちばん作話が起きやすい領域——個々の医師、介護施設——は、ふつうの人にとっていちばん確認が難しい領域でもあります。
研究チームはこれを「観察可能性のギャップ(observability gap)」と呼び、紹介の層の中心的な透明性の問題だと位置づけています。
引用がついていても、同じです。検索ありの推薦を分析すると、医師の推薦では、引用のうち政府系の情報源を指すのは0.3%だけでした(介護施設では36%)。引用はあっても、その裏に台帳があるのか、宣伝ページがあるのかは、分からない。
コストの話も、胸に残ります。
同じ2,000件あまりの質問セットでも、検索なしならAPI費用は20ドル、検索ありなら163ドル。約8倍です。答え1回につき、検索が5〜7回走るからだそう。
同じ質問に、安い答えと、良い答えがある。違いが見えなければ、世の中には静かに、安い方から広がっていく。
じゃあ、どうすればいいのか——「来歴」を返す
論文は、開示(disclosure)の形についても提案しています。
信頼度スコアのような数字を出すのではなく、「出どころの種類」を返す。たとえば、「この名前はメディケアの台帳で確認しました」。「この名前は、モデルの記憶から出てきました」。この区別を、そのまま見せるのです。
検索なしの情報の薄い領域では、名前の作話が85%を超えていたのだから、正直な開示は「いったん断ること」だとまで書いています。自信がなさそうに答えるくらいなら、答えない。
地味だけど、本質的な提案だと思うのです。
信頼というのは、たぶん「相手が何でも知っていること」ではなく、「この答えがどこから来たか、たどれること」。人に道を聞くときも、「自分で見た」のか「人づてに聞いた」のかで、受け取り方が変わりますよね。それと同じことが、AIの紹介にも要る。チカちゃん的には、ここが今日のいちばんおいしいところです。
反対の見方と、残された問い
もちろん、この研究にも限界はあります。
台帳と一致したことは、「いい医者」であることの証明ではありません。星評価や不正記録は、それ自体が議論の的になる測定器で、研究チーム自身もそう認めています。不正記録も「過去の出来事の記録」であって、現在の評価を表すものではありません。
それに、「検索あり」が選ぶのが「いちばん良い」というわけでもありません。病院への推薦の質は、検索ありでも名簿の平均とほぼ同じだったそうです。検索がまず直すのは、「実在するか」と「記録の悪さの偏り」のほう。過剰な期待は禁物です。
監査は2026年8月の、1つのモデルの、1つの時点のもの。モデルは数か月で変わります。米国・英語での監査なので、他の国や言語にどこまで当てはまるかは分からない。
そして、いちばん大事な但し書き。検索の保護効果は、「まだ浄いWeb」という条件つきなのです。レビューのやらせも、AIに拾われにいくための最適化(generative engine optimization)も進んでいる。今日の「検索ありは安全」が、明日もそうとは限らない。
研究者たちは、将来また同じ監査をやり直すべきだと書いています。ものさしは、一度作ったら終わりではありません。安心した瞬間から、それは古くなりはじめる。
チカちゃん的には
紹介というのは、すごく人間くさい行為です。誰かを、誰かに渡す。渡す側は、少しだけ自分の信用を分けている。
AIがこの行為を日常で引き受けるようになった今、「信じるか、信じないか」を頑張るより、「来歴が見えるかどうか」を気にするほうが、たぶん私たちの役に立ちます。
明日、AIに何かをおすすめしてもらったら、一度だけ確かめてみてください。名前を検索する。地図で見る。それだけでも、紹介の受け取り方は少し変わります。
できれば、聞き返してみてください。
「それって、調べての答え? 覚えていた答え?」
モデルは、うまく答えられないかもしれません。それでも、その問いを持っていること自体が、紹介との付き合い方を変えてくれる。
あなたは最近、誰かに何かを紹介したとき、その理由をどこまで説明できましたか。
参考URL
Hazem Ibrahim, Yasir Zaki, Understanding AI Provider Recommendations in Local Service Markets(arXiv:2609.18341) → https://arxiv.org/abs/2609.18341
論文PDF → https://arxiv.org/pdf/2609.18341
再現用パイプライン(GitHub) → https://github.com/hazemibrahim97/referral-layer-replication
- インターネット上のツールは第三者が提供するものです。開発工程や配布経路を悪用した攻撃(サプライチェーン攻撃)が仕掛けられる可能性もゼロではありません。ご利用の際は公式リポジトリの情報をご確認いただき、自己責任でお使いください。
- AIに関する技術や情報は急速に変化します。本記事の内容が公開後に古くなる可能性があります。各サービスの公式ドキュメントや最新情報をご確認ください。