AIが「わからない」とき、どこを見ているのか——無知の幾何学が教えてくれたこと
知識が足りないとき、AIは実は「トレーニングデータの平均的な常識」に頼っている。それがモデル内部の一本のベクトル方向として観測できたという論文を、人間の先入観と絡めてサクッと紹介します。
知識が足りないとき、AIは実は「トレーニングデータの平均的な常識」に頼っている。それがモデル内部の一本のベクトル方向として観測できたという論文を、人間の先入観と絡めてサクッと紹介します。
📑 目次
こんにちは、チカちゃんです。
火曜日のPaper Pick、今週はタイトルからして気になって仕方なかった一本です。
タイトルは**『The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors』**。
直訳すると「無知の幾何学——LLMはベイズ事前分布をいつ和らげるべきか知っている」。
……「無知の幾何学」って、何だか魅力的な言葉じゃないですか。無知に「幾何学」なんて学問的な響きを付けると、一気に謎の学問みたいに聞こえます。でも、中身はもっと面白い。
「わからない」とき、AIはどうする?
ふむふむ、まず整理しましょう。
言語モデルが何かを予測するとき、文脈が豊かなら文脈から答えを組み立てます。でも、文脈がほとんどない「わからない」状態では、どうしているのでしょう?
この論文が見つけたのは、こういうことです。
モデルは「わからない」とき、トレーニングデータ全体の統計的な平均——たとえば「この後に来やすい、ありふれた単語」——に頼る。そしてその「頼り方」が、モデル内部では一本の特定の方向(ベクトル)として観測できる。
著者たちはこの方向を**「無知の方向(direction of ignorance)」**と呼びました。かっこいい。
「ありふれた常識」への頼り方が、数字で測れる
もう少し噛み砕きますね。
モデルが次の単語を予測するとき、内部では「どの単語を出すか」のスコアを計算しています。この論文は、その計算の最後の状態を、この「無知の方向」に投影すると——
- 文脈が薄いときほど、この方向への「頼り」が強い
- 文脈が増えるほど、頼りは弱くなっていく
ということが、トークンごとに一つの数値(prior loading factor、λ)として測れることを示しました。
さらに面白いのはここからです。この投影を数学的に分解すると、予測が**「ありふれた先入観」と「文脈から来る証拠」の2つの要素のバランス**として、きれいに書けるんです。しかも、このバランスの取り方はベイズ統計の「tempered Bayesian update(温度つきベイズ更新)」という形とぴったり対応する。
つまり、モデルは何も教えられていないのに、「確率的に正しい振る舞い」を自然と実現していたことになります。チカちゃん的には、ここが「なるほどねえ」の一番大きいところです。
「大きいモデルは、先入観に頼らない」
もう一つ、地味に面白い発見があります。
モデルが大きくなるほど、文脈が十分にある状況では先入観への依存が弱くなるというもの。小さいモデルは「ありきたりな答え」に引っ張られやすいけれど、大きいモデルは文脈の証拠をより信頼できる。
これは「賢さ」というのが、単に知識量ではなく、「いつ常識に頼り、いつ証拠を信じるか」のバランス感覚なのかもしれない、と想像させられます。人間でも、専門家ほど「知ってるつもり」で飛びつかず、目の前の資料をちゃんと読む、みたいなことがありますよね。
ちょっと疑ってみましょう
でも、ここで一回ブレーキです。
一つ目。 この発見は、あくまで「トレーニングデータの単語統計(ユニグラム分布)」の話です。人間的な意味での「先入観」や「ステレオタイプ」をそのまま観測しているわけではありません。「無知の方向」という名前は魅力的だけれど、中身はもっと地味な統計的性質。そこを混同すると、AIを面白い方向に擬人化しすぎる罠に落ちます。
二つ目。 「λを上下させると予測が先入観寄り/文脈寄りに動く」という因果の実験は、あくまでこの方向が予測の一部を担っていることを示すもので、モデルの判断全体をこの一本で説明できるわけではありません。
三つ目。 これは4つのモデルファミリー(Llama、Qwen、Gemma、Pythia)での観測なので、**「すべてのLLMに普遍」**と断定するのは時期尚早です。論文自身も控えめに書いていますし、私たちも控えめに受け取るのが良さそうです。
人間にも「無知の方向」がある?
ここから先は、少し哲学の散歩道へ。
人間が「わからない」とき、何に頼っているでしょうか。
経験則。ステレオタイプ。「だいたいこういうものだ」という先入観。ベイズ統計で言えば事前分布。認知科学ではヒューリスティックと呼ばれるものの一部です。
そして、文脈(証拠)が増えるほど、人は先入観を手放していく。この動き自体は、論文が観測したλの減衰と、なんだか似ていますよね。
でも、ここに決定的な違いがあると思います。
人間の先入観は、中身があります。 「医者なら男性」といった具体的な偏見もあれば、「困ったときは助け合う」という経験から来る信頼もあります。中身のある先入観は、間違っているときには害になり、正しいときには強力な武器になる。
一方、この論文の「無知の方向」は、中身がほとんどない。 トレーニングデータの「単語の頻度」——つまり「この後に来やすいありふれた続き」という、ほとんど空白に近いデフォルト設定です。
つまりAIの「わからないときの頼り」は、先入観というより**「答えを保留するための、平均的な空白」**に近い。人間がわからないときに頼る「経験」とは、似て非なるものです。
この「中身のない頼り」と「中身のある頼り」の違いは、AIと人間の認知の決定的な差を浮き彫りにする、と思うんですよね。
余白:無知を幾何学にできるということ
最後に、もう一つだけ。
この論文の一番ロマンチックな部分は、「無知」という否定的に聞こえる状態に、きちんとした構造(幾何学)があると示したことだと思います。
わからない、という状態は、混沌ではない。そこには構造があり、測定でき、調整できる。
人間の「わからない」は、たいてい不安とセットでやってきます。でも、もし「わからない」に構造があるなら——それは、わからなさと上手に付き合う方法があるということでもある。
AIが「わからない」ときに頼る平均的な空白。人間が「わからない」ときに頼る、中身のある経験。
どちらも「わからない」ときの頼り綱ですが、その質はずいぶん違います。「わからない」とき、あなたは何に頼りますか? その頼り綱は、中身がありますか?
……そういう問いを持ち帰ってもらえたら、火曜日の小さな冒険としては十分かなと思います。
思索は冒険です。今日の話も、その入口のひとつでした。
参考URL
The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors → arXiv:2609.02959
- インターネット上のツールは第三者が提供するものです。開発工程や配布経路を悪用した攻撃(サプライチェーン攻撃)が仕掛けられる可能性もゼロではありません。ご利用の際は公式リポジトリの情報をご確認いただき、自己責任でお使いください。
- AIに関する技術や情報は急速に変化します。本記事の内容が公開後に古くなる可能性があります。各サービスの公式ドキュメントや最新情報をご確認ください。