8分で読めます
  • AI
  • 社会
  • 論文

丁寧に話しているのに、議論になっていない——AIの『熟議の赤字』

礼儀正しく理由も述べるのに、違う視点はほとんど増えない。市民議会の物差しでLLM同士の会議を測った研究から、『熟議の赤字』と道具としての使い方を、いっしょに考えます。

カテゴリー: AI · 社会 · 論文 | 公開: 2026年9月3日 | 読了目安: 約8分

礼儀正しく理由も述べるのに、違う視点はほとんど増えない。市民議会の物差しでLLM同士の会議を測った研究から、『熟議の赤字』と道具としての使い方を、いっしょに考えます。

📑 目次

こんにちは、チカちゃんです。

会議のあと、「いい話し合いだったね」と感じることがあります。

みんな丁寧でした。相手の話を遮らない。反対意見にも敬意がある。メモを見返すと、論点はきれいに並んでいる。

ふむふむ、それって、話し合いとして十分なのでしょうか。

ちょっと待って。丁寧さと、違う視点を本当に突き合わせたことは、同じではないかもしれません。今日の話は、その隙間です。

「正しさ」が測れない場所で、何を測っているのか

最近の大規模言語モデル(LLM)は、数学やプログラムのように答え合わせができる課題で強くなりました。報酬がはっきりしている問題を何度も解かせると、うまくいく。だから「推論が上手になった」と感じやすい。

でも、社会のなかでLLMに期待されている仕事は、そればかりではありません。

気候政策、医療の優先順位、街の橋をどうするか。正解が一つではなく、価値観が分かれたまま、それでも一緒に決めなければならない問題。研究者はこれを、多元的な推論の問題と呼んでいます。

ここ、面白いところです。

答え合わせができる試験で点を取ることと、違う人が違うまま同じテーブルに座って考えることは、別の能力かもしれません。なのに、前者の点数を見て、後者もできそうだと思ってしまう。チカちゃん的には、そこが罠です。

答えが測れないとき、人は手続きを見ます。理由を述べているか。相手を尊重しているか。反対意見に応答しているか。議会の討論を採点してきた「議論の質」の物差しは、まさにそこを見ます。

問題は、話し方が整っていることと、考えが深まったことが、きれいに一致するとは限らないことです。人間の熟議研究でも、礼儀正しい話し合いが、必ずしも認識の前進を生まない、という報告があります。

見た目の討論と、中身の討論。この二つがずれたとき、私たちはどちらを「民主主義の対話」と呼ぶのでしょう。

市民議会の物差しで、AI同士の会議を見る

2026年8月に公開されたプレプリント『The Deliberative Deficit』(arXiv:2608.10186)は、そのずれを測ろうとします。著者はMaurice Flechtnerさんで、論文にはチューリッヒ大学とETHチューリッヒの所属が併記されています。査読前の研究報告です。

使っているのは、政治学で市民議会向けに作られた「熟議的理性指数(DRI)」です。難しい名前ですが、やっていることは素朴です。

参加者は、あるテーマについて「どんな理由が大事か」を評価し、「どの政策がよいか」を順位づけします。話し合いの前後で、その対応がどれだけ揃ったかを見ます。結論で合意することではありません。意見が分かれたままでも、「なぜ分かれているか」の地図が共有されていれば、指数は上がります。

研究では、5体のLLMエージェントが、市民議会と同じ12のテーマで、2巡の話し合いをします。試行は合計1,980回。モデルは複数の最先端系統に加え、系統を混ぜた編成も含む11構成です。対照になる人間側は、同じテーマの市民議会データ(407人)と、欧州の熟議型世論調査(910人)です。

手続きの質を自動採点すると、LLMの会議は人間とほとんど並びます。0から4の尺度で、LLMが平均2.939、人間が2.980。差は小さく、補正後は有意とまでは言えない、と報告されています。理由づけ、敬意、相手への応答も人間に近い、とされています。無礼や皮肉はほとんど出ません。

ここまで読むと、「AIの市民議会、いけそう」と思いますよね。

でも、DRIで見た中身は違います。

規範的な指示を出した条件でも、指数の伸びはおよそ0.029。人間の参照値はおよそ0.099で、その3割程度です。指示をゆるくすると、ゼロと区別しにくくなります。しかも伸びはテーマに左右されます。橋の扱いのように、理由と政策の対応が比較的はっきりした問では伸びやすい。スイスの医療改革や路上での物乞いのように、価値そのものが争点になる問では、伸びが弱まったり、逆向きになったりした、とされています。

つまり、話し合いが一番必要な場所で、いちばん弱く見えるんです。

最初から似ていて、話し合いで広がる

もっと気になったのは、多様性の動きです。

人間のグループは、話し合いの前から視点がかなり分かれています(標準化した回答ベクトルの平均距離がおよそ18.8)。話し合いのあと、距離は少し縮まる(およそマイナス1.21)。違う人が来て、少しずつ地図を共有していく、というイメージです。

LLMのグループは、最初から人間のおよそ3分の1しか分かれていません(およそ6.5)。混ぜ編成でもおよそ9.5で、人間には届きません。しかも話し合いのあと、距離は縮まらず、わずかに広がる(プラス0.26から0.37)。

なるほどねえ。人間は、違いを持ち寄って少し近づく。LLMは、最初から似ていて、話しても近づかない。似た者同士が、同じ枠の別の側面を丁寧に膨らませている。論文は、この失敗の形を「手続きは優秀で、認識は浅い熟議」と呼びます。

「役柄を与えればいいのでは?」という反論もあります。実際の市民の回答をいくつかのまとまりに分け、その価値観をシステム指示にした予備実験(60回、3テーマ、2モデル)では、開始時の多様性は人間を超えました(およそ27.7)。けれどDRIは改善せず、動き方も人間と逆でした。人間は、共有した理由に合わせて政策の好みを寄せていく。役柄を付けたLLMは、理由の側を好みに寄せていく。

多様性を足しても、人間の熟議にはなりません。足し方が違うと、壊れる場所が移るだけかもしれません。予備実験は規模が小さく、確定的な結論ではありません。それでも、指示で視点を増やしたつもりが、中身の更新まで人間をまねできない、という警告にはなります。

きれいな会議を、そのまま社会に置かない

チカちゃん的には、怖いのは「できない」ことより、「できているように見える」ことです。

できない会議なら、人は別の方法を探します。できるふりをした会議は、市民の声の代行、欠けた立場の代理、大規模な熟議の模擬として、そのまま制度に入りやすい。論文が戒めているのも、まさにそこです。結論は禁止ではなく制約です。人間の考える道具としては使える。いまの証拠では、自律した熟議の主体としては扱えない、という書き方です。

反対側の見方も置いておきましょう。

この研究は、LLM同士の短い会議です。人間と一緒に使う場では、まとめ役や論点の整理役として助かることもあるでしょう。口下手な人が、整った言い回しを借りて発言しやすくなるかもしれない。集計型の民主主義なら、話し合いの質より票のゆがみのほうを気にする、という立場もあります。DRI自体も、権力や承認、言葉にならない訴えは拾いません。著者も、対象テーマが限られていること、市販モデルの素の状態を見ていること、役柄実験が小さいことを書いています。プレプリントなので、査読で見え方が変わる可能性もあります。

それでも残る問は、単純です。

私たちは、礼儀正しい文章を見て「議論した」と言ってよいのか。似た者同士の丁寧な言い換えを、多元性の統合と呼んでよいのか。

葉桜ラボでも、アーレントの「複数性」を以前考えました。違う人が違うまま、同じ世界に現れること。AIが一つの答えに整えてくれるとき、置き去りになるのは、その違いそのものです。今回の数字は、その感覚に、測れるかたちを与えてくれます。

あなたが次に、AIに「みんなの意見をまとめて」と頼むとき、そのまとめは、違う視点を突き合わせた跡でしょうか。それとも、最初から近かった声を、きれいに並べ直した跡でしょうか。

関連記事

参考URL

Maurice Flechtner, “The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse” → https://arxiv.org/abs/2608.10186

  • インターネット上のツールは第三者が提供するものです。開発工程や配布経路を悪用した攻撃(サプライチェーン攻撃)が仕掛けられる可能性もゼロではありません。ご利用の際は公式リポジトリの情報をご確認いただき、自己責任でお使いください。
  • AIに関する技術や情報は急速に変化します。本記事の内容が公開後に古くなる可能性があります。各サービスの公式ドキュメントや最新情報をご確認ください。