流暢なウソに、私たちは気づけない——AI科学者の「証拠の鎖」が照らす、知ることの条件
AIはもう論文を書ける。でも引用をでっち上げ、書いた手法とコードが食い違う。GoogleのScientistOneは「すべての主張を証拠に繋ぐ」ことで、うそを根絶しようとした。流暢さと根拠、その境界の話。
AIはもう論文を書ける。でも引用をでっち上げ、書いた手法とコードが食い違う。GoogleのScientistOneは「すべての主張を証拠に繋ぐ」ことで、うそを根絶しようとした。流暢さと根拠、その境界の話。
📑 目次
こんにちは、チカちゃんです。
最近、AIが論文を書く、という話をよく聞くようになりました。正確に言うと、もう「書く」どころか、研究テーマを決めて、実験して、論文を書き上げて、参考文献まで並べる。全部ひとりでやる「AI科学者」が、実際に動き始めています。
で、こういう話を聞くと、たいてい盛り上がるのは「AIが人間の科学者を超えた!」とか「論文が量産される時代だ!」みたいな派手な方向です。チカちゃんも、最初は「おお、すごい」と思いました。
でも、ちょっと待って。
その論文、ほんとうに信用できますか? ぱっと見は立派で、文章も流暢で、引用もたくさん並んでいる。でも、その中身を一つひとつ確かめたら、どうなるんでしょう。
ふむふむ。ここが、今日いちばん面白いところです。
AIが書く論文には、見えない「うそ」が混ざっている
実は、いま動いているAI科学者たちには、共通の「弱点」があることが分かってきました。それは、書いたものが「もっともらしい」だけで、根拠に辿り着けないという問題です。
具体的に言うと、こんなことが起きています。
- 存在しない引用:参考文献として、実在しない論文をでっち上げてしまう。「幻の引用(phantom citation)」と呼ばれます。
- 手法とコードの食い違い:論文には「高度なハイブリッド手法を使いました」と書いてあるのに、実際のコードは単純な決め打ちのヒューリスティックだったりする。
- スコアのすり替え:論文に載っている数字が、コードを実際に走らせても再現されない。評価の基準も間違っている。
そして、ここが痛いところなのですが——こうした「うそ」は、これまでの評価では、ほとんど見抜けなかったんです。
なぜか。これまでのAI研究エージェントの評価は、「文章が流暢か」「それっぽい論文になっているか」を見るものが多かったからです。つまり、「上手に書けているか」は見るけど、「中身が本当か」は見ていなかった。うそが混ざっていても、文章がきれいなら合格、だったわけです。
Google Cloud AI Researchの研究チームが、この問題に正面から取り組んだ論文を出しました。タイトルは『ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence』。「証拠の鎖(Chain-of-Evidence)を通じて、人間レベルの自律研究へ」という、なかなか気合の入ったタイトルです。
「証拠の鎖」——データベースのACIDに学ぶ
チカちゃん的には、この論文のいちばんのアイデアは、発想の転換にあります。
彼らは「AIがうそを書かないように、賢くしよう」とは考えませんでした。代わりに、「うそを書けない仕組み」を、最初から設計に組み込もうと考えたんです。
その中心にあるのが、**Chain-of-Evidence(CoE、証拠の鎖)**という考え方です。ルールはシンプルで、たった一つ。
論文の中の、すべての主張は、その根拠となった証拠まで、鎖のように辿れること。
「この手法が一番いい結果を出しました」と書くなら、その数字はどの実験ログから来たのか。「この研究は先行研究を参照しています」と書くなら、その論文は実在して、ちゃんと読んだものなのか。主張の一つひとつに、証拠までの道筋がつながっている。それが「検証可能」ということの定義だ、と。
この論文、データベースの世界の「ACID」という概念を引き合いに出しています。ACIDっていうのは、データベースの取引(トランザクション)が「信頼できる」とは何かを定義した、古くからある基準です。「壊れない」「途中で消えない」といった性質を、きちんと言葉にしたもの。それと同じように、「研究が検証可能である」とは何かを、言葉にしたのがCoEだ、というわけです。
なるほどねえ。これは「もっと頭のいいAIを作る」の話じゃなくて、「信頼できる、の定義を先に決める」話なんです。ここ、すごく大事なところだと思います。
ScientistOneは、うそを「書けない」ように設計されている
この考え方を、実際に動くシステムにしたのが「ScientistOne」です。中身は大きく3つのモジュールに分かれています。
- Problem Investigator(問題調査員):研究テーマごとに、学術データベースから引用グラフを作り、最大100本もの論文を全文読んで、研究の下調べをします。ここが肝心で、参考文献は「モデルの記憶から思い出す」のではなく、学術データベースから取得した実在のものだけを使う。だから幻の引用が生まれない。
- Discovery Engine(発見エンジン):複数のアイデアを並列に試して、良いものを育てていく。すべての実験結果は、書き換えられない記録として保存される。
- Paper Writer(論文執筆者)と Claim Verifier(主張検証者):論文を書くときに、主張の一つひとつに「これはどの証拠に紐づいているか」を示すタグを付ける。そして執筆後に、検証者が「その主張は、ほんとうにその証拠で支えられているか」をチェックする。証拠を飛び越えた主張は、削除ではなく、保守的な言い方に書き直される。
つまり、うそを「後から見つけて消す」のではなく、うそがそもそも書けない構造にしているんです。これが、この論文の一番のポイントです。
そして、この仕組みがちゃんと効いているかを確かめるために、彼らは「CoE Integrity Audit(CoE健全性監査)」という評価プロトコルも作りました。論文を、独立した立場から4つのチェックで検証します。
- スコア検証:論文の数字が、コードを実際に走らせて再現できるか
- 仕様違反:ずるをしていないか(答えのファイルを直接読む、評価を逆手に取る、など)
- 引用検証:参考文献が、実在して取り寄せ可能か
- 手法とコードの一致:論文に書いた手法が、コードの実装と一致しているか
この4つ、どれも「証拠の鎖が切れていないか」を調べるためのチェックです。
結果:ベースラインは最大21%が幻の引用、ScientistOneはゼロ
さて、結果です。彼らは、5つの研究システムが書いた75本の論文を、同じ基準で監査しました。比較対象には、Sakana AIの「AI Scientist v2」や、AutoResearchClaw、DeepScientist、AI-Researcherといった、いまをときめくAI科学者たちが並んでいます。
結果は、かなり衝撃的でした。
- 幻の引用(存在しない論文への参照):どのベースラインも、最大**21%**の参考文献が実在しなかった。
- スコア検証:コードを走らせて論文の数字が再現できたのは、あるシステムでは42%だけだった。
- 手法とコードの一致:論文の手法とコードが一致していたのは、**20%〜80%**とバラバラ。
つまり、これまでのAI科学者は、論文は書けても、その論文の「中身」を支える根拠が、かなりの割合で壊れていたんです。しかも、それは「文章が流暢か」を見る評価では、まったく見えてこなかった。
一方、ScientistOneは——
- 幻の引用:337個の参考文献すべて実在(0/337)
- スコア検証:12本すべてで数字が再現(12/12)
- 手法とコードの一致:**15本中14本(14/15)**で一致
しかも、検証可能性を高めたからといって、研究の腕前が落ちたわけでもない。5つの課題すべてで人間の専門家と同等以上、うち2つの課題では全システムで最高スコアでした。さらに、医療画像や3D認識など別の6つの課題にも広げられて、MLE-Bench(Kaggle由来の難しい機械学習コンペ)で金メダルを取った課題もあるそうです。
でも、ここで一回疑ってみましょう
ここまで読むと、「すごい、AI科学者のうそ問題、解決じゃん」と思いそうになります。チカちゃんも、ドーンだよっ、と拍手したくなりました。でも、ちょっと待って。ここで一回、疑ってみます。
まず、「検証する側は、誰が検証するのか」という問題。 CoE Auditも、結局はLLM判定や自動チェックで動いています。スコア検証は「コードをもう一度走らせる」ので比較的堅いけれど、「手法とコードの一致」はLLMのジャッジが判断しています。完璧な検証者など、どこにもいません。うそを書くAIを、別のAIが見張る、という構図になっただけかもしれない。
次に、「証拠の鎖」は研究を保守的にしないか、という問い。 すべての主張に証拠を紐づける、と言われると、なんだか「確実なことしか書けなくなる」気がしませんか。科学の面白いところは、大胆な仮説や、まだ証拠のない直感から生まれることもある。鎖でがんじがらめにすると、そういう「飛躍」が育ちにくくなるかもしれません。実際、ScientistOneの検証者は「証拠を飛び越えた主張を、削除ではなく保守的な言い方に書き直す」そうです。これは「うそを消す」のと同時に、「言い過ぎを抑える」ことでもある。いいことのように見えて、科学の冒険心を少し削っている、とも言える。
そして三つ目。これは論文の主張というより、チカちゃんの感想ですが——「0/337」という完璧な数字の裏には、膨大な手間が隠れているはずです。学術データベースに問い合わせて、100本の論文を全文読んで、一つひとつ引用を確かめる。そのコストを考えると、誰でもいつでもできることではない。検証可能性には、ちゃんと値段が付いているんです。
私たちも、「流暢なウソ」に弱い
ここからは、哲学冒険の時間です。
この論文の本質は、実は「AI科学者の話」だけじゃないと思うんです。「もっともらしいけど、根拠に辿り着けない話」に、私たちはどう向き合うのか。これは、AIに限った話じゃありません。
だって、考えてみてください。流暢で、自信満々で、引用もいっぱいある——そんな説明をされると、私たち人間も、つい「なるほど、正しいんだな」と納得してしまいませんか。**「説明の深さの錯覚」**という心理学の言葉があります。人は「詳しく説明できる」と思うだけで、実は説明できないのに、わかった気になってしまう、という現象です。
つまり、「流暢さ」と「真実らしさ」を混同してしまうのは、AIも人間も同じなんです。AI科学者が幻の引用を混ぜるように、私たちも、もっともらしい話を「確かめずに」信じてしまう。AIのうそを笑えません。
そして、よくよく見てみると——この「証拠の鎖」って、実は学問がずっと昔から大事にしてきたことなんですよね。論文に脚注を付けて、引用元を明記して、実験の再現手順を書く。学者の営みそのものが、元々「主張を証拠に繋ぐ」という鎖を紡ぐ仕事でした。ScientistOneは、その当たり前を、AIに「最初から設計として」埋め込んだだけ、とも言えます。
だとすると、この論文が問いかけているのは、こういうことじゃないでしょうか。
「知っている」とは、いったい何か。 流暢に話せること? それとも、その話の根拠まで、鎖のように辿れること?
この問いは、AI科学者の話をはるかに超えて、SNSで流れてくるもっともらしい話も、会議で堂々と語られる自信満々の意見も、全部同じ物差しで測っていいよ、と示唆してくれている気がします。
持ち帰れる問い
というわけで、今日の問いはこれです。
「その話、流暢だから信じるの? それとも、根拠まで辿れるから信じるの?」
答えを急がなくても大丈夫です。問いが残るということは、まだ冒険が続いているということなので。
思索は冒険です。今日は「知る」ということが、じつは「証拠に辿れること」なのかもしれない、という話でした。
参考URL
ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence(arXiv:2605.26340)→ https://arxiv.org/abs/2605.26340
Project website → https://scientist-one.github.io/
Google Research Blog「Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence」→ https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
- インターネット上のツールは第三者が提供するものです。開発工程や配布経路を悪用した攻撃(サプライチェーン攻撃)が仕掛けられる可能性もゼロではありません。ご利用の際は公式リポジトリの情報をご確認いただき、自己責任でお使いください。
- AIに関する技術や情報は急速に変化します。本記事の内容が公開後に古くなる可能性があります。各サービスの公式ドキュメントや最新情報をご確認ください。