実質的な中身のあるものを AI に書かせるべきではないと私がほぼ常に考える理由

AI にブログ記事、リサーチレポート、メモのような実質的な内容のテキストを書かせるのは、十分な要点と文脈を与え、後から自分で編集したとしても、ほぼ決してすべきではないと著者は主張する。書くこと自体が思考であり、AI の文章は気づきにくいところで曖昧に誤り、明示しなければ失礼かつ人を誤導するからだ。

日本語
コピー
一张黑白抖动噪点风格的插画:一个人伏在桌前,右侧一台笔记本电脑的屏幕发亮

私は、AI に書かせること——つまり、ブログ記事、調査報告書、メモ、心を込めたメール、小説、その他なんらかの考え・論証・分析、あるいは実質的な中身を持つ1思考を伝えることを目的としたあらゆるテキストを、紙の上に文字を打ち込むときのあの行為を AI にやらせること——は、ほぼ常に避けるべきだと考えている。AI に非常に詳細な箇条書きや口述したアイデア、その他の文脈を与えたとしても、AI が書いた文章を後から編集したとしても2、私の考えは変わらない。

理由は三つある。(1) 書くという過程は考えるという過程の不可欠な一部である。(2) AI が書くものは曖昧で、しかも間違いが見つけにくい。(3) AI で書いてそれを明示しないのは、失礼であり誤解を招く。以下で詳しく述べるが、その前に少し前置きを。

すでにご存じかもしれないが、私は AI に反対しているわけではない。研究や執筆の流れには、AI を使うのが合理的な工程がほかにもたくさんある。音声の文字起こし、データ分析、情報検索、ブレインストーミング、草稿へのフィードバックなどだ。行単位の編集や校正、あるいはある段落をより明確に、より簡潔に書き直すのに AI を使うのも問題ないと思う。ただし、一つ一つの変更を人間が意図的に採用するか却下するかを決める場合に限る。私が反対しているのは、本文を AI に書かせることだけだ。3

確かに、AI で書くことには利点が多い。自分で書くよりはるかに楽で、はるかに速い。だから、それが全体として悪いことだと判断するには、その欠点が十分に大きくなければならない。もうお察しだろうが、私はその欠点は十分に大きいと考えている。

最後に一つ。私が主張しているのは、現在存在する AI モデル、および近い将来に存在すると私が予想する AI モデルについてだけだ。将来、文章を任せられるほど優れたモデルが現れるだろう(とはいえその頃には、研究や執筆の流れ全体を端から端まで任せるほうが合理的かもしれない。書くこと以外に、思考の全部あるいは大部分も担う必要があるのだから)。

書くという過程は考えるという過程である

どんな研究であれ、その目的は重要な問いについて正確な見解を形成し、それを読者に伝えることにある。私の考えでは、それを実現する最良の方法の一つが書くことによって考えることだ。

Paul Graham はこう書いている4

何かについて書くと、たとえよく知っていることでも、たいていは自分が思っていたほどには理解していないと気づかされる。アイデアを言葉にすることは厳しい試練だ。[…] 記事に最終的に載るアイデアの半分は、それを書く過程で初めて出てくる。これこそが私が書く理由だ。

Patrick McKenzie のポッドキャストのある回で、Clara Collier はこう言っている:

実質的な中身のあるものを書いているとき、書く過程のどこにも、考えていなかったり考えを変えていなかったりする部分はない。アウトラインを立てるときも、それを文章に変えるときも、一つの文を書くときもそう。よくあるのは、アウトラインを原稿にしようとしていて、つなぎの文を考えているのだけれど、どうしてもうまくつながらない。そこで気づく。ああ、このつなぎがうまくいかないのは、この二つの点をそもそも並べるべきじゃなかったからだ。ここでやろうとしていること自体が間違っていたんだ、と。もしアウトラインを LLM に渡したら、それは立ち止まって、このアウトライン自体がおかしいかもしれないと考えたりはしない。[…]

Patrick はこう応じている:

書く過程が考える過程だというのは完全に同意だし、今は実証もあると思う。書く機械を作ると、思考が副作用として直接 湧き出てくる。でも、何ページにもわたるものを書くときは、たとえ強い論点を持っていても、それを文と段落にして、論証を構造化するよう自分に強いる過程で、論証の穴がどこにあるかが見えてくる。自分の調査がどこで足りていないかも見えてくる。それに、こういうことも掘り起こされる。ああ、実は自分の言いたい結論と矛盾するものがある、と。まともな倫理感のある人間として、反論の存在を認めるか、完全に成り立つ結論は自分が「書きたい」と思っていた結論より小さいと付け加えざるを得ない。

これらの見方に私はほぼ同意する。何かを書くとき、私はまず自分が何を言いたいのかを知らなければならない。つまり、証拠と論証を考え、最終的に何らかの見解を形成しなければならない。だから書くことは私にそれを強いる。そしてそれはどんな執筆や研究のプロジェクトにも必要なことだ。そうしたプロジェクトでは、誰かが全体を頭の中に収めておかなければならない——すべての証拠、考慮事項、論証、そしてそれらがどう噛み合うかを。AI で書くと、こうした必要な思考を避けやすくなる。

AI が書くものは曖昧で、間違いが見つけにくい

私が書くときは、具体的な語の選択や言い回しについて、大量の小さな決定を下す。こうした小さな決定が積み重なって、テキスト全体の明晰さと正確さができあがる。

一例を挙げよう。Claude Fable 5 に「AI チップの密輸という問題について短い文章を書いて」と頼んでみる。この話題はすでに書かれ、大々的に報じられてもいる。返ってきたのはこれだ:

2022年10月以降、米国は中国への先端 AI チップの輸出を制限し、中国の AI フロンティアでの進展を遅らせようとしてきた。だが輸出管理の実効性は執行にかかっており、AI チップは小さく、極めて高価で、複雑に絡み合ったグローバルサプライチェーンを通じて販売される——こうした性質が、密輸するに値し、かつ密輸しやすいものにしている。さまざまな転送ネットワークが、規制対象の GPU をシンガポール、マレーシア、アラブ首長国連邦などの仲介業者を経由して転売し、ペーパーカンパニーと偽造書類を使って中国に運び込んでいる。その規模の推計は大きくばらつき、年間数万個から、おそらく10万個以上のハイエンドチップに及ぶ。低めの推計でも、その計算能力は有能な AI システムの訓練と展開に影響を与えるのに十分だ。一方、この数千億ドル規模の貿易を監督する米国産業安全保障局(BIS)の予算と人員は、はるかに小さい問題に対応するのに適した規模にとどまっている。したがって、チップ密輸は米国の AI 政策の中心的支柱の一つを、気づかれないうちに空洞化させる可能性がある。

この段落は悪くない、むしろかなり合理的と言ってもいい。だが、これは自分が書く書き方だろうか?違う。実際、Claude は私が微妙に誤っている、あるいはまずいと考える選択を数多くしている。

  • Claude は「輸出管理の実効性は執行にかかっている」と書くが、これはどういう意味か。当たり前のことを言っているだけか(執行されない、あるいは執行が甘い政策の効果が劣るのは当然だ)、さもなければ何も言っていない。5
  • Claude は AI チップが「小型でかさばらない」と書く。それは正しいが、密輸されるのは普通 AI サーバーであり、サーバーはかさばらないとは言えない。ただ、もっと重要なのは、この点は実はどうでもいいということだ。AI チップの密輸は、貨物を隠して税関をやり過ごすという方法ではほとんど行われない。たいていは製品を別の貨物として再ラベル付けして、いわば堂々と送り出しているだけだ。
  • Claude は、AI チップが「複雑に絡み合ったグローバルサプライチェーンを通じて販売される」ため、「密輸する価値があり、密輸しやすい」と書く。これはどういう意味か。密輸業者がアメリカ国外の企業からチップを買いやすくなっているということか?(つい最近まで、密輸業者はアメリカに本社を置く企業からかなり楽に AI チップを調達できていたようだ。)密輸業者がマレーシアのような国で AI チップを大量に仕入れれば目立たないということか?(こちらの方が実情に近いと思う。)それとも何か別のことか。
  • Claude は、密輸の規模の推定値は「年間数万個から、おそらく十万個以上の高性能チップまで、大きく幅がある」と書く。文字通りには正しいが、低い側の推定はほぼ確実に誤りで、実際の数字はおそらく Claude が挙げた上限、つまり数十万個に近い。6 つまりこの文はミスリードだ。加えて Claude はどの年の話かを示しておらず、密輸量は 2022 年 10 月以来大きく変動している。また Claude は何をもって「高性能」チップとするかも示していない(サウジ王家の一員や貴族の未亡人にだけ売られる、手作りの高級品のような響きだ)。
  • Claude は「低い側の推定でも、有能な AI システムの訓練と展開に影響を与えるだけの計算能力がある」と書く。この文は何の情報もない。ある意味では、AI チップが 1 個でも、そのシステムが有能であれ何であれ、AI システムの訓練と展開に「影響」はある。(そもそも「有能な AI システム」とは何か。なぜ少量の計算能力が、有能な AI システムに対して、そうでない AI システムに対するよりも大きな影響を与えるのか。むしろ逆ではないかと思えてくる。弱い AI システムの方が少量の計算能力から恩恵を受けやすいはずだ。)
  • Claude は、産業安全保障局(BIS)が「この数千億ドル規模の貿易を監督する」責任を負うと書く。ここは数字をそのまま出した方がよい。
  • Claude は、BIS の「予算と人員は、はるかに小さな問題に対処するのに適した規模だ」と書く。第一に、BIS の予算と人員は分かっているのだから、その数字を出して文脈を説明した方がよい。第二に、問題が「より小さい」とはどういう意味か。重要度が低いということか、解決に必要な手間が少ないということか、それとも別のことか。本当に重要なのは、BIS に資源を増やせば執行が大幅に改善する可能性が高いという点であって、BIS の現在の資源規模が別の問題にこそ適しているという話ではないのではないか。
  • Claude の最後の文、チップ密輸が「気づかないうちにアメリカの AI 政策の中心的な支柱の一つをむしばむ可能性がある」というのは、情報量ゼロの拍手灯でしかない。

記事にこうした問題が一、二箇所あるだけなら大したことではないかもしれないが、私の経験では、AI が書いた文章にはこの種の不要な曖昧さと微妙に誤った表現が非常に密集している。注意してほしいのは、書面のメモやアウトラインなど、大量の文脈を AI に与えてもこの問題は残るということだ。7

同様に、Eric Schwitzgebel はこう書いている

人間の専門家は LLM とは違う仕方で、そしてよりよく考える。その言葉遣いは、ごく微妙なものであっても、本人が意識していないかもしれない感受性を反映している。一般に、専門家が書いた文章は、言語モデルの出力よりも、その専門家が専門とする領域によく即している。[…] こう反論するかもしれない。もちろん LLM の出力は送信前に読むし、一字一句納得できなければこのメールを送ったり、この記事を投稿したりはしない。だから自分は文中で表現された考えを確かに考えたのだ、と。この文章は専門家としての自分の最善の判断を反映している——いや、最善の判断よりも少し良いもの、つまり自分の専門的判断に LLM の専門知識を足したものを反映している、と。私の答えはこうだ。読みながらうなずくことと、実際に生産的に文章を生成することの間には、認知上の大きな違いがある。理由は二つ。第一に、文字がページに落ちてしまえば、人はそのまあ適切な言葉を容易に受動的に受け入れてしまい、自分で一から文章を生成するときのように、同じだけ骨の折れる能動的な仕方で言葉を吟味したりはしない。第二に、先にも述べたように、人間は、専門家であっても、自分の言葉遣いを形作るすべての要素、つまり自分が感受性を持っている物事を、うまく自覚できていないのではないかと思う。あなたは少し違う言い方をするだろうし、自分がそうしていること、ましてその理由に気づかなくても、送られる信号と受け取られる信号は異なっている。

私もこの説に同意する。だが実態はこれよりはるかにひどい。AI は不要に曖昧で微妙に誤った文章を書くだけでなく、それをほぼ最大限に説得力のある形で書く。AI が、書かせた事柄を本当に「知って」いなければ、たいていは知らないと立ち止まって教えてはくれない。代わりに、真になり得る程度に曖昧でありながら何の意味もないことを書くか、本当に聞こえるが実際には真でない、あるいは真とは限らないことを書く。人間ももちろんよく間違えるし、よく曖昧になる。だが、私たちの間違い方や曖昧さは、たいていここまで説得力がなく、もっと気づきやすいものだと思う。

先ほど AI チップ密輸の段落を分析したように、AI が書いたテキストを読み通し、小さな欠点をすべて拾い上げるには、かなりの労力がいる。私が AI チップ密輸についてあまり知らなければ、この段落を長く考え込まない限り、挙げた問題の大半は気づけなかっただろう。だが、この文章を自分で書いていたなら、自分がどこで混乱しているかに気づかないはずがない。

AI で書いたのに明示しないのは、失礼で誤解を招く

自分が書いた文章を、他人に読ませるつもりで書くことがある。ネットに公開したり、同僚に意見を求めて送ったり、メールとして送ったり、出版社に持ち込んだりする場合だ。公開や共有をするとき、読む側はたいてい、書き手がその文章に手間をかけたはずだと期待している。とりわけ、その文章が_自分の_考えを表していると期待している。少なくともそう期待されるべきだし、自分もそう期待してほしい。これは読者と書き手の間の暗黙の契約だ。読者は注意というコストを払い、書き手は情報や娯楽といった何か価値あるものでそれに応える。

Patrick McKenzie のポッドキャストの同じ回で、Clara Collier はこうも言っている。

気取って聞こえるかもしれないけど、LLM が書ける私の記事みたいなものには、私が補える何かがいつも欠けている。これも、モデルのほうが私より詳しい領域がたくさんある、という話ではない。でも、誰でもいつでも Claude に聞けばいい。私が書いたもの、あるいは編集者として私が選んで目の前に置いたものを読むのは、そこに暗黙の契約があるからだ。私が提供するのは、ほかでは手に入らないものだ。モデルに直接聞くより、時間をかける価値がある。だから私は LLM が生成した文章をそのまま使わない。使うとしても、あなたが時間をかける前に、それが何なのかをはっきり伝えておきたい。

さきほど書いた、微妙な誤りや曖昧さの話、そして文章が AI に書かれたものなら書き手がどれだけ手間をかけたか分からないという話は、どれもこの契約の違反だ。だから、ある文章を読んで、その全部または一部が AI に書かれたと分かったとき、その文章と書き手への信頼は即座に下がる。そしてこの低下は理性的だと思っている。

以上のことから、AI に書かせた文章を宣伝したり、AI に書かせた草稿を人に送ったりするのは失礼な行為だと考えている。雑な草稿を、それが雑であることを隠したまま人に送るのに少し似ている。そして AI が書いた内容をはっきり示さない限り、読者を誤解させる。読者はあなたの文章が_あなたの_文章で、よく考え抜かれ、具体的に_あなたの_見解を表していると期待するからだ。

もちろん、AI が書いたもの、あるいは実質的に AI が書いたものだと明示すれば、失礼と誤解の両方は避けられる。ただ、ほとんどの人はそうしたくないだろう。

例外はないのか

問:AI が書いた内容を_はっきり明示すれば_、記事に入れてもいいのか。答:いい。私の見方ではほぼ問題ない。たとえば、ある事柄について浅くしか知らず、ある情報を Claude に頼ったうえで「Claude Fable 5 によれば、状況はこうだ」といった文を書くことはある。8 その一つの記述のために大量の時間をかけて検証する価値がないときには役に立つ。大事なのは、出力を AI が書いたものとはっきり示すことだ。そうすれば読者は、それを割り引いて受け取るかどうかを自分で決められる。

問:では全体をそう処理すればいいのではないか。答:中身のある文章を_丸ごと_ AI に書かせるのは、ほぼ常に良い考えではないと思う。AI が書いたと明示していても、少なくとも人に読ませるつもりならそうだ。理由は二つある。第一に、結果は自分で書くよりずっと劣る可能性が高い。第二に、AI が書いたと明示すれば、人は(当然ながら)読まない。読者が自分一人だけの場合でも、AI に書かせるのはたいてい間違いだと思う。前の二節で挙げた利点を失うからだ。

問:英語が母語ではなく、英語で書くのが苦しい。AI に英語を書かせてもいいか。答:開示しない場合も含めて、これは許容できるという主張をときどき聞く。以上に挙げた理由から、私は同意しない。母語で書いたテキストをAI に翻訳させるのは許容できると思うが、それでも開示したほうがいいと感じる。全体として、AI は要点のメモから草稿を起こすときよりも、翻訳のときのほうが明晰さと正確さを保てるという印象を持っている。

問:重要な場合、たとえば AI 関連の政策メモを書く場合、AI でこうした必要な執筆を加速することが重要で価値がある、というのはどうか。答:AI で書くことで実際にどれだけ速くなるかは疑問だ。というより、実際に速くなるのは質を犠牲にしたときであり、質を限界的に犠牲にすべきではないと考えている。たとえばワシントンは、ほとんど誰も読まない報告書やイシュー・ブリーフでとっくに溢れかえっている。本当に希少で、政策決定者に本当に役立つのは、重要な争点についてのより正確で、より考え抜かれた分析だ。

Footnotes

  1. 調整や事務的な役割が主の短いテキストを AI で書くのは、場合によっては問題ないと思っている。たとえば会社で、短くて非常に定型化したメールを繰り返し書く必要があるなら、AI に下書きさせ、送る前に少し編集するのは問題なさそうだ。

  2. ここには一つか二つ例外があるかもしれない。たとえば、AI が書いた文章を自分で極めて厳密に検証し、大量に編集したなら、もしかすると許容できるかもしれない。だが、そうではないかもしれないし、そうするのは最初から自分で書くより楽でも速くもなさそうだ。実際にこれで速くなるのは、やはり質を犠牲にしたときだと思う。

  3. AI をブレインストーミングや分析に使うのは賛成だが、この二つも同じように骨の折れる思考を要する。これは矛盾しているか。よく分からないが、自分の見解を文章に書き下すという関門にも同時に通すなら、AI をこうした用途に使うのはおそらく問題ないと思う。

  4. 彼は後に AI を専門に扱った記事でこの論証を再び論じている。

  5. この文にはほかの読み方もあるが、どれも正しくないと思う。たとえば「輸出管理の実効性は執行にかかっている」を、輸出管理制度全体の良し悪しとその執行の良し悪しを何らかの形で数値化できたとして、ある点を超えると執行が改善しない限り制度自体はそれ以上改善できない、という意味に読むこともできる。しかしこれは成り立たないと思う。輸出管理を改善する方法はほかにも、たとえば輸出政策を調整するなど、たいてい残っているからだ。

  6. これは自業自得なのだが、2023年10月の時点で私は将来のAIチップ密輸の規模を過小評価していた。そしてそれがFableの訓練データに入り込んだ可能性がある。あのレポートには正しい点が多くあったと思う。AIチップ密輸の仕組みの説明も、私の政策提言もそうだ。ただ、問題の規模についての予測はおそらく一桁外していた。当時、根拠にできたのは地味なロイターの記事一本だけで、内容は深圳での小規模な闇市場の話だった。

  7. たとえば、私は会議の議事録をClaudeで要約して同僚に共有することがある。自分で書いた議事の要点をいくつか例として入れた、注意深く書いたプロンプトを使っても、Claudeには完全な議事録が渡っているのに、微妙な曖昧さや誤りが混入する。(ちなみに、そうした誤りのかなりの部分は、私が文脈を提供しようとしているにもかかわらず、Claudeがこれらの要点を誰が読むのか、その読者が何を知っていて何を知らないのかをよく理解していないことが原因のようだ。)

  8. おまけとして、どの具体的なモデルが出力を生成したのかを示すのも良さそうだ。

出典: Erich Grunewald's Blog← ホームへ戻る