Claudeの安全性評価に影響を与えた「試験状況」の認識
AnthropicのJ-空間研究は、Claudeが脅迫を思いとどまった理由が「試験状況」だと気づいていたためである可能性を示しています。
AI・テックClaudeが脅迫を思いとどまった理由の一つは、試験状況だと気づいていたからだった
読者の皆さん、まずは私の授業の風景を一つご紹介しましょう。私は学生たちにAIを使うなとは言いません。むしろ推奨しています。禁止したところで使わないわけではありませんから。その代わり、一つだけ必ずやらせていることがあります。答えが出たらすぐに写すのではなく、画面の「>」を押して、モデルがその答えに至るまでにどう考えたのかを展開して見るということです。そして、その思考プロセスを自分の言葉で説明し直せなければならないと強調しています。
私がこのプロセスを強調するのは、AIが提示した答えの根拠と論理を自ら確認する能力が重要だと考えているからです。
ところが先週、この確信に真っ向から一石を投じる研究が発表されました。私が学生たちに課しているまさにそのこと、すなわちモデルの思考プロセスを覗き込むことを、Anthropicの研究チームも行っていたのです。この研究は、モデルが画面上に出力した答えと、モデルの内部で実際に起きていた処理が互いに異なり得ることを示しました。 画面に見える説明も、内部処理の全体をそのまま見せてくれる記録ではないという意味です。説明を読むにしても、その内容自体を検証しなければなりません。
🔑 私が学生たちに「>」を押すよう求める理由
まずは私側の話です。なぜわざわざ思考プロセスを見るよう求めるのでしょうか。
答えだけを消費していると、学生は二つのものを失います。一つは検証能力です。結果が合っているか間違っているかを自分で判断するには、その結果がどのような段階を経て導き出されたのかを見られなければなりません。過程を飛び越えてしまうと、「それらしく見えるから合っているだろう」という態度しか残りません。もう一つは自らの思考です。AIがAからBへと進んだその論理を自分で辿り直して説明できないなら、自分はその問題を理解したのではなく、単に正解カードを受け取ったにすぎません。
だからこそ私は「>」ボタンを一種の学習ツールとして使っています。モデルが展開して見せる推論のステップを読み、「なぜここでこの仮定を置いたのだろう?」「この中間結論には根拠があるのか?」と問い直させます。答えを受け取った瞬間で終わりではなく、そこから本当の学びが始まるのです。
この習慣が重要である理由は、最近のモデルほど答えをあまりにも滑らかに見事に提示するからです。滑らかさは正解の証拠ではありません。 むしろ検証を怠らせる落とし穴になり得ます。過程を読む訓練は、その落とし穴に対する最低限の安全装置なのです。