<ニュース概要>
Anthropicが、言語モデルの内部に”意識のグローバルワークスペース”のように振る舞う疎な領域「J-space」を特定しました。Jacobian lensという手法で、モデルが次に出そうとしている内容を層ごとに読み取れ、そこを書き換えると出力自体が変わることを実証(例:内部の「Soccer」を「Rugby」に変えると答えも変わる)。安全性の新しい足がかりです。
<あなたが明日からできること>
【バックオフィスはこう変わる】
「AIは中身が見えないから怖い」という理由での利用回避が減り、”内部を検証できるAI”を前提に、より重要な業務へ任せる判断がしやすくなります。出力の正しさだけでなく、AIがどんな前提で動いたかを確認できる方向へ進んでいきます。
【今日からの5分トライ】
いつも使うAIに同じ質問を2回、片方は前提条件を1つだけ変えて投げ、答えがどう動くかを5分で見比べてみましょう。「AIは前提に敏感で、少しの違いで結論が変わる」という感覚が体で掴めます。これは、AIの回答を鵜呑みにしないための最も手軽な訓練になります。
<出典>
出典:Anthropic(Transformer Circuits)・2026/7
https://transformer-circuits.pub/2026/workspace/index.html
