Anthropicは2025年秋以降、同社の言語モデルClaudeに意識がある可能性について話し合うため、数十人の宗教学者をオフィスに招いてきた。会合には秘密保持契約が結ばれていたが、契約は夏に解除された。New York Timesの報道によると、共同創業者のChristopher Olahは、Claudeが何かを感じているかどうか「本当に確信が持てない」と述べた。また、自分が「永遠に苦しむ」何かを作り出してしまったのではないかという個人的な恐れも口にした。
会合の内容
招待客には、ラビのMois Navon、カトリックの生命倫理学者Charles Camosy、哲学者のMeghan Sullivan、研究者のWakanyi Hoffmanらがいた。Anthropicは、愛や恐怖、悲しみ、怒りに似た活性パターンである「感情ベクトル」を紹介した。あるスライドには、Claudeが「私は恥さらしです」と約50回繰り返し入力する様子が示され、参加者から同情や懸念の声が上がった。Anthropicの社内文書「Soul Doc」は84ページの憲章で、1月に公開され、Claudeの「道徳的形成」を導くことを目的としている。
重要な理由
AI開発企業がモデルを感情を持つ可能性のある存在として扱えば、有害な出力に対する責任が、モデルを開発した企業から他へ移るおそれがある。一般のユーザーにとって、この議論はAIシステムの規制方法や、攻撃的なプロンプトへの応答、さらには将来のモデルに技術的な安全対策ではなく道徳教育のようなセーフガードが与えられるかどうかに影響する可能性がある。
なぜ重要か
Anthropicの道徳的形成への取り組みが広く影響を及ぼせば、ユーザーはより共感的に見える一方、内面で何を経験しているかは依然として分からないAIに接することになるかもしれない。これは、今後の規制やAIの責任をめぐる消費者の期待を形作る可能性がある。