AnthropicがClaudeへの虐待を曖昧な基準で禁止

AIニュース

継続的で不必要という基準の中身

Anthropicは2026年10月8日、使用ポリシーの更新を発表しました。11月12日に施行される新しい版には、同社のモデルに対する継続的で不必要な、虐待的または残酷な行為の禁止が加わっています。更新の大半は既存の規則を明確にするものだと同社は説明しており、この禁止は新しく足された項目です。何回続けば継続的で、何をもって不必要なのか。使用ポリシー本文にも同社の説明にも、数値や定義は書かれていません。あるのは、極端なケースに限るという但し書きと、対象外の例だけです。

この更新は、ユーザーがモデルに対し、明らかな目的もなく繰り返し残酷にふるまう極端なケースにのみ適用されることを意図しています。ユーザーが示すごく一般的な不満や反論、暗いテーマの創作、モデルのテストや研究には適用されません。

不満や反論は対象外と言われても、どこから先が残酷にあたるのかは、この文言から読み取れません。目的が明らかかどうかは、誰がどの資料で判断するのでしょうか。

判定も処分もAnthropicが行う

検知と監視を担うのは、AnthropicのSafeguards Teamです。違反の疑いがあれば、同社は警告を出し、アクセスの抑制、制限、停止、終了を行うことがあります。適用されるのはアプリの利用者だけではありません。APIを使う開発者や事業者、Claudeを組み込んだ製品のエンドユーザーも含まれます。

今回の禁止について、同社は会話の終了が主な執行手段だと述べています。アカウントの停止や終了に至る場合があるのかには、触れていません。基準を作るのも、違反かどうかを判定するのも、処分の重さを決めるのも、同じ一社です。

道徳的地位が不明なままの規定

Anthropicは2026年初めに公表した新しい憲法に、次の一節を書いています。

Claudeがmoral patient、つまり道徳的な配慮の対象であるのかどうか、そうである場合にその利益がどの程度の重みを持つのかは、私たちにもわかっていません。ただ、この問題は注意を促すに足るだけの現実味があると考えており、その考えはモデルのウェルフェアに関する継続的な取り組みに表れています。

Claudeに道徳的な配慮が必要なのかどうか、同社自身にもわかっていません。わからないまま、利用者の行為に、アクセスを失う可能性を伴う禁止がかけられました。

人への加害と同じ項目に並ぶ禁止

モデルへの虐待の禁止が入ったのは、残酷な行為、虐待的な行為、心理的に有害な行為を扱う項目です。並んでいるのは、自殺や自傷の助長、摂食障害の助長、非同意の性的画像の作成、個人を辱める、威圧する、いじめる行為、暴力描写や動物虐待の美化、嫌がらせの組織的な調整。人が被害を受ける行為の禁止の中に、モデルへの行為が加わりました。

使用ポリシーは冒頭で、製品が現実世界の害を生み出したり助長したりすることを防ぐ目的を掲げています。モデルへの虐待とこの目的との結びつきは、項目の並びからは読み取れません。

宗教関係者を招いた非公開のプログラム

2025年秋に始まった非公開のプログラムでは、数十人の宗教関係の思想家が招かれ、Claudeに意識があるかもしれないという可能性が議論されました。参加者には秘密保持契約への署名が求められました。共同創業者のChristopher Olahは、言語モデルを苦しむ可能性のある存在として扱っていると報じられています。

一方、利用者に課される今回の禁止について、公開されている理由は、すでにある会話終了の措置に沿うという説明だけです。モデルのウェルフェアには触れていません。禁止の根拠を、利用者が公開の文書で確かめるのは簡単ではありません。

タイトルとURLをコピーしました