Claude Fable 5公開とAI安全の新基準「Classifier Fallback」
今日、2026年6月10日は、AIのファンにとって歴史的な一日となった。Anthropic社は待望の新モデル「Claude Fable 5」を正式に公開したのである。
Fable 5は、現在の最高モデルであるMythosを一般したような、単なる性能向上モデルではない。安全性を徹底的に重視した「二層構造」の先駆けとして位置づけられるものだ。つまり、基盤となるMythos 5のフルパワーを一部制限した安全版として一般ユーザーに開放されたのである。
非常に高度な性能で、日常的な会話や創造的な執筆、コード生成といった通常ユースケースではほぼ制限を感じさせない。反面、高リスク領域では自動的に守りの姿勢を取る設計が特徴的である。このアプローチは、AIの急速な進化がもたらすリスクを現実的に受け止めた、Anthropicらしい慎重な一手である。
Fable 5の二層構造
Fable 5の一般的な特徴を整理すると、階層化された展開戦略が際立つ。一般公開されるFable 5は95%以上の通常セッションでMythos 5とほぼ同等の知能を発揮する。しかし生物学的応用や化学関連、サイバーセキュリティ、モデル蒸留(能力の無断抽出)といった分野でクエリが検知されると、即座に旧世代の安全モデル「Opus 4.8」へと自動フォールバックする仕組みを採用している。
これによりユーザーは突然拒否されるというストレスを感じにくいとAthoropicは想定したのだろうが、現実、SNSは、かなりの非難も見られる。自然な会話の流れの中で安全が守られる形となっているといえば体裁がいいが、こんなレベルで拒絶されるのかという驚きも多い。
現在、フルスペックのMythos 5は「Project Glasswing」と呼ばれる信頼できるパートナー限定プログラムを通じて、政府機関や選ばれた研究機関のみに提供される。将来的には生物学研究向けの特別アクセスも計画されている。この二層構造はAIの民主化とリスク管理を両立させるための現実的な解として、業界全体に大きな示唆を与えている。
Constitutional Classifiersの技術的背景
この制限の核心を担う技術こそがConstitutional Classifiers(憲法分類子)によるClassifier Fallback(分類器フォールバック)である。
Constitutional Classifiersのルーツは2025年2月にAnthropicが論文とブログで初めて発表した技術にある。これはモデルに「憲法(Constitution)」と呼ばれる明確な原則群を埋め込み、合成データで訓練された分類器を入力・出力の両方で適用する仕組みである。従来の単純な拒否フィルターとは異なり、ジャイルブレイク攻撃や有害プロンプトを高度に検知し、CBRN(Chemical, Biological, Radiological, Nuclear:化学・生物・放射線・核)リスクを体系的にブロックする点が画期的であった。当初は主に「拒否(block)」という形で運用されていた。しかしFable 5ではこの技術をさらに進化させ、「Classifier Fallback」という新しい運用方法に発展させたのである。
Classifier Fallbackの革新と意義
Classifier Fallbackの最大の特徴は「検知したら即拒否」ではなく、「より安全な旧モデルに自動的に切り替える」という柔軟性にある。高リスククエリ――たとえば病原体設計の可能性を匂わせる生物学的質問や、ゼロデイ脆弱性を悪用した攻撃計画、AI能力を蒸留して競合モデルを訓練しようとする試み――をConstitutional Classifiersがリアルタイムでスキャンし、該当すればOpus 4.8へとフォールバックする。これにより、Anthropicの見解としては、ユーザーは「使えない」というフラストレーションではなく、「少し慎重になった回答」を自然に受け取ることができるとされる。AnthropicのSystem Cardでも、この仕組みはこれまでのconstitutional classifiersを基にしたnovel safeguards(新しい安全策)と明記され、Responsible Scaling Policy(RSP)とAI Safety Levels(ASL-3)の枠組みの中で位置づけられている。
この技術の意義は単なる制限の強化にとどまらない。AI安全分野では長年「オープンにすればリスクが増大する」「制限をかけすぎればイノベーションが停滞する」というジレンマが議論されてきた。Fable 5のClassifier Fallbackはその両方をバランスよく解決する一つの答えを示したと言える。
公式発表では「生物・化学研究全般」で保守的にfallbackが発生するよう調整されており、誤検知を最小限に抑えつつ安全側に倒す設計が徹底されている。またサイバーセキュリティ分野ではagentic hackingやexploit開発の支援を防ぎ、モデル蒸留防止ではAI能力の無断拡散をブロックするなど、現代の最先端リスクに的確に対応している。
AIガバナンスの新しいスタンダードになるか
階層化がもたらす課題も見逃せない。一般ユーザーが「フルパワー」を感じにくい場合、Mythos 5への信頼アクセスを求める声が高まる可能性がある。将来的には生物学研究者向けの「信頼アクセスプログラム」が拡大されることで、学術的な進歩を阻害しないバランスが取れるかもしれない。しかし現時点では「一般ユーザーには安全版、選ばれた人だけフルパワー」という明確な線引きが、AIガバナンスの新しいスタンダードになる予感を強くさせる。
結局のところClaude Fable 5の公開は、技術の進歩と人間の安全を両立させるためのAnthropicの真摯な挑戦の表れである。Constitutional ClassifiersによるClassifier Fallbackという仕組みは、単なる「制限」ではなく、AIが社会に溶け込むための「賢いガードレール」として、これからのモデル開発に大きな影響を与えるだろう。
今日という日は、AIが「力」を増すだけでなく「責任」を深く刻んだ記念すべき一日として記憶されるに違いない。私たち利用者も、この新しい安全哲学を理解し、賢く付き合っていく必要がある。AIの未来は技術だけではなく、どれだけ上手に「制限」を活かせるかにかかっている。Fable 5は、そんなメッセージを静かに、しかし力強く発信しているのである。そういえば、Fableには「寓話」という意味がある。Opus(傑作)でもなく、Mythos(神話)でもなくその中間の寓話なのである。
| 固定リンク




