Anthropic は 10 月 6 日、ソフトウェアの守り手に向けた Cyber Verification Program (CVP) を広げると発表した。審査を通ったセキュリティの専門家は、同社の最上位モデル Claude Mythos 5.1 と、Opus 5.5・Sonnet 5.5 を、防御の仕事向けの安全策つきで使えるようになる。
攻撃にも使える能力を、相手を選んで開く仕組みだ。個人や企業から情報が漏れる知らせが続くなかで、AI の能力がまず誰の手に渡るのかを示す動きでもある。
3 段階に分かれた入口
Anthropic の発表によると、新しい CVP は、提携先と進めてきた Project Glasswing と従来の CVP を一つにまとめたものだ。入口は 3 つある。
- 防御アクセス: 監視センターでの警告対応、事故対応、マルウェアの解析、脆弱性の分析が対象。自社や自分たちが守るシステムを持つ企業・非営利団体・大学・行政のセキュリティ部門、地方の病院や自治体の水道・電気のような重要インフラの運営者、小さなセキュリティ会社、オープンソースの保守担当者、脆弱性の報告実績がある個人の研究者が想定されている
- レッドチームアクセス: 許可を得た侵入テストまで広げる。組織だけが対象で、物理的な危害や大規模な混乱につながる操作は、使っている最中でも止められる
- 特別アクセス: 人の命に関わる安全システムの試験が対象で、米国政府と連携して審査する
一般向けのモデルでも、コードの見直し、既知の問題の修正、自分が持つコードの脆弱性探し、セキュリティ警告の仕分けには引き続き使えるという。悪意のある利用者がモデルでできることを抑えるための線引きだと、Anthropic は説明している。
4 か月で 12 万 9,000 件
発表は、この仕組みが何を見つけてきたかの数字も示した。提携先はこの取り組みを通じて、2026 年 4 月から 7 月までに、少なくとも 12 万 9,000 件の確認済みの脆弱性を見つけた。Anthropic 自身のオープンソースの調査でも、4 月から 10 月までに 5,500 件を追加で確認した。そのうち 3 万 3,000 件超が、深刻度で「重大」または「高」と評価されている。
数字は Anthropic と提携先の集計で、どの製品の欠陥がいくつ直ったかの内訳までは出ていない。それでも、防御側の AI が人の手では追いつかない数の穴を拾い始めていることは読み取れる。
AI どうしの信頼が、新しい穴になる
10 月に入って、AI エージェントの別の弱点も報じられた。Ars Technica によると、独立研究者の Syed Anas Mohiuddin 氏が、あるエージェントに仕込んだ指示が別のエージェントへ渡り、そのまま実行される弱点を示し、Google を含む 5 つの組織がこの 5 か月のあいだに弱点を認めた。エージェントどうしをつなぐ MCP (Model Context Protocol) では、受け取る側が渡す側を信頼する作りになっていることが多い。
Google のデータベース向け MCP ツールボックスの欠陥は、深刻度 10 段階で 8 と評価され、Google は接続先の IP アドレスを許可リストで絞る修正を入れた。Rapid7 の欠陥 (深刻度 2.7) は 9 月に直っている。Rapid7 の担当者は、連鎖の一つひとつは設計どおりに動いていて、それが見つけにくさの理由だと話している。
守る側の AI を、自分の暮らしでどう使うか
CVP に入れるのは、ほとんどが組織だ。個人で入れるのは、脆弱性を報告してきた実績のある研究者に限られる。多くの読者にとって、この発表の効き目は間接的に届く。使っているアプリやサービスの穴が、前より早く見つかって塞がれるという形だ。
裏返せば、届いた修正を当てるのは使う側の仕事になる。アプリや OS の更新を後回しにしないことは、守る側の AI が見つけた成果を自分の端末に取り込む、いちばん安い方法だ。
漏えいの知らせも続いている。旭化成セラピューティクスは 10 月 6 日、医療従事者向けのサイトへの不正アクセスで、最大で約 55 万 8,000 人分の情報が漏れた恐れがあると公表し、なりすましのメールに注意するよう呼びかけた。漏れた名前やメールアドレスは、本物らしい偽メールの材料になる。パスワードを使い回さない、メールのリンクから入力しない、明細を自分で確かめる。この 3 つは、AI が攻める側にも守る側にもいる時代でも変わらない。
AI エージェントにメールや予定表、ファイルをつなぐ人には、もう一つ問いが残る。エージェントは、読んだ文章に紛れた指示まで実行しうる。何を読ませ、どこまでの操作を任せるかを、つなぐ前に決めておく必要がある。
次に見ておくこと
確認できる次の一点は、Anthropic が次の新しいモデルを出すときの発表だ。CVP は今後のモデルも対象に含めるとしており、新モデルが公開と同時にこの枠に入るのか、防御側にだけ先に開かれるのかで、守る側がどれだけ先回りできるかが見えてくる。提携先の Booz Allen と Comcast が公表した利用の経験も、防御の現場で何が変わったかを知る手がかりになる。
ことば
- Cyber Verification Program — Anthropic が、審査を通った防御側の専門家に、通常より制限を緩めたモデルの使い方を許す仕組み。攻撃にも転用できる能力を、相手を確かめたうえで開くことで、守る側に先に道具を渡す狙いがある。
- MCP — AI エージェントが外部のツールやデータ、ほかのエージェントとやり取りするための共通の取り決め。つなぐのが簡単になった分、受け取った指示をどこまで信用するかが、新しい弱点として問われ始めている。
- プロンプトインジェクション — AI が読む文章やデータの中に指示を紛れ込ませ、利用者の意図と違う動きをさせる攻撃。人が読めば怪しい文でも、AI は普通の依頼として処理してしまうことがある。
あなたが AI に任せている作業のうち、読んだ文章の指示で勝手に動かれて困るものはどれだろうか?
