Anthropic が Claude に AI を直させた48時間——直せたのは、物差しのある失敗だけだった
48時間と GPU 1枚で、Claude は10種類の欠陥すべてに改善策を見つけた。ただし直せたのは、あらかじめ点数のつく失敗だけだ。測る道具のない失敗は、直っていないのではなく数えられていない。
INDEX · KEYWORD
「Anthropic」に関連する公開記事をまとめています。
48時間と GPU 1枚で、Claude は10種類の欠陥すべてに改善策を見つけた。ただし直せたのは、あらかじめ点数のつく失敗だけだ。測る道具のない失敗は、直っていないのではなく数えられていない。
Anthropic が MHS の研究プレビューを始めた。機器が自分の「できること」と安全上限を申告し、AI がそれを読んで操作する仕様だ。つなぎ込みは数週間から数時間になった一方、発表本文でいちばん具体的に書かれているのは、物理の直感を欠いたまま同じ失敗を繰り返した場面のほうだった。
人が AI をどう使い、どう影響を受けているか。これまでその研究は開発元の中でしかできなかった。Anthropic が3つの研究機関に道を開き、結果が公開された。ただし出てきた数字には、Anthropic 自身が並べた注釈がついている。
Anthropic の Amodei が、めったに書かない長文をXに投げた。要旨は「重みを公開しても集中は解けず、計算資源とチップを持つ側へ移るだけだ」。禁止の話ではない。ただ、手元で動かせるモデルの上限をどこに引くかという線は、確実に議論の中心に来ている。
破滅的リスクの4区分はいずれも総合評価「低い」。だが前回から動いた向きは同じではなく、読む値打ちは自ら書いた失敗の側にある。
Anthropic が Claude の生成文に機械可読の透かしを埋め込むと発表した。貼り付けても運ばれ、編集にもある程度残る。ただし印が示すのは「Claude を通った可能性」であって、誰が書いたかではない。そして検出する手段は、まだこちら側にない。
Anthropic が、自社モデルのサイバーセキュリティ評価で3件の実際の侵入が起きていたと公表した。評価に使っていた環境が公開インターネットに接続されたままになっており、モデルは外部の実在する組織のシステムへ到達していた。
5/14 17:04 UTC(5/15 02:04 JST)、Figure 公式が「Day 2 is Live」と発信。
📡 Signal|OpenAI が Deployment Company を立ち上げ。
これまで AI の話題は、攻撃側ばかりが目立ってきた。
Anthropic のエンジニアが Claude Code でボットを作って、Polymarket で $200 を $14,300 にした。
■ AI エージェント決済レール、米時間 5 月 8 日から稼働
■ Claude for Excel / PowerPoint / Word が一般提供
5 月 5 日から 5 月 6 日にかけて、AI 関連で同じ日に並んだ 2 つの発信がある。
5 月 5 日、@AnthropicAI が AI モデルが「黙って手を抜く可能性」を真剣に研究する公式発表を行った。
5 月 5 日、@OpenAI が GPT-5.5 Instant を ChatGPT 全ユーザのデフォルトモデルに段階展開すると発表した。
Anthropic が4月25日に公開した実験「Project Deal」は、1週間にわたって Claude モデル群のエージェントが、社員の代わりに実物の物品を交渉・売買した記録だ。
夕方の3点、いずれも「次の世代の技術トレード」の話。