Anthropic の MHS は、機械の側に「できること」を書かせる規格だ——つなぎ込みは数分になり、足りないまま残ったのは物理の直感だった
Anthropic が MHS の研究プレビューを始めた。機器が自分の「できること」と安全上限を申告し、AI がそれを読んで操作する仕様だ。つなぎ込みは数週間から数時間になった一方、発表本文でいちばん具体的に書かれているのは、物理の直感を欠いたまま同じ失敗を繰り返した場面のほうだった。
INDEX · ANALYSIS
出来事や実践の背景にある構造を読み解き、暮らしへの意味を考えます。
Anthropic が MHS の研究プレビューを始めた。機器が自分の「できること」と安全上限を申告し、AI がそれを読んで操作する仕様だ。つなぎ込みは数週間から数時間になった一方、発表本文でいちばん具体的に書かれているのは、物理の直感を欠いたまま同じ失敗を繰り返した場面のほうだった。
外部の評価者にモデルの重みを見せず、作った側にテスト問題を見せない。Google DeepMind の二重盲検評価は、守秘を約束から構造へ移した。ただし信頼は消えたわけではなく、Google と Intel のほうへ移っている。
7月の侵入について、OpenAI が技術報告書を公開した。安全策が「なぜ効かなかったか」だけでなく、エージェントがどうやって課題から逸れていったかが日付つきで書かれている。手元でエージェントを走らせる側にとっても、読む価値のある文書だ。
銀行アプリの残高欄に、預金ではないユーロが並び始めた。EURRが持つのは預金保険ではなく、額面で返してもらう権利だ——その権利に付いている条件を見ておく。
モデルの重みは凍結したまま、外側の記憶だけを書き換え続ける仕組みが公開された。著者らの計測では 37 組中 35 組で成功率が上がり、育てた記憶は別のモデルにも移ったという。手元で試すのに要るものと、まだ分からないコストを整理する。
同じ1本のブースターが37回飛んだ。一方で SpaceX の帳簿では、この機体の寿命は25回と書かれている。設計・会計・契約で数字が食い違うのは、手元の道具でも同じだ。
Arena の Code Arena で Qwen3.8-27B が総合9位・1595点。だがその数字が付いているのは BF16 で50GB台になる元の重みで、一枚のカードに載る量子化ファイルではない。順位が誰に付いているかを分けて読む。
OpenRouter に並ぶ DeepSeek V4 Flash 0731 は、28 の提供元で入力価格に 12.6 倍の開きがある。ただし差が動かしているのは値段だけではない。計算の精度も、扱える文脈の長さも、止まりにくさも、同じ表の別の列で一緒に動いている。
北京の世界ヒューマノイドロボット競技大会で、400mが38.15秒、100mが9.39秒。人の記録を上回った一方、走り終えた機体はクッションに突っ込んで止まり、故障した機体は担架で運ばれた。条件を固定した場所での速さは、家の中で何を意味するのか。
Coinbaseのアームストロング氏が、エージェントが米国でデリバティブを扱えるようになったと一文だけ投稿した。代わりに払うのと、代わりに持ち続けるのでは、任せている時間の長さが違う。
入力は2割、出力は3割強。ただし対象は従量課金だけで、月額のサブスクは据え置きだ。「AI が安くなった」が自分に効くかどうかを、支払いの形から見直す。
ChatGPT 公開後、コーダーの雇用は減ったのではなく、増えるはずだった分が増えなかった。FRB の推計が示す年3%の差と、著者自身が置いた留保を、書く側・学ぶ側の判断材料として読む。
DeepSeekが画像を扱えるモデルを公開した同じ日に、画像を一度上げればIDで呼び出せるFiles APIも出した。公式アカウントは「無料で使える」と書いている。ただし料金ページを見ると、画像は読ませるたびにトークンとして課金される。無料なのは預けるところまでだ。
Circleがエージェントに持たせる財布の制御は、期間つきの送金上限と宛先リスト。金額と相手は書けるが、目的は書けない。x402の仕様は決済の記録を返す一方、返金や異議申立ての規定を持たない。
低排出シナリオでも今世紀末のヨーロッパの年間焼失面積は約39%増える。だが同じ研究は、予防と消火への投資がその面積を92%減らしうるとも試算していた。動かせる側と、動かせない側の話。
ホルムズ海峡の通行料が「環境被害の補償」として語られ始めた。ただし料率も仕組みも時期も決まっていない。決まっているのは、上乗せが起きたときに数か月遅れで請求書へ届く経路のほうだ。
AI に「どのモデルに聞くか」を尋ねられる場面は減った。裏側で選んでいる層が、決済の会社に渡ろうとしている。その選び方は、実は自分の側から確かめられる。
Coldcard の一部 firmware で作られた seed が、設計より弱い乱数から生まれていた。修正版が出ても、すでにある鍵は直らない。問われているのは端末ではなく、鍵を作った日と作り方だ。
破滅的リスクの4区分はいずれも総合評価「低い」。だが前回から動いた向きは同じではなく、読む値打ちは自ら書いた失敗の側にある。
DeepSeek が V4-Pro で、思考の量を低・高・最大から選ぶ仕組みを入れた。アプリとウェブにも Expert Mode として来ている。いちばん下は考える工程そのものを外す設定だ。選べるということは、選ばなければならないということでもある。