Anthropic は 9 月 28 日、中位モデル Claude Sonnet 5.5 を公開した。価格は前世代の Sonnet 5 と同じ入力 100 万トークンあたり 2 ドル・出力 10 ドルで、上位の Opus 5.5 (入力 4 ドル・出力 20 ドル) のちょうど半分になる。
文書や表計算をつくる実務の評価では、その Opus 5.5 にほぼ並んだ。手元の道具の値段が一段下がったいま、自分の仕事のどこまでを任せるかを引き直す材料がそろった。
Opus 5.5 との差は 2 点
Anthropic の公式ページによれば、Sonnet 5.5 は Sonnet 5 より出力が 30% 以上速く、多くの作業で 1 件あたりのコストが最大 30% 下がる。得意とするのは範囲がはっきりした日常の作業、バグの修正、文書・スライド・表計算の仕上げだとしている。API の名前は claude-sonnet-5-5 で、AWS、Google Cloud、Microsoft Azure を含むすべての提供先で使える。
目を引くのは GDPval-AA v2.1 の数字だ。さまざまな職業の実務課題で文書や表、スライドをつくらせ、匿名にした出来を 2 つずつ比べてレーティングにする評価で、Sonnet 5.5 は 1844、Opus 5.5 は 1846。Sonnet 5 の 1449 から大きく伸び、上位との差は 2 点まで縮んだ。画面を操作して作業を進める OSWorld 2.1 でも、Sonnet 5.5 は 80.1% と Opus 5.5 の 81.8% に近い。
それでも公式ページは、複雑で答えの決まっていない仕事では Opus 5.5 が「はっきり強い」と書いている。並んだのは実務の成果物づくりであって、あらゆる知的作業ではない。
値札は半分、請求額は設定しだい
評価会社 Artificial Analysis の測定は、別の面を映した。推論にかける手間を最大 (max effort) にした設定で、Sonnet 5.5 は同社の総合指標で 56 点と、Opus 5.5 (最大設定) の 58 点に迫った。その代わり、1 課題あたりの出力トークンは約 19 万 3000 と同社が測った中で最も多く、Opus 5.5 や Sonnet 5 の最大設定より 60% 前後多かった。1 課題あたりの費用は 7.60 ドルで、Sonnet 5 より約 5 割高い。
公式の「最大 30% 安い」と食い違って見えるが、測った条件が違う。公式は多くの作業での比較で、Artificial Analysis は最も重い設定で全課題を回した結果だ。トークン単価が同じでも、考える量を増やせば請求額は増える。
公式ページには、手間を増やしても良くなるとは限らない例も載っている。コード変更が人の手直しなしで取り込めるかを見る FrontierCode では、最大設定の Sonnet 5.5 のほうが一段低い設定より点が低かった。最大設定では作業を多数のサブエージェント (分担して動く補助の AI) に割り振るレビュー機能をよく使い、AI 開発企業の Cognition が調べた 2 件では、それが時間切れや頼まれていない範囲への修正につながったという。
個人の仕事に置き直すと
API を従量課金で使う個人や小さなチームにとって、これはモデル選びより設定の話に近い。範囲がはっきりした作業、たとえば定型の資料づくりや表の整理、小さなバグ修正なら、Sonnet 5.5 を控えめの設定で回す。答えの形が決まっていない調査や設計には Opus 5.5 を残す。依頼の範囲を最初に狭く書くほど、余計な修正も余計なトークンも減る。
向かない条件もある。サイバーセキュリティで危険度の高い依頼は、目に見える形で Sonnet 5 に切り替わる仕組みが入った。ベンチマークは公式の数字と一社の外部測定で、自分の業務で同じ差が出るかは、自分の作業で測るまで分からない。
次に見るのは、自分の API 使用量画面の出力トークン数だ。今週の作業 1 件ぶんを、Sonnet 5 で回していた頃の同じ種類の作業と並べれば、公式の「3 割減」と外部測定の「5 割増」のどちらに近いかが分かる。
ことば
- GDPval-AA — 多くの職業の実務課題で AI に成果物をつくらせ、匿名で 2 つずつ比べて強さを点数にする評価。Artificial Analysis が運営し、今回 Sonnet 5.5 と Opus 5.5 の差は 2 点だった。
- effort (推論の手間) — 答える前にどれだけ考えるかを利用者が選ぶ設定。上げるほど出力トークンが増えて請求額も増えるが、今回の FrontierCode のように点が下がる場合もある。
- 出力トークン — AI が書き出す文字の量を数える単位で、API の料金はこの量に単価をかけて決まる。料金表の単価だけでは、1 件あたりの費用は決まらない。
値札が半分になった道具も、使い方しだいで半分の値段にはならない。安い設定で渡せる仕事と、手元や上位モデルに残す仕事。その線を、あなたは自分の仕事のどこに引くだろうか?