本文へ移動
LIFEMAKERS.COM — 自立型ライフの実践知カタログベータ版
Signal観測テクノロジーと道具FUTURE LIFE BRIEF

Qwen のスマホエージェント3種、完遂率90%は自社ベンチマーク

Alibaba の Qwen がスマートフォンを操作するエージェント群を公開。三つに役割を分け、完遂率は自社の評価基準で 90%。窓口のないアプリでは画面をそのまま見て操作する。

Qwen のスマホエージェント3種、完遂率90%は自社ベンチマークのイメージ

この記事でわかること

  • 計画・操作・生成の三つのエージェントに分かれ、アプリを跨いだ作業の完遂率は自社の評価基準で 90%
  • アプリに外部から呼べる窓口が無い場面では画面をそのまま見てタップするため、表示されているものがエージェントに見えている
  • 端末メーカー向けの仕組みで個人は選べない。先に確かめられるのは同時公開された評価基準 4 つの側

Alibaba の Qwen が 9 月 23 日、スマートフォンを自分で操作するエージェント群「Qwen Intelligence」を公開した。計画・操作・生成の三つに役割を分け、アプリを跨いだ作業の完遂率は自社が用意した評価基準で 90% だとしている。

頼めば端末がアプリを開いて手続きまで終わらせる、という方向に一歩進んだ発表だ。ただし、これで個人が今日できることが増えたわけではない。Qwen Intelligence は端末メーカーに提供される仕組みで、自分で選んで入れるアプリとして配られてはいない。読む側に効いてくるのは、次に買う端末に何が載っているか、という形になる。

計画・操作・生成に分かれた三つのエージェント

公式の告知によれば、内訳はこうなっている。

  • Mobile Planner Agent — 依頼を受けて手順に分解し、道具を呼び分け、途中で組み替える。自社が公開した MobilePA-Bench で首位だとしている。
  • Mobile-Use Agent — 実際に端末を動かす。アプリが外部から呼べる窓口を持っていればそれを使い、無ければ画面操作に切り替える。
  • Mobile Creative Agent — 一文から画像を作る。1 枚 3 秒で、主要な同種製品のおよそ 2 倍の速さだとしている。

目を引くのは分業そのものだ。考える部品、触る部品、作る部品が別々に置かれている。一つの大きなモデルに全部やらせるのではなく、役割ごとに測れる形にした設計になっている。

API がない場面では、人と同じく画面を触る

Mobile-Use Agent の説明にある「窓口があればそれを使い、無ければ画面操作に切り替える」は、読み飛ばしやすいが重い一文だ。

アプリが外部から呼べる窓口 (API) を用意していれば、エージェントはその窓口越しに用件を済ませる。用意していなければ、人がやるのと同じように画面を見てタップし、スワイプする。後者の場合、エージェントはその瞬間に表示されているものを見ていることになる。銀行のアプリも、届いた連絡も、写真も、同じ一枚の画面の上にある。

Qwen 側はこの点を放置してはいない。今回同時に公開された評価基準の一つは MobileWorld-Safety という名前で、安全性そのものを測る枠として置かれている。測る対象に安全性が立っているということは、ここが論点だと作った側も認めているということだ。

ただし公開されたのは測り方であって、個々の端末でエージェントがどこまで触れるかを決めるのは、それを載せる端末メーカーの側になる。

完遂率 90% の、残り 10% が動かすもの

完遂率 90% は、10 回に 1 回は最後まで行かないという意味でもある。

この差は作業の種類で効き方が変わる。要約する、探す、下書きを作る。この種の失敗はもう一度頼めば済む。予約を取る、連絡を送る、支払いを確定する。こちらは戻せない。同じ 90% でも、10 回に 1 回の重さがまるで違う。

数字の出どころも見ておきたい。実機での評価に使われた MobileWorld-Real は、公式のプロジェクトページによれば 400 を超えるタスクと 100 を超えるアプリでできていて、そこでの成功率は 92.2% とされている。画面操作だけで解く MobileWorld では 82.1% で、条件が変われば 10 ポイント動く。作った側が作った基準で測った値だという前提は、どの数字にも付いて回る。

費用についても但し書きがある。MobilePA-Bench のページ自身が、1,000 タスクあたりの費用は目に見える出力分だけからの見積もりで、入力・再利用分・内部の推論分は含まないと明記している。表に出ている額より、実際は上に振れうるということだ。

そして手に入れ方の話がある。Constellation Research は、この仕組みが端末メーカー向けであり、HONOR が最初のスマートフォン側の採用企業だと伝えている。HONOR のグローバルのニュース欄には、本稿の執筆時点でこの件の発表は出ていない。個人の側から見れば、買った端末に載っているかどうかで決まる話になる。

同時に公開された四つの評価基準

今回の発表で、個人がすぐ触れるものが一つだけある。評価基準の側だ。

MobilePA-Bench・MobileWorld・MobileWorld-Real・MobileWorld-Safety の四つが同時に公開されている。MobilePA-Bench は 1,705 のタスク・212 の道具・13 の領域・89 の小分類でできていて、配点は道具の使い方が 50%、記憶の使い方が 20%、技能の使い方が 20%、エージェント同士の連携が 10% と示されている。何を「できた」と数えているかが、外から読める形になっている。

確認する先は決まっている。tongyi-mai.github.io に置かれた MobileWorld のリーダーボードだ。いまは Qwen 自身の数字が中心で、他社のモデルが同じ基準で並んだときに、90% がどのあたりの数字なのかが初めて分かる。端末側は honor.com のグローバルニュース欄で、本件の発表がそこに出るかどうかが、搭載が実際に動いたかの最初の目印になる。

ことば

  • エージェント — 指示を受けて自分で手順を決め、道具やアプリを操作して最後まで進めるソフト。答えを返すだけの対話型と違い、途中で実際に何かを動かす点が分かれ目になる。
  • API — ソフトが外部から呼び出されるために用意する窓口。窓口があれば画面を介さずに用件を渡せるので、エージェントが画面を見る必要が減る。
  • ベンチマーク — 決めた課題を解かせて能力を比べるための共通の物差し。今回のように作った側が同時に公開する場合、何を課題に選んだかまで含めて読むことになる。

自分の端末に住みつくエージェントに、画面の何を見せて、どこまで触らせるだろうか?

参照

あなたの暮らしで、最初に試せることは何でしょうか。