Alibaba の Qwen が 9 月 23 日、スマートフォンを自分で操作するエージェント群「Qwen Intelligence」を公開した。計画・操作・生成の三つに役割を分け、アプリを跨いだ作業の完遂率は自社が用意した評価基準で 90% だとしている。
頼めば端末がアプリを開いて手続きまで終わらせる、という方向に一歩進んだ発表だ。ただし、これで個人が今日できることが増えたわけではない。Qwen Intelligence は端末メーカーに提供される仕組みで、自分で選んで入れるアプリとして配られてはいない。読む側に効いてくるのは、次に買う端末に何が載っているか、という形になる。
計画・操作・生成に分かれた三つのエージェント
公式の告知によれば、内訳はこうなっている。
- Mobile Planner Agent — 依頼を受けて手順に分解し、道具を呼び分け、途中で組み替える。自社が公開した MobilePA-Bench で首位だとしている。
- Mobile-Use Agent — 実際に端末を動かす。アプリが外部から呼べる窓口を持っていればそれを使い、無ければ画面操作に切り替える。
- Mobile Creative Agent — 一文から画像を作る。1 枚 3 秒で、主要な同種製品のおよそ 2 倍の速さだとしている。
目を引くのは分業そのものだ。考える部品、触る部品、作る部品が別々に置かれている。一つの大きなモデルに全部やらせるのではなく、役割ごとに測れる形にした設計になっている。
API がない場面では、人と同じく画面を触る
Mobile-Use Agent の説明にある「窓口があればそれを使い、無ければ画面操作に切り替える」は、読み飛ばしやすいが重い一文だ。
アプリが外部から呼べる窓口 (API) を用意していれば、エージェントはその窓口越しに用件を済ませる。用意していなければ、人がやるのと同じように画面を見てタップし、スワイプする。後者の場合、エージェントはその瞬間に表示されているものを見ていることになる。銀行のアプリも、届いた連絡も、写真も、同じ一枚の画面の上にある。
Qwen 側はこの点を放置してはいない。今回同時に公開された評価基準の一つは MobileWorld-Safety という名前で、安全性そのものを測る枠として置かれている。測る対象に安全性が立っているということは、ここが論点だと作った側も認めているということだ。
ただし公開されたのは測り方であって、個々の端末でエージェントがどこまで触れるかを決めるのは、それを載せる端末メーカーの側になる。
完遂率 90% の、残り 10% が動かすもの
完遂率 90% は、10 回に 1 回は最後まで行かないという意味でもある。
この差は作業の種類で効き方が変わる。要約する、探す、下書きを作る。この種の失敗はもう一度頼めば済む。予約を取る、連絡を送る、支払いを確定する。こちらは戻せない。同じ 90% でも、10 回に 1 回の重さがまるで違う。
数字の出どころも見ておきたい。実機での評価に使われた MobileWorld-Real は、公式のプロジェクトページによれば 400 を超えるタスクと 100 を超えるアプリでできていて、そこでの成功率は 92.2% とされている。画面操作だけで解く MobileWorld では 82.1% で、条件が変われば 10 ポイント動く。作った側が作った基準で測った値だという前提は、どの数字にも付いて回る。
費用についても但し書きがある。MobilePA-Bench のページ自身が、1,000 タスクあたりの費用は目に見える出力分だけからの見積もりで、入力・再利用分・内部の推論分は含まないと明記している。表に出ている額より、実際は上に振れうるということだ。
そして手に入れ方の話がある。Constellation Research は、この仕組みが端末メーカー向けであり、HONOR が最初のスマートフォン側の採用企業だと伝えている。HONOR のグローバルのニュース欄には、本稿の執筆時点でこの件の発表は出ていない。個人の側から見れば、買った端末に載っているかどうかで決まる話になる。
同時に公開された四つの評価基準
今回の発表で、個人がすぐ触れるものが一つだけある。評価基準の側だ。
MobilePA-Bench・MobileWorld・MobileWorld-Real・MobileWorld-Safety の四つが同時に公開されている。MobilePA-Bench は 1,705 のタスク・212 の道具・13 の領域・89 の小分類でできていて、配点は道具の使い方が 50%、記憶の使い方が 20%、技能の使い方が 20%、エージェント同士の連携が 10% と示されている。何を「できた」と数えているかが、外から読める形になっている。
確認する先は決まっている。tongyi-mai.github.io に置かれた MobileWorld のリーダーボードだ。いまは Qwen 自身の数字が中心で、他社のモデルが同じ基準で並んだときに、90% がどのあたりの数字なのかが初めて分かる。端末側は honor.com のグローバルニュース欄で、本件の発表がそこに出るかどうかが、搭載が実際に動いたかの最初の目印になる。
ことば
- エージェント — 指示を受けて自分で手順を決め、道具やアプリを操作して最後まで進めるソフト。答えを返すだけの対話型と違い、途中で実際に何かを動かす点が分かれ目になる。
- API — ソフトが外部から呼び出されるために用意する窓口。窓口があれば画面を介さずに用件を渡せるので、エージェントが画面を見る必要が減る。
- ベンチマーク — 決めた課題を解かせて能力を比べるための共通の物差し。今回のように作った側が同時に公開する場合、何を課題に選んだかまで含めて読むことになる。
自分の端末に住みつくエージェントに、画面の何を見せて、どこまで触らせるだろうか?
参照
- Qwen 公式告知 (三つのエージェントの役割・完遂率 90%・画像 3 秒・評価基準 4 つの公開)
- Qwen-UI-Agent 公式プロジェクトページ (MobileWorld 82.1%・MobileWorld-Real 92.2%・実機ベンチの規模)
- MobilePA-Bench 公式ページ (1,705 タスク・212 の道具・13 領域・89 小分類・配点・費用推定の但し書き)
- Tongyi-MAI 公式リポジトリ (Qwen-UI-Agent の評価結果と技術報告)
- Constellation Research (端末メーカー向けの提供形態・HONOR が最初のスマートフォン採用企業)
- HONOR グローバルニュース欄 (執筆時点で本件の発表は掲載なし)