元 OpenAI の研究者 Diogo Almeida 氏が率いる TypeSafe AI は米国時間 9 月 15 日、文章を生成せず、はい・いいえ、どれを選ぶか、何点か、といった判定だけを確率つきで返す AI モデル「Jev」を発表した。同社は応答の速さを既存の大規模言語モデル (LLM) の 20〜200 倍、費用を 40〜400 分の 1 とし、出力トークンの料金をゼロにした。
文章を書く AI に慣れた側から見ると、できないことが先に目に入る。だがこの割り切りは、暮らしの中の小さな自動化にとってはむしろ扱いやすい形かもしれない。数字はまだ同社の自己申告で、外部の再現はこれからだ。
「文章を書かない」の中身
Jev への問いは、状況を書いたテキストと、答えの形をあらかじめ決めた質問の組で送る。公式ドキュメントによれば質問の型は 3 つで、選択肢から選ぶ Choice、基準に沿って点を付ける Score、真偽を 0〜1 で返す Noul。答えは決めた型の値と、それぞれの確からしさを示す確率で返ってくる。
LLM が 1 トークン (語の断片) ずつ順に文章を生成するのに対し、Jev はすべての答えを 1 回の問い合わせで同時に出す。この差が速さの根にあり、同社は 1 回の応答を 70 ミリ秒から 500 ミリ秒、LLM を 3 秒から 329 秒としている。発表の実演では、同じ問いに GPT-5.6 Terra が 8.566 秒かかったところを 0.114 秒で返した。
語の範囲は絞っておきたい。同社は Jev を「幻覚を起こさない」と言うが、公式ブログ自身が「型の一致は保証されるので 0% と書いた。実測値ではない」と注記している。決めた選択肢の外に飛び出さない、という意味であって、選んだ答えが正しいことまでは保証しない。The Register も、出力が自然言語でない以上、幻覚の有無を LLM と比べるのは公平な比較ではないと書いた。
名前の由来も同社の考えを表している。System One は心理学者ダニエル・カーネマンの言う速い思考から、Jev は経済学者ウィリアム・スタンレー・ジェヴォンズから取った。蒸気機関の効率が上がると石炭の消費が増えたように、判定 1 回の値段が桁で下がれば使い道が桁で増える、という見立てだ。
数字の床はどこまで固いか
料金は入力 100 万トークンあたり 0.042 ドル、出力は無料。同社の比較表では LLM の入力が 0.20〜10 ドルで、出力はその 5 倍前後とされる。ホームページの「193.6 倍速い、444.6 倍安い」は、同社が作った 4 つの業務ワークフロー (セキュリティ事案の分類、AI エージェントの動作記録の監視、請求書処理、カスタマーサービス) で測った値で、ブログは「実世界での効果としては上限寄り」と書いている。
比較の物差しにも注意がいる。正解データは、GPT-6 Astra と Claude Fable 5.1 を高推論モードで動かした答えの平均で、人が付けた正解は使っていない。ワークフローは同社のモデル能力チームが作り、速度の計測は米西海岸のノート PC から行われた。料金についても「補助金で下支えしていないことは証明できない」と同社は認めている。第三者による再現はまだない。
それでも公開している情報は多い。評価サイトには 4 ワークフローの全問と、各モデルが正解と食い違った箇所が並ぶ。1 秒に 10 回問い合わせて DOOM を動かす実演は、時間あたり約 7 ドルだったという。資金は The Register が 4,000 万ドルと報じた。
暮らしの側から見ると
個人が自分の生活を自動化しようとすると、対応が必要なメールか、食費のレシートか、センサーの値は異常か、といった判定が要所に出てくる。これを LLM に頼むと、返事が文章で戻るため受け取り側で解釈が要り、遅く、料金もかさむ。同社はこの用途を「賢い if 文」と呼び、Jev の主戦場に置いている。文章が要る場面は LLM に、決めるだけの場面は Jev に、と役割を分ける形だ。
費用の桁を確かめておく。1,000 トークンの状況説明を 1 万回判定させても、入力の料金は 0.42 ドル。個人の実験なら、料金より先に時間が尽きる水準だ。
ただし、今日すぐ使えるものではない。提供は早期アクセスで、待機リストの順に開放される。Python と JavaScript の SDK が用意されるが、使うにはコードを書く必要がある。1 つの質問で選べる選択肢は 255 まで。実演の DOOM も状況をテキストに直したものを読ませており、画像はまだ扱えない。日本語の入力について、編集部で公式ドキュメントを確認した範囲では記載がなかった。サービスは米西海岸にあり、日本からは往復の通信時間が上乗せされる。
何を任せ、何を手元に残すか
Jev が持ち込んだのは新しい能力というより、AI に頼む仕事を「書く」と「決める」に分ける習慣だ。決める部分だけを速く安く切り出せるなら、文章を書く AI に何もかも頼む必要はなくなる。逆に、確率つきの答えをどう扱うかは使う側に残る。80% で対応が必要と出たメールを、開くのか、放っておくのか。
確かめる先は 2 つある。評価サイト evals.typesafe.ai には、4 ワークフローで各モデルが食い違った問いがそのまま載っている。自分の用途に近い問いを 1 つ選んで読めば、数字の意味が具体的になる。もう 1 つは同社が予告した DOOM 実演の詳細な解説で、公開されれば 1 秒 10 回の判定が実際にどう組まれているかが分かる。
あなたの暮らしの中で、文章はいらないが判断は要る場面はどこにあるだろうか。
ことば
- System One Models — 文章を生成せず、決められた形の答えを確率つきで返す AI の種類。カーネマンの言う速い思考にちなみ、TypeSafe AI が 9 月 15 日に提唱した。
- RLCD — Reinforcement Learning for Calibrated Decisions。答えの確率が実際の正答率と釣り合うよう訓練する同社の手法。95% と言ったら 95% 当たる状態を目指す。
- 出力トークン — AI が返す文章の長さの単位。LLM では入力より高く課金されるのが普通で、Jev はここを無料にした。
一次ソース
- TypeSafe AI 公式ブログ (9月15日:System One Models と Jev の発表・料金・応答時間・評価の注記)
- Diogo Almeida 氏の X 投稿 (9月15日:20〜200 倍速・40〜400 倍安・出力トークン無料)
- TypeSafe AI ワークフロー評価サイト (4 ワークフローの全問と各モデルの食い違い)
- TypeSafe AI 公式ドキュメント (Choice / Score / Noul の 3 つの質問型)
- The Register (9月16日:実演の 0.114 秒対 8.566 秒・資金 4,000 万ドル・幻覚比較への指摘)
- GIGAZINE (9月16日:日本語での発表報道)
