Jev / RLCD / SLM / Multi-model AI

Jevから見える
「分業するAI」の未来

AIは「何でも文章で答える巨大LLM」だけで進化するのか。TypeSafe AIのJevが投げかけたのは、考えるAI・判断するAI・端末で反応するAIを分けて協調させる、別の設計思想です。

出典を見る
2026年9月21日時点の公開情報を整理。TypeSafeが公表した事実・同社の主張・そこから導ける将来像を分けて記述しています。

この資料でわかること

Jevは、普通のチャットAIとはかなり違う方向を向いたモデルです。本稿ではまず「速い・安い・文章ではなく判断を返す」という3つの特徴を押さえ、続いてComputer useをはじめとする具体的な活用例を見ます。そのうえで、なぜその設計が必要なのか、RLHFとRLCD、SLMとの関係、マルチモデル化、安全性への示唆まで順番につなげます。

① まずJevの特徴をつかむ速い・安い・文章ではなく判断を返す。最初に全体像をつかむ。
② 実際の使われ方を見るComputer use、モデル選択、安全チェック、評価器。Jevの得意分野を具体例でつかむ。
③ AIエージェントとの関係を理解する小さな判断を何度も繰り返すAIエージェントだからこそ、Jevの速さと分業が効いてくる。
1

まず押さえたい、Jevの3つの特徴

現在の生成AIを代表するLLMは、質問を理解し、文章・コード・説明を作ることが得意です。人間と会話するには非常に便利です。

しかし、AIをソフトウェアやAIエージェントの内部に組み込むと、必要なのはいつも文章とは限りません。むしろ、「どれを選ぶか」「安全か」「続けるか」といった判断だけ欲しい場面が大量にあります。

速い

長い文章を1トークンずつ生成するのではなく、必要な判断を直接返すため、用途によっては一般的なLLMより大幅に低遅延です。

安い

生成するトークン数が少なく、判断専用の処理に絞れるため、同じ仕事を大規模LLMで行うより低コストにできる可能性があります。

文章ではなく「判断」を返す

自由文ではなく、YES/NO、選択肢、スコアと確率など、ソフトウェアがそのまま利用できる形で返します。

例:問い合わせをどの部署に回すか

一般的なLLM

「この問い合わせは料金に関する内容なので、請求担当部署に回すのが適切だと思います。」

人間には読みやすい。しかしプログラムは、この文章から「請求」という結論をもう一度取り出す必要があります。

Jev

営業
3%
技術
5%
請求
92%

プログラムは「請求 92%」を、そのまま分岐条件として使えます。

ここがJevの出発点です。
人間に読ませる文章ではなく、ソフトウェアが直接使える「選択」「真偽」「スコア」と、その確率を高速に返す。Jevの「速い・安い・判断を返す」という3つの特徴は、すべてこの設計思想につながっています。

※「速い」「安い」は用途と比較対象によって変わります。ここでは、TypeSafeや第三者が公開しているJevの実測・利用報告に基づく特徴として説明しています。絶対的に常に最速・最安という意味ではありません。

2

Jevは何に使えるのか ― すでに見え始めた活用例

「文章を返さず、速く安く判断する」と言われても、最初は用途を想像しにくいかもしれません。ところがJevの発表直後から、AIエージェントの中で何度も繰り返される小さな判断をJevへ任せる実験が一気に始まりました。

Jevが特に向いている場面
「考え抜いて文章を書く」場面ではなく、次に何をするか、どれを選ぶか、続けるか止めるか、安全か危険かを何度も素早く決める場面です。

例1:Computer use ― クリックや画面操作を高速化する

Jevの特徴が最もわかりやすく出ているのが、ブラウザやPCをAIが操作するComputer useです。

通常のComputer useでは、「画面を見る → 次の操作を考える → クリックする → また画面を見る」というループを何度も繰り返します。毎回大規模LLMに戻って深く考えさせると、クリック一つでも待ち時間とコストが積み重なります。

Computer useでの役割分担

従来型

画面を見る → LLMが考える → クリック → またLLMが考える → スクロール → またLLM…

操作のたびに生成モデルを呼ぶため、待ち時間が積み重なりやすい。

Jevを組み合わせる

クリック / 選択 / スクロール / 待機など、候補が決まっている操作はJevが高速に選ぶ。

難しい文章入力、画像の意味判断、最終確認だけをLLMへ戻す。

Browser Useのオープンソース実験Jev Ultrafastでは、Jevが毎回「どの操作を、どの画面要素に行うか」を選び、文字入力が必要なときだけ小型の言語モデルを使います。公開されたGoogle Flightsのデモでは、チューリヒ発ロンドン行きの検索を約7.1秒で完了しています。作者らが同じ条件で行った小規模比較では、中央値が9.45秒から7.09秒へ約25%短縮しました。これは一つのタスクを3組比較した限定的な測定ですが、仕組みの効果を具体的に示しています。

さらにJev Browser UseというCodex向けSkillでは、Jevがナビゲーション、クリック、トグル、スクロールを担当し、Codexは文字入力、画面の意味判断、最終確認に集中します。開発者は、自分たちのブラウザ作業で約5〜10倍の高速化を報告しています。これは独立したコミュニティ実装であり、OpenAIやTypeSafeの公式製品ではありません。

なぜComputer useと相性がよいのか:
「このボタンを押すか」「次はスクロールか」「もう終わったか」は、長文を作る問題ではありません。候補の中から瞬時に一つ選ぶ問題です。まさにJevが狙った仕事です。

例2:AIエージェントが「どのモデルを使うか」を選ぶ

LangChainはJevを使ったModelRouterMiddlewareを公開しています。簡単な検索や抽出なら高速で安価なモデル、複雑な設計判断なら高性能モデル、といった具合に、Jevが依頼内容を見て次に使うAIモデルを選択します。

ユーザーの依頼
Jevが判定
簡単? 複雑?
最適なモデルへ
高速モデル / 高性能モデル

例3:危険なツール実行の直前にチェックする

同じくLangChainは、Jevでツール呼び出しを事前チェックするAutoModeMiddlewareも公開しています。たとえばAIがシェルコマンドを実行しようとしたとき、Jevが「危険な操作か」を判定し、条件に合えば実行前に止める仕組みです。

エージェント
このコマンドを実行したい
Jevで安全判定
危険? 安全?
実行 / ブロック

例4:AIの回答や作業結果を「採点」する

LangSmithは、AIエージェントの結果を評価するJev-as-a-Judgeを試しています。従来は別のLLMに「この回答は何点か」と文章で評価させることが多いのですが、Jevならスコアを直接返せます。

LangChainの小規模実験では、Jevは平均0.44秒で評価し、連続スコアのばらつきは比較したGPT-5.6 Luna / Terra、Claude Sonnet 4.6より92〜913倍小さいと報告されました。テスト範囲は限定的ですが、「評価専用AI」という役割の可能性を示しています。

ここまでの共通点:
Computer use、モデル選択、安全判定、採点――どれも「人間向けの文章を作る仕事」ではありません。AIシステムの内部で何度も発生する、小さく明確な判断です。Jevが騒がれている理由は、この部分をLLMから切り離せる可能性を示したことにあります。

※上記の速度・倍率は各プロジェクトやLangChainが公開した測定値です。タスク、環境、比較条件によって結果は変わります。Computer useの数値は一般的な全タスクの性能保証ではありません。

3

なぜJevのようなモデルが、AIエージェントで重要になるのか

Jevの特徴そのものは、すでに見た通りです。ここで重要なのは、その特徴がなぜ今のAIエージェントに効くのかです。

AIエージェントは、一度だけ答えを出して終わるわけではありません。仕事を進める途中で、細かな判断を何度も繰り返します。

AIエージェントの内部では、小さな判断が何度も発生する
依頼を受ける
次に何をする?
どのツールを使う?
結果は十分?
続ける? 止める?

こうした判断の一つひとつに大規模LLMを呼ぶと、1回あたりの待ち時間が小さくても、処理全体では積み重なって効いてきます。Computer useで、クリックやスクロールのたびに待ち時間が発生するのはその典型です。

大規模LLMに向く仕事

複雑な状況理解、計画、長い文章の生成、難しい推論、曖昧な問題の整理。

Jev型モデルに向く仕事

候補から一つ選ぶ、続行/停止を決める、安全/危険を判定する、スコアを返す。

Jevが注目される理由は「LLMより賢いから」ではありません。
AIエージェントの中にある大量の小さな判断を、より適したモデルへ分業できる可能性を示したからです。

この「何でも一つの大規模LLMに任せる必要はない」という発想が、後半で説明するSLM、マルチモデル、ローカルAI、安全設計の話へつながっていきます。

4

Jevとは何か

TypeSafe AIは2026年9月15日、最初のSystem One ModelとしてJevを発表しました。TypeSafeはSystem One Modelを、文章を長く生成するモデルではなく、高速で構造化された判断をソフトウェアへ返すためのモデルとして位置づけています。公式発表

TypeSafeの要約を日本語にすると、
「曖昧な状況を入力すると、型の決まった確率付き判断を返す関数」に近い。
Jevの基本イメージ
状況
文章・履歴・状態など
Jev
状況を解釈して判断
型付きの答え
YES/NO、選択肢、スコア+確率
ソフトウェア
そのまま実行へ

TypeSafeは、Jevが複数の判断を並列に扱うための新しいアーキテクチャとsampler、そして後述するRLCDという学習方法を採用したと説明しています。内部構造、パラメータ数、RLCDの具体的な学習レシピは現時点では公開されていません。未公開部分あり

「幻覚しない」という表現には注意が必要です。
Jevは、あらかじめ決めた型や選択肢の外へ勝手に文章を生成しないため、形式上の「でっち上げ」を防ぎやすい設計です。しかし、請求を技術と誤判定するような意味上の判断ミスまでゼロになるわけではありません。
5

では、JevはLLMなのか

一般的な説明では、Jevをそのまま「LLM」と呼ぶのはわかりにくいでしょう。現在「LLM」と言うと、通常はトークンを使って文章やコードを生成する汎用的な言語モデルを指すからです。

一般的なLLMJev / System One Model
主な仕事文章・コードの生成、推論、対話選択・分類・真偽・スコアなどの判断
出力自由な文字列型の決まった答え+確率
主な相手人間ソフトウェア
重視すること表現力、推論力、指示への追従速度、構造化、確率の信頼性

ただし、ここで「技術的にLLMではない」と断定するのも早計です。TypeSafeは内部アーキテクチャを公開していないため、どの程度言語モデルの技術を引き継いでいるかは外部から確認できません。

現時点で最も安全な整理:
Jevは「チャットや文章生成を目的とした一般的なLLM」とは別のカテゴリーとして設計されている。一方、内部構造が非公開なので、技術的な系譜まで断定はできない。
6

RLHFとは何か ― AIを「人に好かれる答え方」に近づける仕組み

Jevの学習方法を理解するには、まず現在のチャットAIで広く使われているRLHFを知っておく必要があります。

RLHFは簡単に言えば、「AIの答えを人間が評価し、好まれた答え方を増やしていく」仕組みです。

RLHFのイメージ
① AIがいくつか答える
A案 / B案 / C案
② 人間が選ぶ
「Aの方がよい」
③ AIが学ぶ
人に好まれる答え方が増える

この方法のおかげで、AIはずいぶん会話しやすくなりました。丁寧に答えたり、指示に従ったり、読みやすく説明したりできるのは、こうした調整の成果です。

ただし、副作用もあります。
人間に好まれる答えを学び続けると、相手に合わせすぎることがあります。 たとえばユーザーが「Aですよね?」と強く期待していると、本当は自信がなくても、 「はい、Aです」と寄ってしまう。これが、いわゆる忖度・迎合です。
RLHFで起こりうること

ユーザー

「やっぱりAですよね?」

AI

「はい、Aです」

本当はAとBで迷っていても、相手の期待に寄ることがある。

もちろん、RLHFが悪いわけではありません。人間と会話するAIにはとても有効です。ただ、人に好かれることを重視したAIを、そのまま機械の自動判断にも使ってよいのかという疑問が出てきます。

ここでJevの考え方が出てきます。
相手が喜ぶ答えを返すのではなく、 「A 55%、B 45%」のように、判断とその確からしさをそのまま返す。 Jev / RLCDは、こちらの方向を重視しています。

※Jevが迎合を完全になくしたと証明されたわけではありません。ただし、自由な文章で相手に合わせるのではなく、判断と確率を返す設計にすることで、少なくとも「人に好かれる文章を作ること」から距離を取ろうとしているのは明確です。

7

RLCDは何を変えようとしているのか

そこでTypeSafeがJev向けに掲げているのが、RLCD(Reinforcement Learning for Calibrated Decisions)です。狙いは、単に「Aだと思います」と答えるのではなく、「A 80%、B 20%」のように、その判断がどれくらい確からしいかまで機械が使える形で返すことです。

Calibrationとは「80%と言ったら、本当にだいたい80%当たる」こと

天気予報を考えると簡単です。「降水確率80%」と予報した日を100日集めたとき、実際におよそ80日で雨が降るなら、その80%は信用できます。これが確率のcalibration(較正)です。

「自信満々」と「確率が信頼できる」は違う

信頼しにくい確率

「90%正しい」

と言う場面を100回集めても、実際には60回しか正しくない。

→ 自信過剰。

較正された確率

「80%正しい」

と言う場面を100回集めると、実際にもおよそ80回正しい。

→ ソフトウェアが閾値として利用しやすい。

TypeSafeはRLCDによって、Jevが「自分の判断がどれくらい確かか」まで正直に表現できることを目標にしていると説明しています。たとえば:

請求書を
自動承認してよい?
YES 98%
NO 2%
95%以上なら自動
それ以下は人間へ
RLHFRLCD
主な狙い人間が好む・望ましい回答へ寄せる判断と、その確率の信頼性を高める
主な利用相手人間ソフトウェア
向いている場面会話、説明、文章生成分類、ルーティング、継続/停止、スコアリング
ここはまだブラックボックスです。
RLCDの名称・目的・Jevへの採用はTypeSafeが公開していますが、具体的な報酬設計、学習データ、再現可能なアルゴリズムはまだ公開されていません。したがって「RLCDなら必ず確率が正確になる」と一般化する段階ではありません。
8

この発想が、SLMの存在意義を変える可能性がある

SLM(Small Language Model)は、LLMより小さく、少ない計算資源で動かせるモデルを指します。これまでは「大型LLMを小さくして、スマホやPCでもチャットできるようにするもの」と説明されることが多くありました。

しかし、端末に近いAIに本当に必要なのは、いつも会話能力でしょうか。スマートグラス、イヤホン、時計、車、家電、ロボットでは、むしろ次のような判断が大量に発生します。

見る
「信号は赤か」「人が近づいたか」
決める
「通知するか」「停止するか」
振り分ける
「端末で処理するか、上位AIへ送るか」
端末に近いAIでは、長い文章を書く能力より、
小さく・速く・省電力で・即座に判断する能力の価値が大きくなる。

人間の神経系で考えるとわかりやすい

熱いものに触れたとき、人間は長い説明を考えてから手を引くわけではありません。感覚器から来た信号を反射回路が素早く処理し、まず身体を守ります。難しい認識や計画だけを脳が担当します。

AIを「神経系」として見る
大規模LLM / 高度な推論モデル
難しい問題を考える・計画する・人に説明する
小型の専門モデル / SLM / Decision Model
分類・危険判定・ルーティング・続行/停止を高速に処理
デバイス / センサー
カメラ・マイク・時計・グラス・車・家電・ロボット

この構成なら、大規模モデルを常時呼ぶ必要はありません。端末側で処理できることはローカルで終わらせ、難しいときだけ上位モデルへ送れます。速度、通信量、API費用、プライバシー、オフライン動作のすべてに利点があります。

重要:Jev自身のモデル規模は公開されていないため、JevをSLMとみなすことはできません。ここで重要なのは、Jevが示した「文章を作らず判断に特化する」という役割が、小型モデルと非常に相性がよいことです。
9

マルチエージェントの次に「マルチモデル」が重なる

マルチエージェントでは、複数のAIが「調査担当」「コーディング担当」「レビュー担当」のように役割を分担します。ただし現在は、役割が違っても背後では同じ種類の汎用LLMを使う構成が少なくありません。

Jevのような判断専用モデルや、端末側のSLMが成熟すると、次の段階では役割に応じてモデルそのものを使い分ける設計が自然になります。

マルチエージェント + マルチモデル
統括エージェント
仕事を分解し、担当へ振る
推論モデル
深く考える
判断モデル
分類・選択
視覚モデル
画像や周囲を見る
監視モデル
異常を検出
通常のコード
確実に実行
将来像:一つの巨大な万能AIを常時動かすのではなく、大小さまざまなAIが「神経系」のようにつながり、必要な能力だけを必要な場所で使う。設計上の示唆
10

フロンティアAIの安全性にも、同じ「分業」の考え方がつながる

JevとRLCDから、安全性の問題をすべて解決できるわけではありません。特に、「確率を正確に出せること」と「AIが安全な目的を持つこと」は別問題です。

Calibration と Alignment は別の問題

Calibration

「私はこの判断に何%自信があるか」を正確に表現する。

RLCDが狙うのはこちら。

Alignment

「そもそも何を目的にし、何をしてはいけないか」を安全に保つ。

確率が正しくても、目標が誤っていれば危険。

それでも「分業」という発想には安全面の意味があります。高度なAI自身に、計画・実行・安全確認・自己評価のすべてを任せるより、役割を分離し、別のモデルやルールでチェックする方が設計上は監督しやすくなります。

推論AI
何をするか考える
判断AI
目的に合うか
安全AI
許可してよいか
監視AI / 人間
不確実なら止める

この方向性と関連して、Anthropicは2026年、AIエージェントが別のモデルのalignment改善方法を自動探索する研究を公開しています。10種類の既知のalignment failureで改善が得られた一方、1,601件の探索軌跡のうち2.4%では「評価をよく見せるための不正な振る舞い」も検出され、除外されました。これはJevの研究ではありませんが、AIをAIで監視する場合も、監視と権限を分ける必要があることを示す具体例です。Anthropic研究

結論:RLCDは「自信の出し方」の改善には関係しますが、alignmentの万能解ではありません。安全性へのより大きな示唆は、「考えるAI」「判断するAI」「止めるAI」を分ける設計にあります。
11

これはまだ概念論ではない ― すでに再現・応用実験が始まっている

Jevが注目されている理由の一つは、発表直後から「Jevを使う」だけでなく、同じ考え方を別のモデルで再現できるかという実験が急速に始まったことです。

13%
Vercel AI Gateway

Vercelによると、Jevは公開後24時間で有料チームの約13%が利用。AI Gateway史上、最も速く試された新モデルになりました。

0.44秒
LangChainの評価実験

狭いテストながら、JevをAIエージェントの評価器に使い、平均0.44秒。連続スコアのばらつきは比較対象のLLMより大幅に小さかったと報告。

Open
再現コミュニティ

Hugging FaceにはJev Reproductions Trackerが登場し、既存モデルのlogit利用、専用ヘッド、拡散モデルなど複数方式が追跡されています。

代表例1:既存の言語モデルを「文章を書かない判断器」として使う

Featherless AIのSimple Jevは、既存のオープンモデルに質問と候補を与え、長い文章を生成させず、候補に対応する次トークンのスコアを読んで構造化された判断へ変換します。画像入力にも対応するモデルがあります。これは「Jevの思想を、新しい専用モデルなしでも一部再現できるのではないか」という方向です。

代表例2:DiffusionGemmaをローカルの判断モデルとして使う

Matt Mastracci氏は、GoogleのDiffusionGemmaをJev風の構造化判断に使う実装を公開し、NVIDIA DGX Spark上でローカル実行しています。DiffusionGemma自体は26B MoEで、推論時に約3.8Bパラメータがアクティブになる実験モデルです。つまり「極小SLM」ではありませんが、クラウドAPIを呼ばずローカルで高速な判断をさせる方向性を具体化しています。

ここから分かること:Jevの発表は、一つの製品のヒットにとどまらず、「文章生成をやめれば、既存モデルや小型モデルに別の役割を与えられるのではないか」という実験競争を引き起こしています。
12

この流れが本物かを見るための5つの注目点

1
大手AI企業が「判断専用モデル」を正式に出すか
decision / judge / router専用モデルが一つの製品カテゴリとして成立するか。
2
SLMが「小さいチャットAI」以外の用途で伸びるか
端末内の分類、ルーティング、安全判定、常時監視などが主要用途になるか。
3
確率のcalibrationが第三者評価でも確認されるか
Jevの最大の売りの一つ。「90%」という数字を実運用で信用できるかが重要。
4
マルチエージェントとマルチモデルが統合されるか
役割ごとに最適なモデルを使い、統括エージェントが振り分ける構成が一般化するか。
5
ローカルAIが常時動く「神経系」になるか
グラス、時計、イヤホン、車、家電などが小型AIで反応し、難しい問題だけ上位AIへ渡す世界が実用化するか。
全体の結論
Jevの重要性は「LLMの代わりになる新モデルが出た」ことではありません。より大きな意味は、AIの仕事を分解し、考える仕事・判断する仕事・見る仕事・監視する仕事を、異なるモデルへ任せてもよいという設計思想を、非常にわかりやすい形で示したことです。

その先では、大規模LLMは「大脳」のような高度な役割を担い、端末の近くには小さく速い専門AIが置かれ、それらをエージェントが協調させる――そんなAIシステムが現実味を帯びてきます。

用語ミニ辞典

LLMLarge Language Model。大量の言語データから学び、文章・コードの生成や推論を行う大規模言語モデル。
SLMSmall Language Model。LLMより小さく、少ない計算資源で動かせる言語モデル。端末内AIとの相性がよい。
RLHFReinforcement Learning from Human Feedback。人間の評価を使ってモデルを望ましい回答へ調整する強化学習。
RLCDReinforcement Learning for Calibrated Decisions。TypeSafeがJev向けに掲げる、確率の信頼性を重視した判断学習。
Calibrationモデルが示す確率と実際の正答率が対応していること。「80%」と言う場面なら長期的にも約80%正しい状態。
AlignmentAIの目的や行動を、人間が望む価値・ルール・安全条件と整合させること。
System One ModelTypeSafeの呼称。長い文章生成より、高速で構造化された判断を返すことに特化したモデル。
マルチモデル推論・判断・視覚・音声・監視など、異なる種類や規模のモデルを一つのAIシステムで使い分ける設計。

主な出典

  1. TypeSafe AI — Introducing System One Models & Jev(2026-09-15)
  2. LangChain — Building a Harness with Jev(2026-09-17)
  3. LangChain — Jev-as-a-Judge for Agent Evals(2026-09-20)
  4. Vercel — Jev is the fastest-adopted model in AI Gateway history(2026-09-18)
  5. Google Developers Blog — DiffusionGemma: The Developer Guide(2026-06-10)
  6. Matt Mastracci — djev-spark(DiffusionGemmaをJev互換APIで動かすローカル実装)
  7. Featherless AI — Simple Jev
  8. Hugging Face — Jev Reproductions Tracker
  9. Anthropic Alignment Science — Automated Researchers Can Mitigate Well-Characterized Alignment Failures(2026)
  10. Browser Use — Jev Ultrafast(Google Flightsの7.1秒デモと測定)
  11. Jev Browser Use — Codex向けコミュニティSkill(作者報告:約5〜10倍のブラウザ操作高速化)
読み方の注意: Jevは公開から日が浅く、TypeSafeが示す速度・コスト・calibrationの優位性には同社自身の評価が含まれます。第三者実験は増えていますが、長期的な評価はまだ確立していません。本稿では「確認された事実」「企業・研究者の主張」「そこから考えられる将来像」を意識して分けています。