Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

System One Modelとは

System One model は TypeSafe AI が提唱する、ソフトウェアが直接使える「速くて構造化された判断」を返すAIモデルのクラス。

テキストを生成するLLMとは違い、状態(state) と 型付きの質問(typed questions) を受け取り、型付きの答えと確率 を返す。

名前の由来

Daniel Kahneman『ファスト&スロー(Thinking, Fast and Slow)』の二重過程理論から来ている。

System 1System 2
人間の思考速い・直感的・自動的遅い・熟慮的・論理的
AIでの対応System One model(Jevなど)推論型LLM(Chain-of-Thought等)

LLMは推論(System 2的な思考)の方向へ進化してきたが、ソフトウェアの自動化で大量に必要になるのは「このチケットは返金依頼か?」「どの部署に回すべきか?」のような 小さく速い判断 であり、それを専門に担うのが System One model という位置づけ。

Why System One?

創業者の Diogo Almeida(OpenAIで instruction following の開発に携わった)の問題意識は「チャットでは超人的な性能なのに、自動化はどこにあるのか?」というもの。

LLMをソフトウェアの部品として使うときの典型的な問題:

  • 出力が自由なテキストなので、パースが必要で、JSONが壊れる・ありえない選択肢を返すなどの 型エラー が起こる

  • 自己回帰で1トークンずつ生成するため 遅く、高い

  • RLHFで人間の好みに最適化されているため、過信(overconfident) しがちで、確信度が当てにならない(sycophancyや自信満々のハルシネーション)

TypeSafeは「将来の大規模なAI自動化は 99% が機械対機械、1% が人間とのやり取りになる」と考えており、人間に読みやすいテキストよりも 信頼できる制約された出力 が重要だとしている。

LLMとの違い

LLMSystem One model
出力自由なテキスト事前定義された型付きの値(+確率・確信度)
生成方式自己回帰(逐次)並列(1回のパスで全質問に回答)
学習目標人間の好み(RLHF)・検証可能な報酬(RLVR)結果に対してキャリブレーションされた確率(RLCD)
型エラー起こりうる構造上起こらない
できないこと-コード・説明文などのテキスト生成

System One model は テキスト生成能力を捨てる 代わりに、速度・コスト・信頼性を得ている。

基本的な使い方の考え方

  1. 判断に必要な文脈を state にまとめる(テキスト・JSONオブジェクト・テキストの配列)

  2. 独立した 複数の質問 を同時に投げる

  3. 返ってきた答えと confidence をもとに、通常の(決定的な)コードで分岐する

つまり、LLMにワークフロー全体を任せるのではなく、制御はコードが持ち、曖昧な判断だけをモデルに任せる という設計思想。

質問の型(primitives)

型問い返り値例
Choiceどの選択肢か?(順序なし)choice, probabilities, confidenceチケットの振り分け、文書分類
Scoreどのレベルか?(順序あり)score, legend, probabilities, confidenceバグの深刻度、顧客の苛立ち度
Noulこれは真か?noul(0〜1の確率)返金依頼か、PIIを含むか

Noulの0.5は「Yes/Noが半々」という意味で、「中くらい」ではない。程度を測りたいならScoreを使う。

Probability と Confidence

  • probability:選択肢(レベル)上の確率分布

  • confidence:その分布がどれだけ1点に集中しているかを 0〜1 に要約した値

1つの選択肢に全確率が乗れば 1.0、一様に広がるほど低くなる。例えば3択のChoiceでは

confidence=3⋅max⁡kpk−12\text{confidence} = \frac{3 \cdot \max_k p_k - 1}{2}

(一般には KK 択なら Kmax⁡kpk−1K−1\frac{K \max_k p_k - 1}{K - 1} と同じ形と思われる)

Confidenceによる3段階の運用

confidenceアクション
高そのまま自動で実行
中追加情報を集める・ユーザーに確認する
低人間にエスカレーション・別システムにフォールバック

閾値は 間違えたときの影響の大きさ に応じて変える(読み取りだけの操作は低め、送金などの破壊的な操作は高め)。

キャリブレーション

キャリブレーションされたモデルでは、確率0.2と言った事象が実際に約20%で起き、0.8と言った事象が約80%で起きる。

これにより「確率が高いときは自動実行、低いときは人間へ」という判断を 確率そのものに基づいて 設計できる。

TypeSafeはこのための事後学習手法を RLCD(Reinforcement Learning for Calibrated Decisions) と呼び、RLHF・RLVRに続く第3の事後学習パラダイムと位置付けている。

代表的な設計パターン

TypeSafeのドキュメントでは以下のようなパターンが紹介されている(Patterns)。

  • Speculative Fan-Out:必要になるかもしれない質問も含めて1回のリクエストでまとめて投げ、コード側で使う答えを選ぶ(並列処理なので質問を増やしてもほぼコストが増えない)

  • Confidence-Gated Routing:confidenceを分岐の軸にする

  • Composite Scoring:複雑な判断を小さなScoreに分解し、コードで重み付けして合成する

  • Intent Routing:リクエストを分類して最適なハンドラに振り分ける

同じリクエスト内の質問は 互いに独立 で、ある答えを別の質問の文脈にはできない。依存関係がある場合はリクエストを分ける。

エコシステム

  • Jev:TypeSafe AIの最初のSystem One model(商用API)

  • OpenJev系:Jevの発表直後に大量に登場したオープンソースの再現・代替実装

  • CLM(Contrastive Language Model):対照学習でstateとactionを結ぶ、オープンウェイトのSystem One model