共通テスト AI比較

Jev vs luna-none / luna-low / terra-none / sol-none ── 令和8年度 大学入学共通テスト(本試験)23科目・836問

English

調査の目的

TypeSafe AI の日本語の性能は、OpenAI のモデルに匹敵するのか?

手法とその動機

日本語の知識を横断的に測れる公開問題として、大学入学共通テストを選定した。1問ずつ、あるいは依存し合う問題はテキストのみでまとめて渡し、両モデルを公平な条件で比較した。図表は別のAIで事前に文字化したテキストを与えている。

結論

  1. CoT を挟まない luna-none に対しては、Jev のほうが賢く、しかも速い。
  2. CoT を挟む luna-low には精度で劣るが、コストと時間では Jev が圧倒的に有利。
  3. 推理オフ同士では sol-none が最も高く luna-low に匹敵し、terra-none は luna-none を下回る。

データ

ひと目でわかる比較

科目の組み合わせ(1000点換算):

科目別の得点

大問別の得点

分類を選ぶ
科目を選ぶ

速さ・費用

費用: Jev 入力 $0.042/100万トークン、luna 入力 $0.2・出力 $1.2。時間は全836問のAPI応答時間の合計。

ダウンロード

科目別JSON
問題(出典): 問題は大学入試センターが公開している令和8年度本試験の問題を使用。 大学入試センター 令和8年度 本試験問題

リクエストの形式

すべての科目で、問題はテキストとしてモデルに渡した。図表は別のAIで事前に文字起こしし、そのテキストを問題文と一緒に含めている。1問ずつ、依存し合う問題はまとめて1回で送る。以下は形式のサンプル(内容はダミー)。

Jev — TypeSafe System One(Choice)

POST https://api.typesafe.ai/v1/systemone

{
  "model": "jev-latest",
  "state": {
    "question": "(問題文。図表は文字起こししたテキストをここに含める)",
    "figure_note": "(図・表をテキスト化した説明)"
  },
  "questions": {
    "blank_ア": {
      "type": "choice",
      "instructions": "空欄【ア】に入る最も適当なものを選べ。",
      "criteria": { "0": "選択肢0の内容", "1": "選択肢1の内容", "2": "選択肢2の内容" }
    }
  }
}

luna — OpenAI互換(構造化出力)

POST {OPENAI_URL}/chat/completions

{
  "model": "gpt-5.6-luna",
  "reasoning_effort": "none",
  "messages": [{
    "role": "user",
    "content": "(問題文+図表のテキスト)\n各空欄の答えを、選択肢キーで答えよ。"
  }],
  "response_format": {
    "type": "json_schema",
    "json_schema": {
      "name": "answers",
      "strict": true,
      "schema": {
        "type": "object",
        "properties": { "ア": { "type": "string", "enum": ["0", "1", "2"] } },
        "required": ["ア"],
        "additionalProperties": false
      }
    }
  }
}

reasoning_effort は none(luna-none)または low(luna-low)。