Jev vs luna-none / luna-low / terra-none / sol-none ── 令和8年度 大学入学共通テスト(本試験)23科目・836問
TypeSafe AI の日本語の性能は、OpenAI のモデルに匹敵するのか?
日本語の知識を横断的に測れる公開問題として、大学入学共通テストを選定した。1問ずつ、あるいは依存し合う問題はテキストのみでまとめて渡し、両モデルを公平な条件で比較した。図表は別のAIで事前に文字化したテキストを与えている。
科目の組み合わせ(1000点換算):
費用: Jev 入力 $0.042/100万トークン、luna 入力 $0.2・出力 $1.2。時間は全836問のAPI応答時間の合計。
すべての科目で、問題はテキストとしてモデルに渡した。図表は別のAIで事前に文字起こしし、そのテキストを問題文と一緒に含めている。1問ずつ、依存し合う問題はまとめて1回で送る。以下は形式のサンプル(内容はダミー)。
POST https://api.typesafe.ai/v1/systemone
{
"model": "jev-latest",
"state": {
"question": "(問題文。図表は文字起こししたテキストをここに含める)",
"figure_note": "(図・表をテキスト化した説明)"
},
"questions": {
"blank_ア": {
"type": "choice",
"instructions": "空欄【ア】に入る最も適当なものを選べ。",
"criteria": { "0": "選択肢0の内容", "1": "選択肢1の内容", "2": "選択肢2の内容" }
}
}
}
POST {OPENAI_URL}/chat/completions
{
"model": "gpt-5.6-luna",
"reasoning_effort": "none",
"messages": [{
"role": "user",
"content": "(問題文+図表のテキスト)\n各空欄の答えを、選択肢キーで答えよ。"
}],
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "answers",
"strict": true,
"schema": {
"type": "object",
"properties": { "ア": { "type": "string", "enum": ["0", "1", "2"] } },
"required": ["ア"],
"additionalProperties": false
}
}
}
}
reasoning_effort は none(luna-none)または low(luna-low)。