主権AI鍛造所 — 公開教材をLLM訓練データに鍛造する

すべての国は自国のLLMを持つべきです。しかしデータがなければモデルは作れません。SovAI Forgeは、国がすでに持っている——小学校から高校までの教科書と過去の試験問題——をそのまま使える訓練セットと評価セットに鍛造します。

これは何か

各国のオープンライセンス教育資料(教科書・過去問)を構造化されたLLM訓練セットと評価セットに変換します。学習指導要領は国民が知るべきことを定義し、教科書は自国語で完全な説明を提供し、過去問は公式解答付き——その構造はまさに訓練データに必要な形です:問題が入力、公式解答が正解、教科書が推論の根拠。

なぜ必要か

すべての国は自国の主権LLMを持つべきです。主権はデータの中にあります。今日の最強の言語モデルは、あなたの国で訓練されたものではありません。政府のシステムがその国を本当に理解していないモデルに判断を委ね始めたとき——これは性能の問題ではなく、主権の問題です。

仕組み

3つの経路、1つのフレームワーク

パイプライン: Ingest → Validate → Ground → Generate → Export、3つの出力パス

A. 推論型訓練セット

試験問題を教科書の章と組み合わせ、LLMは答えを見ずにブラインド解答で推論します。正解に到達した推論のみが収録されます——これにより、各訓練データの推論過程が本当に導き出されたものであり、答えを見てから逆算した合理化ではないことを保証します。

各問題をk=4回試行し、正解のみ収録。全て不正解の難問はhardとしてマークされ、ベンチマークセットに入ります。

Q/Aペアリングの原理:設問をQとし、解答で該当する教科書の段落を検索してAとし、両者を組み合わせて訓練データにする

B. ベンチマーク評価セット

過去の試験問題そのものが評価データです——問題が入力、公式解答が正解。公開教材に根拠が見つからない問題(unsupported)は、モデルの能力を最も識別できるベンチマーク項目になります。

エクスポート形式はlm-evaluation-harnessに直接対応し、即座に標準化された評価を実行できます。

ベンチマークの原理:試験問題には最初から正解が付いており、根拠ありの問題とunsupportedな問題の両方がlm-evaluation-harnessにエクスポートされる

C. 合成問題

教科書の文章から新しい問題を生成します。出題と解答を分離:まず問題を生成し、次にn回独立してブラインド解答します。n回全ての解答が一致し、かつ主張された答えと等しい場合のみ収録。不一致は曖昧さまたは誤りを意味し、即座に破棄します。

合成問題は訓練セットのみに使用し、ベンチマークには入れません。n-gram重複排除で既存の問題集との衝突を防ぎます。

合成問題の原理:出題器と解答器を分離し、複数回のブラインド解答が一致した場合のみ収録する

設計原則

選材の一線

公開領域の教材のみ(学習指導要領、CC BY/BY-SA、パブリックドメイン)。NCライセンスは一切拒否しバイパスフラグなし——出力データセットはCC BY-SA 4.0で、各国が自由に採用可能。

強制的な根拠付け

LLMは推論を生成するために教科書の文章を引用しなければならない。公開教材の根拠が見つからない問題は却下——追跡可能な推論こそが「主権」の実質的内容。

ブラインド解答による品質管理

答えを見せない推論で事後合理化を防止。正解のみ収録、不正解は破棄——rejection samplingが同時に難易度ラベルを生成。

自己整合性検証

LLM生成の新問題はself-consistencyで品質管理:複数回のブラインド解答が全て一致して初めて収録。出題と解答を完全に分離し、自己採点を防止。

各ステージの出力はJSONL——git diffで確認可能、中断後の再開時は処理済み項目を自動スキップ。

特色

ライセンスの一線は越えない

NC ライセンスは即拒否——バイパスフラグなし

ブラインド解答、答えを見ない

答えを見ずに推論——事後合理化を防止

JSONLが状態

各レコードは完了時に即書き込み——いつでも中断・再開可能

再開可能

処理済み項目をスキップ——APIコストの重複なし

はじめる

pip install sovai-forge
forge --recipe recipe.yaml ingest
forge --recipe recipe.yaml ground
forge --recipe recipe.yaml generate
forge --recipe recipe.yaml export --format messages

ライセンス

フレームワーク

MIT

出力データセット

CC BY-SA 4.0

試験問題の著作権は各試験実施機関に帰属します。本プロジェクトは公開された試験問題とオープンライセンスの教材のみを処理します