主權 AI 鍛造所 — 把公開教材鍛造成 LLM 訓練資料

每個國家都該有自己的 LLM。但沒有資料,就沒有模型。SovAI Forge 把一個國家已經擁有的——國小到高中的教材與歷年考題——鍛造成可直接使用的訓練集與評測集。

這是什麼

將各國公開授權教育資料(教科書、歷年考題)轉化為結構化的 LLM 訓練集與評測集。課綱定義了公民必須知道什麼,教材用本國語言寫成完整說明,歷年考題附有官方標準答案——其結構剛好就是訓練資料需要的形狀:題目是輸入,官方答案是標準答案,課文是推理依據。

為什麼需要

每個國家都該有自己的主權 LLM,而主權在資料裡。今天世界上最強的語言模型,都不是在你的國家訓練的。當一個國家的公務系統、教育現場開始把判斷交給模型,卻沒有一個模型真正讀懂這個國家——這不只是效能問題,是主權問題。

怎麼運作

三條路徑,一個框架

Pipeline: Ingest → Validate → Ground → Generate → Export,三條輸出路徑

A. 推理型訓練集

考題搭配章節課文,LLM 不看答案進行盲解推理。只有推導出正確答案的推理才會被收錄——這確保每筆訓練資料的推理過程是真正推導出來的,不是看到答案後倒推合理化。

每題跑多次(k=4),答對才收。全部失敗的難題標記為 hard,進入評測集。

Q/A 配對原理:題目為 Q,用答案檢索課文段落作為 A,兩者配對成訓練資料

B. Benchmark 評測集

歷年考題本身就是現成的評測資料——題目是輸入,官方答案是標準答案。無法在公開教材中找到依據的題目(unsupported),反而是最能區分模型能力的評測題。

匯出格式直接對接 lm-evaluation-harness,可立即執行標準化評測。

Benchmark 原理:考題自帶標準答案,有課文依據的題目與 unsupported 題目一起匯出對接 lm-evaluation-harness

C. 合成新題

從課文段落生成全新考題。出題與解題分離:先生題,再盲解 n 次——只有 n 次答案完全一致且等於原聲稱答案才收錄。不一致代表題目有歧義或答案有誤,直接丟棄。

合成題只進訓練集、不進 benchmark,並以 n-gram 去重防止與既有題庫撞題。

合成新題原理:出題與解題分離,多次盲解一致才收錄,否則丟棄

設計原則

選材紅線

只收公開領域教材(課綱、CC BY/BY-SA、公有領域)。NC 授權一律拒絕且無繞過旗標——資料集掛 CC BY-SA 4.0,確保各國可自由採用。

強制溯源

LLM 必須引用章節課文才能產出推理。查不到公開教材依據的題目退件——可溯源的推理才是「主權」的實質內容。

盲解把關

不給答案推理,避免倒推合理化。答對才收、答錯丟棄——rejection sampling 同時產生難度標籤。

自洽驗證

LLM 出的新題用 self-consistency 把關:多次盲解全部一致才收。出題與解題完全分離,防止自己出題自己給分。

每一段輸出都是 JSONL,可 git diff 檢視,中斷後重跑自動跳過已完成項目。

特色

授權紅線不可繞過

NC 授權直接拒絕,不設旗標繞過

盲解不給答案

不看答案推理,避免倒推合理化

JSONL 即狀態

每筆寫完即落盤,隨時中斷續跑

中斷續跑

跳過已處理項目,不重複花費

開始使用

pip install sovai-forge
forge --recipe recipe.yaml ingest
forge --recipe recipe.yaml ground
forge --recipe recipe.yaml generate
forge --recipe recipe.yaml export --format messages

授權

框架本身

MIT

產出資料集

CC BY-SA 4.0

考題著作權屬各原命題機關;本專案僅處理已公開之試題與公開授權之教材