主權 AI 鍛造所 — 把公開教材鍛造成 LLM 訓練資料
每個國家都該有自己的 LLM。但沒有資料,就沒有模型。SovAI Forge 把一個國家已經擁有的——國小到高中的教材與歷年考題——鍛造成可直接使用的訓練集與評測集。
這是什麼
將各國公開授權教育資料(教科書、歷年考題)轉化為結構化的 LLM 訓練集與評測集。課綱定義了公民必須知道什麼,教材用本國語言寫成完整說明,歷年考題附有官方標準答案——其結構剛好就是訓練資料需要的形狀:題目是輸入,官方答案是標準答案,課文是推理依據。
為什麼需要
每個國家都該有自己的主權 LLM,而主權在資料裡。今天世界上最強的語言模型,都不是在你的國家訓練的。當一個國家的公務系統、教育現場開始把判斷交給模型,卻沒有一個模型真正讀懂這個國家——這不只是效能問題,是主權問題。
怎麼運作
三條路徑,一個框架
A. 推理型訓練集
考題搭配章節課文,LLM 不看答案進行盲解推理。只有推導出正確答案的推理才會被收錄——這確保每筆訓練資料的推理過程是真正推導出來的,不是看到答案後倒推合理化。
每題跑多次(k=4),答對才收。全部失敗的難題標記為 hard,進入評測集。
B. Benchmark 評測集
歷年考題本身就是現成的評測資料——題目是輸入,官方答案是標準答案。無法在公開教材中找到依據的題目(unsupported),反而是最能區分模型能力的評測題。
匯出格式直接對接 lm-evaluation-harness,可立即執行標準化評測。
C. 合成新題
從課文段落生成全新考題。出題與解題分離:先生題,再盲解 n 次——只有 n 次答案完全一致且等於原聲稱答案才收錄。不一致代表題目有歧義或答案有誤,直接丟棄。
合成題只進訓練集、不進 benchmark,並以 n-gram 去重防止與既有題庫撞題。
設計原則
選材紅線
只收公開領域教材(課綱、CC BY/BY-SA、公有領域)。NC 授權一律拒絕且無繞過旗標——資料集掛 CC BY-SA 4.0,確保各國可自由採用。
強制溯源
LLM 必須引用章節課文才能產出推理。查不到公開教材依據的題目退件——可溯源的推理才是「主權」的實質內容。
盲解把關
不給答案推理,避免倒推合理化。答對才收、答錯丟棄——rejection sampling 同時產生難度標籤。
自洽驗證
LLM 出的新題用 self-consistency 把關:多次盲解全部一致才收。出題與解題完全分離,防止自己出題自己給分。
每一段輸出都是 JSONL,可 git diff 檢視,中斷後重跑自動跳過已完成項目。
特色
授權紅線不可繞過
NC 授權直接拒絕,不設旗標繞過
盲解不給答案
不看答案推理,避免倒推合理化
JSONL 即狀態
每筆寫完即落盤,隨時中斷續跑
中斷續跑
跳過已處理項目,不重複花費
開始使用
pip install sovai-forge
forge --recipe recipe.yaml ingest
forge --recipe recipe.yaml ground
forge --recipe recipe.yaml generate
forge --recipe recipe.yaml export --format messages
授權
框架本身
MIT
產出資料集
CC BY-SA 4.0
考題著作權屬各原命題機關;本專案僅處理已公開之試題與公開授權之教材