主權 AI 訓練語料庫採無償授權引爭議 出版界呼籲建立合理採購機制

為了建立具在地文化特色的大型語言模型(LLM),數位發展部日前啟動「台灣主權 AI 訓練語料庫」民間徵集計畫,規劃以自願且無償授權的形式,向出版社與創作者徵集文字作品。然而,這項做法引發台灣出版產業強烈關切,業界團體出面呼籲政府應編列預算合理採購高質量資料,而非要求民間業者免費提供。

無償授權引發出版業擔憂 業界期待建立標準收費機制

數發部推動的語料庫計畫,旨在集結民間文字資源以協助研發本土人工智慧(AI)模型。雖然官方說明該機制採取自願參與並提供隨時退出的下架申請,但出版商業同業公會全國聯合會理事長吳政鴻表示,內容一旦輸入模型完成訓練,事後退出的追溯與清除相當困難。此外,公會認為政府身為政策推手,若以免費作為徵集標準,恐怕會給民間與國際科技公司樹立「訓練語料應為免費」的壞示範,進而影響未來商業模型的計費機制建立。

包含遠流出版董事長王榮文與獨立出版聯盟理事長陳夏民等業界代表亦指出,要打造真正具備競爭力的本土模型,單靠免費資料並不足夠,高品質的有償內容不可或缺。多位出版界人士建議,政府應在現行財政狀況充裕的情況下,將資源優先投注於高品質語料的合法採購,而非僅憑政策號召要創作者無償捐出權利。

著作權與刑事責任未解 成為科技業投資內容產業屏障

除了收費機制的討論,著作權保護與法律責任也是產業關注的核心焦點。美國 AI 公司 Anthropic 近年就因使用未經授權的書籍訓練 Claude 模型,面臨高額賠償和解。王榮文分析,國外經驗顯示資料獲取若缺乏嚴謹法律規範,後續將伴隨極大的訴訟風險;而在台灣現行著作權法架構下,甚至涉及刑事追訴,導致本土科技企業對於投資語料軟體與內容產業心存疑慮。

業界人士進一步指出,目前已有國際大型語言模型逕自擷取台灣網路上的優質內容進行訓練,本土創作者不僅無法獲得合理的利潤分潤,也難以對跨國業者進行追討。業者期盼政府應優先釐清公部門現有影音圖文內容的公開授權範圍,並考慮針對 AI 訓練的著作權法規進行合宜調整,才能為台灣內容產業與科技業搭起良性合作的橋樑。

這代表什麼

對於台灣的人工智慧發展與數位內容生態系而言,語料庫的建置方式具有指標性意義。本土主權 AI 的發展關鍵在於優質的繁體中文資料,但若強制要求內容創作者以無償方式提供成果,恐將削弱台灣原創內容產業的獲利能力,長遠來看將導致高品質內容生產減少,間接損害整體模型訓練的資料品質。

對中小企業與創作者來說,此事件顯示出數位資產保護的機制急需建立。如果政府能夠透過這波討論,規劃出健全的文本資料計費體系與商業分潤模式,未來國內企業在開發或調校特定領域模型時,就能有明確且合法的收費標準可循,實現科技研發與內容產業的雙贏。

背景補充

所謂的「主權 AI(Sovereign AI)」,是指一個國家或地區利用自有的數位基礎設施、數據與人力資源,自主開發與維運的生成式人工智慧系統。推動主權 AI 的主因,在於避免過度依賴外國技術,並防止語言模型產出的內容充斥西方觀點或簡體中文的用語邏輯,藉此維護在地的文化主權與價值觀。

在國際發展上,大型語言模型在資料獲取階段的版權爭議屢見不鮮。國際科技巨頭如 OpenAI 與 Anthropic 等,早期因爬取網路公開資料訓練模型而頻遭創作者與新聞機構起訴。近年來,許多國際企業已開始轉向與大型出版社、媒體機構簽訂內容授權合約,付費取得合法的訓練資料,這也使得授權機制成為全球 AI 發展過程中的重要議題。

常見問題

數發部的「台灣主權 AI 訓練語料庫」徵集計畫採取什麼方式?

數發部規劃以自願參與且無償授權的方式向民間徵集作品,並提供後續申請退出的機制,但此舉引來出版業界對合理補償的關切。

為何出版界反對以免費方式提供語料?

出版界認為官方定調免費會設定不良示範,影響未來商業模型的計費標準,且已訓練入模型的資料難以完全撤回,政府應編列預算有償採購高品質內容。

建立主權 AI 對台灣發展有何重要性?

建置主權 AI 能避免模型過度偏向簡體中文或西方觀點,有助於維持台灣在地文化特色與資訊自主性,但需結合完善的法律與授權機制才能永續發展。