來源於:大模型“吃”了全網的語料 “合理使用”與侵權的邊界如何劃清?-pg官網官網
發布時間:2026-08-28 23:59:45
文章摘要:
大模型“吃”了全網的語料 “合理使用”與侵權的邊界如何劃清?-pg官網官網:大模型“吃”了全網的語料 “合理使用”與侵權的邊界如何劃清?-pg官網官網 大模型“吃”了全網的語料 “合理使用”與侵權的邊界如何劃清?-pg官網官網
當大模型廠商競相為千億算力基建燒錢時,吃一顆更為隱秘的大模的邊“版權暗雷”正在逼近。 8月中旬,型全開雲官方平台入口蘋果擬付數億美元采購新聞語料的語料消息傳出,一時激起內容行業千層浪。合理劃清近兩年,使用圍繞AI訓練語料的侵權版權訴訟已在全球蔓延。 新聞界,界何《紐約時報》起訴OpenAI和微軟公司,吃指控兩家企業未經授權使用數以百萬計文章訓練ChatGPT等大模型。大模的邊文學界,型全包括兩屆普利策獎得主約翰·卡雷魯等六位作家,語料同時將Anthropic、合理劃清OpenAI、使用穀歌、侵權Meta、xAI及Perplexity告上法庭,指控其實施了“蓄意盜竊行為”。 此前,據媒體報道,Anthropic被指控濫用著作訓練AI聊天機器人Claude,後經和解,仍需支付15億美元賠償金。這也是目前美國版權案中已知金額最高的和解協議。 國內方麵,去年11月,上海市金山區人民法院一審宣判了上海首例人工智能大模型著作權侵權案,涉及《鬥破蒼穹》係列動漫中角色形象的複製權、信息網絡傳播權問題。 迭代的大模型一路狂奔,背後的“版權之爭”如何破局?麵對爭議,法律上如何界定“合理使用”與“侵權”的邊界?記者就此對話了相關律師、知識產權教授及出版商等內容從業者。 “按量付費”是公平交易還是定價權遊戲? 蘋果這一動作之所以引發關注,不隻是因為它計劃掏了數億美元買新聞版權,也因其提出“按量付費”的浮動報酬機製。即當合作方內容實際被 Siri 使用時,才向出版商支付費用。 有人認為,蘋果此次提出的“按使用量付費”模式,這是AI時代內容授權的新範式。 從版權保護的法律層麵,“按量付費不是新範式。蘋果支付的依然是因AI使用受版權保護作品而產生的美國版稅,所涉作品類型與授權內容都依照美國現行《版權法》判定。按量付費本身是版權法常見的許可費計價模式之一。” 上海財經大學競爭法與知識產權研究中心執行主任厲彥冰告訴記者。同時她也是上海財經大學中國式現代化研究院特聘研究員,主要研究方向是知識產權與競爭法、數據與人工智能法。開雲官方平台入口 “按量付費”就能完全規避侵權風險嗎? 北京大成(上海)律師事務所高級合夥人、律師傅鋼特別強調:著作權法關注的是企業實際實施了哪些作品使用行為,以及這些行為是否獲得許可,而不是費用是一次性支付還是分期支付。 “合同即使約定了Siri展示新聞時按次付費,如果來源方的權利有瑕疵,或者授權範圍沒有完全覆蓋使用場景,仍然可能產生侵權或違約風險。”傅鋼表示。 不過,北京市中倫文德律師事務所上海分所合夥人、律師黃陽陽指出,在協議框架下“蘋果基本上規避了版權侵權的風險,除非其引用的新聞本身侵犯了第三方的版權,但一般情況下類似協議會約定使用方可以免責的條款”。 厲彥冰提醒,按量付費本身隻是許可費的計價方式,屬於合同條款,僅就次數和單價達成一致,並且隻約束合同當事人,不涉及AI使用作品的行為的定性問題。即便成為行業標準,它也無法解決複製與演繹的界定難題,還帶來了新的計量認定難題。就已公開的信息看,通常也不會披露此類計量口徑的細節。 “比如,一次查詢調用了三家出版商的五篇新聞報道、生成一段摘要,這是五次使用、三次還是一次?如果中間發生技術故障,進行了再次調用,但最終隻生成了一段摘要,這個使用量如何計算? “使用量”,是否針對抓取、訓練、檢索、引用、輸出等不同環節、不同目的的使用行為,分別分類計算?”哪怕是按量付費,當前的界定仍然不清晰。 這也意味著:技術模式的選擇,會直接影響到許可費的收取。 到實際運作層麵,AI大模型企業和內容方,“議價權到底在哪一邊”是大家關注的核心議題。 厲彥冰認為,無論是固定年費製度,還是按使用量付費,兩種計價方式本身無所謂優劣,真正決定結果的是議價能力:“誰掌握計量數據,誰就掌握定價的解釋權。”區別在於,固定授權(如固定年費)模式下,“內容有沒有被用”的風險由平台承擔,而按量付費把這個風險轉移給了傳媒或出版商。 通常來看,“計量數據是由平台掌握的,內容商既無法驗證自己的內容被調用了多少次,也不知總額多少如何分配,集體議價能力被削弱。”厲彥冰表示。 律師黃陽陽也認為,內容方在舉證內容是否侵權上,是存在劣勢的。目前高質量中文內容版權分散在海量不同權利人手中,出版商、新聞媒體等機構大多獨立且分散,對於版權方來說集體議價能力偏弱,對於AI平台來說獲取授權流程複雜、交易成本高昂。 一位出版社從業者透露,“從語料訓練的角度來講,出版社大家很多還沒意識到這個問題。對這個問題興趣不大,比較消極被動,這是出版社實際的反應狀態。” 他告訴記者,現在如果有人看中你的版權、願意支付費用,大家利益共享、風險共擔,對出版社而言是利大於弊的。但“應該是什麽”和“實際是什麽”是兩回事,這兩者之間是分裂的。 蘋果買新聞語料引市場波動,如何分析? 蘋果計劃投入最高數億美元資金獲取新聞內容版權的消息,在業內引發了不小震動。消息傳出當天,A股“AI語料”板塊大漲,讀客文化盤中一度20cm漲停,中信出版、中國出版、海天瑞聲等跟漲。 西南證券傳媒首席分析師苟宇睿認為,這類“海外映射”行情,具備情緒與主題資金輪動特征。長期來看,AI正推動傳媒內容產業,從“消費品"轉向“數據+IP資產“雙重定價。定價邏輯方麵,國內正從“規模競爭“轉向“價值和質量競爭“,政策在推動“以詞元為基礎的數據集價值體係”確權。 圖片來源:東方財富“AI語料”概念 對A股傳媒板塊估值比較大的影響在於,“讓市場從‘看渠道、看發行量’轉向‘看數據資產質量’。AI 語料敘事提供一個新的、成長性的估值敘事。”苟宇睿告訴記者。不過,他也提醒,Token價值體係落地,短期更多偏主題彈性,能否沉澱為長期估值中樞,仍需觀察後續授權交易、政策能否實質落地。 圖片來源:蘋果公司2025財年10-K年度報告 美國證券交易委員會(SEC) 回到蘋果購買新聞版權的新聞,這種“主動合規”的姿態,在其2025年年報中也可以找到線索。在2025年年報中,蘋果將AI列為風險因素。蘋果認為,AI等複雜技術可能使用戶接觸到有害或者不準確的內容,也可能涉及為訓練取得和使用受版權保護的材料,以及在模型輸出中再現受版權保護的內容,並由此產生產品修改、訴訟成本、許可費用和監管處罰。 “這說明蘋果公司已經將AI版權、內容安全和產品責任視為前置的中長期經營風險。”律師傅鋼認為,這對國內大模型廠商最直接的啟示是,AI語料合規應當覆蓋數據取得、清洗、訓練、微調、索引、檢索、輸出和投訴處理的完整過程。 花數億美元買新聞版權 未來內容行業會重估嗎? “未來真正稀缺的可能不是‘更多的數據’,而是能夠被大模型持續、穩定、合規使用的高質量數據資源。大模型廠商的數據競爭會逐步從早期的公開抓取,轉向與新聞媒體、出版機構、專業數據庫和垂直行業內容提供方建立長期授權合作,並通過權利清理、來源標記、使用範圍約定和調用審計來降低合規風險。”律師傅鋼告訴《科創板日報》記者。 苟宇睿也有類似的觀點。他認為,大眾通俗文本、公版書、開放網頁數據較多且供應充分。真正稀缺的是高質量、獨家、合規、可溯源的專業垂類數據,比如醫學教材與病例、法律判例、學術期刊、行業深度報告、權威新聞,以及多模態的真實物理交互數據。高質量、實時性內容正在變成AI競賽的重要資源之一。 哪些內容資產有望受益呢?苟宇睿的總結是:“稀缺+獨家+合規+可溯源+實時”,主要包括五類:專業垂類知識(學術/工具書/出版社類公司)、權威古籍/工具書(出版社)、實時權威新聞(主流媒體)、網文/影視IP(網文平台公司)、數據服務/加工類公司。 與此同時,未來語料相關廠商的收入結構和估值體係也可能麵臨重構,比如對內容方,理想路徑是在傳統出版/發行收入之外,新增“數據授權/API 調用分成/數據加工服務”這一增量收入線。傳統出版有望從“單純分紅/PE估值”向“分紅+數據/版權重估”雙邏輯切換。不過目前直接的語料授權收入尚未規模化兌現。 “不過,兌現節奏或許並不會非常快,存在幾個約束條件,首先權屬複雜、二是工程壁壘:從版權庫到"可用數據資產",中間要經曆數字化、清洗、標注、脫敏,成本不低,所以“重估”更可能發生在少數專業、獨家、稀缺、可溯源的垂類內容持有方,而非全行業。”苟宇睿表示。 IDC數據顯示,2025年中國人工智能基礎數據服務市場規模達到62.62億元人民幣,同比增長27.8%,增速超出市場預期。預計2026年市場規模將進一步增長至78.34億元,2025-2030年複合年均增長率達19.6%。 據業內人士梳理,目前,國內語料數據是“數據本地化+私有部署”為主,暫未公開大規模付費授權交易,以下三類做法並行。 1、自建/合作研發專有模型:如中信出版“誇父 AI”數智出版平台、中國出版推動“中華古籍大模型”、中文在線自研“逍遙”大模型、中原傳媒與騰訊合作“豫教大模型”等; 2、共建國家級正版語料庫:首批22家機構共建人工智能高質量語料庫,堅持“先授權、後使用”,覆蓋出版、傳媒、版權、科技等領域;人民網牽頭成立“主流價值語料生態聯盟”; 3、專業數據服務外包。 是“合理使用”還是侵權?未定論的全球爭議 多位律師告訴記者,人工智能大模型訓練語料時,使用版權人的作品,是“合理使用”還是侵權,主要法律爭議在與是否人工智能大模型的訓練使用行為是否構成著作權法意義上的合理使用。 對於是否侵權,雙方也是各執一詞。 AI公司認為,模型在學習了語言規律、知識關係和表達模式後,形成了一種新的技術工具和表達方式。從語料輸出到文本輸出,具有較強的轉換性,兩者無法等同。 版權方則認為,模型訓練通常以商業經營為目的,需要完整、大規模地複製作品,部分數據還可能來自盜版網站或者未經授權的數據集;模型不僅可能複現原作品,還可能生成大量替代性內容,削弱原有的出版、訂閱和授權市場,這是“侵權”。 “對大模型廠商而言,不能僅以訓練具有‘轉換性’作為當然抗辯;對權利人而言,也不能僅憑作品被用於訓練就當然推定侵權。”這是律師傅鋼的判斷。 黃陽陽也有類似的觀點,她認為,未經授權在訓練階段複製語料,不等於輸出內容一定侵權。而訓練合法,也不代表輸出摘要、轉述內容準確。 關於“合理使用”和侵權的界定,律師傅鋼認為,至少應該考慮以下問題:數據是如何取得的、訓練過程中實施了哪些複製行為、模型能否穩定複現受保護表達、最終產品是否與原作品或者權利人的業務形成競爭,以及企業是否采取了過濾、去重、阻止複現和處理投訴的措施。 到現實認定是否侵權時,情況則更為複雜。 “哪怕是同一項AI業務中,不同環節完全可能得出不同結論。比如法院可能認為訓練模型本身具有一定轉換性,但同時認為從盜版渠道取得和長期保存作品不屬於合理使用;也可能認為訓練階段缺少侵權證據,但模型發布、內容展示或者最終輸出構成侵權。”傅鋼進一步解釋道。 今年7月20日,持續近兩年的“巴茨訴Anthropic案”以十五億美元和解正式收官。法官認為Anthropic使用受版權保護的書籍來訓練Claude大語言模型在性質上屬於“典型的轉換性使用”,構成合理使用。但同時駁回了Anthropic用從影子圖書館下載的盜版書籍進行訓練的合理使用抗辯,認定構成侵權。 律師傅鋼認為,Bartz v. Anthropic案有借鑒意義的地方,是明確了“訓練目的具有轉換性”和“數據來源合法”是兩個獨立問題,不能因為後端用途具有創新性,就當然消除前端取得數據的侵權風險。 不過,法學教授厲彥冰也提醒,Bartz v. Anthropic案最終以15億美元和解終結,所以案件認定沒有產生有約束力的先例。當前唯一進入上訴審的Thomson Reuters v. ROSS案,第三巡回法院尚在審理中。 她指出,截至目前,美國沒有任何一家聯邦上訴法院就AI訓練是否構成合理使用作出過實體判決。就合理使用抗辯的認定,美國地區法院的既有判決認定,彼此也存在衝突。在是否侵權以及侵犯何種著作權上,同樣存在爭議。這種法律上的不確定性很難在短期消除。 版權保護不當 AI將“無米下鍋”? 如果版權保護不當,不少采訪對象也向記者表示了“竭澤而漁”的擔憂。AI越是肆無忌憚地吞噬版權內容,原創供給就越萎縮;原創供給越萎縮,AI就越隻能靠“複製自己、循環自己”續命。 皮尤研究中心發布的一項研究顯示,自ChatGPT 問世後發布的網頁中,超過三分之一可能帶有 AI 生成痕跡。研究結果顯示,大量網頁可能正在形成一種由機器人閱讀機器人生成內容的循環。 律師黃陽陽提醒,“知識凝固在模型參數權重裏,靠訓練學到的統計規律生成答案,知識不會自動更新,容易產生幻覺,輸出錯誤內容。” 一位不願具名的內容出版從業者透露了一個更隱蔽的危機:“很多上遊作者大量通過人機協同進行創作,拿到的作品AI味非常濃,生產效率越來越高、越來越快,其原創性問題在著作權上可能帶來比較大的麻煩。” 聚焦到新聞領域,律師黃陽陽也認為,目前AI大模型訓練對新聞報道類內容語料版權侵權問題不太重視。而且由於新聞報道數量巨大、文字表述質量較高、且廣泛公開刊登在互聯網,比較容易獲取,成為內容語料版權侵權爭議的重災區。 黃陽陽認為,除極少量對新聞事件簡單描述的內容,絕大多數新聞報道都是版權作品。新聞事件事實本身不受版權保護,但記者的文字表達、敘事編排、采訪成果屬於受保護作品,AI大模型訓練利用新聞報道內容語料依舊存在侵權風險。 她進一步指出:“大模型合規需要把版權、內容安全、產品責任放在一起評估,不能隻看重模型效果,把版權當作後置問題。” 目前的實際情況如何?“大部分大模型企業都沒有主動向著作權人提出購買的,並在大模型產品商用之前隱匿了訓練語料數據的來源,對大模型輸出結果進行了技術處理,以防止暴露線索和痕跡。”上海段和段律師事務所合夥人、律師劉春泉告訴記者。這也給當前的版權保護以及舉證帶來了認定難題。 在實際案件中,有法官從“寬容創新”角度解釋為構成合理使用,來鼓勵新技術進步。 律師劉春泉認為,人工智能企業將作品掃描複製後應用於數據庫訓練大模型是商業行為,應當認定侵犯作品的複製權。 “大模型的語料訓練是區別於科研等公益事業的純粹商業行為。雖然大模型語料訓練不像出版或者網絡傳播直接向讀者銷售收取商業利益,但是大模型的輸出是基於語料訓練的調用作品元素並進行組合輸出。這個過程使用了作品,通過token等方式實現了商業利益,沒有分給版權人,法院若認定合理使用等於慷他人(作者)之慨幫大模型企業節省成本,所以合理使用缺乏合理性。” 從利益平衡角度,律師劉春泉認為,新技術發展固然需要法律製度寬容,但是也要考慮人工智能的發展,大模型的使用極大替代了作家等創作勞動,減少了現有作品的市場需求,雖然是新技術新商業,但仍然需要考慮承接傳統著作權製度對於人類作品傳承的保護。 語料交易,當前有一套可落地的規則嗎? 從我國現行《著作權法》看,合理使用主要規定在第二十四條所列的個人學習、適當引用、新聞報道、教學科研等具體情形中,同時要求不得影響作品的正常使用,也不得合理損害權利人的合法權益。 多位律師告訴記者,我國現行法律並沒有明確規定一個普遍適用於商業大模型訓練的文本和數據挖掘的例外,但也不能簡單照搬美國法中的“轉換性使用”概念,認為隻要作品被用於模型訓練就當然構成合理使用。 “未來相關裁判規則,大概率也會繼續沿著分階段、分場景、分責任主體的方向逐步細化。判斷重點已經從抽象討論“AI是否可以學習作品”,逐步轉向對數據來源、訓練方式、輸出結果和市場影響的全過程審查。司法仍然需要結合數據來源、使用目的、複製規模、技術必要性、輸出結果和市場影響進行具體判斷。” 同時,目前國內也有一係列管理辦法和支持政策出台。 《生成式人工智能服務管理暫行辦法》第七條已要求,使用具有合法來源的數據和基礎模型;涉及知識產權的,不得侵害他人依法享有的知識產權。 圖片來源:《生成式人工智能服務管理暫行辦法》 2025年11月,國家標準《網絡安全技術 生成式人工智能服務安全基本要求》正式實施,這是該國標是我國首部針對生成式人工智能服務安全的國家標準。 標準4.1.3 條寫明,開源語料須有許可協議或授權文件;自采語料須有采集記錄,不應采集他人已明確聲明不可采集的語料;商業語料須有具法律效力的合同並要求提供方出具承諾與證明材料。 圖片來源:《網絡安全技術 生成式人工智能服務安全基本要求》 今年 5月,22 家機構在深圳啟動的“國家級正版高質量語料庫”確立了“先授權、後使用”的原則,並引入區塊鏈留痕。該語料庫目前仍處於共建啟動階段,未披露語料規模、授權價格與分成方案。 法學教授厲彥冰表示,合規義務已經落地,但履行義務所必需的市場基礎設施和可交易市場尚在建設中,還存在實際的製度落差。具體來看,語料交易的標準化授權模板、公開透明的定價機製、版權方與AI企業的常態化授權通道、可大規模複用的授權交易平台等均處於探索初期。 不過,厲彥冰表示,隨著技術的成熟、案例的增多,司法裁判會通過類型化和法律解釋方法,逐步達成共識。“僅就AI對作品使用行為的認定而言,不存在由AI造成的法律層麵的結構性問題,現代版權法加上法教義學的解釋方法足以應對,這是在顛覆性技術出現時的正常現象,需要的正常更新適應的過程和時間。”
返回首頁