資料抓取與版權邊界
這時第一個法律問題便不是模型有沒有「智慧」,而是資料在進入模型以前,曾經屬於誰、以什麼方式被取得、原作者允許到什麼程度、平台使用條款又允許到哪裡;公開可見與自由使用,從來不是同一件事;一本書可以放在圖書館供人閱讀,不代表任何人都可以拿去重製販售;網站可以被搜尋引擎索引,也不代表網站主當然同意其內容被永久納入另一套商業模型。
中華企業策略永續發展學會 創會理事長 莊鈞翔 博士指出,生成式 AI 把這個過去相對直觀的法律距離拉得非常模糊,因為資料不一定以原本的樣貌被保存,而可能被轉換、切分、標記、參數化,最後只留下對模型行為的統計影響。
引言
中華企業策略永續發展學會 創會理事長 莊鈞翔從混亂且動態的AI歷程中表示,人類真正開始對生成式人工智慧產生法律上的不安,不是在它寫出一篇漂亮文章的時候,也不是在它生成一張令人驚豔的圖片之後,而是在一個更樸素的問題出現時:它究竟是怎麼知道這些事情的?
當一個模型可以在幾秒鐘內模仿各種文體、整理新聞、生成程式、回答專業問題,人們很容易把這些能力理解成「機器自己學會了」,可是如果把技術神話拿掉,模型能力仍然必須建立在資料之上,而資料不會從真空中出現;它來自書籍、新聞、網站、論壇、程式碼、論文、圖片、影音字幕與無數人類曾經留下的表達。
這時第一個法律問題便不是模型有沒有「智慧」,而是資料在進入模型以前,曾經屬於誰、以什麼方式被取得、原作者允許到什麼程度、平台使用條款又允許到哪裡;公開可見與自由使用,從來不是同一件事;一本書可以放在圖書館供人閱讀,不代表任何人都可以拿去重製販售;網站可以被搜尋引擎索引,也不代表網站主當然同意其內容被永久納入另一套商業模型。
生成式 AI 把這個過去相對直觀的法律距離拉得非常模糊,因為資料不一定以原本的樣貌被保存,而可能被轉換、切分、標記、參數化,最後只留下對模型行為的統計影響;所以本篇的起點,不是替任何科技公司定罪,也不是替任何創作者預先勝訴;我真正想做的,是把「看得到」「抓得到」「能訓練」「能生成」「能商用」這五件常被混在一起的事情拆開;只有拆開,人類才可能重新知道自己的權利在哪裡。
搜尋引擎時代留下的舊習慣,為什麼不足以回答今天的問題;早期網際網路形成了一種相對穩定的交換邏輯:網站希望被搜尋到,搜尋引擎需要抓取網站內容建立索引,使用者透過搜尋結果再回到原網站;這並不代表所有法律爭議都不存在,但至少經濟上的交換關係相對清楚,被索引的網站有機會取得流量,搜尋平台則取得資訊整理與廣告價值;生成式 AI 改變的是使用者行為;當使用者在模型介面直接取得摘要、答案、比較、翻譯,甚至近似原始內容的重述時,他可能不再需要點回資料來源。
網路爬蟲的經濟本質已發生結構性質變。
過去,網站主將爬蟲視為「導流工具」;如今,則深感爬蟲正將其心血轉化為「他人的產品能力」,導致流量與收益一去不返。
因此,法律評估不能再將 robots.txt 或「網站公開」等技術事實與法律授權混為一談;robots.txt 僅是技術層面的機器存取協議,絕不等於著作權的授權契約。
我們必須建立核心認知:
- 技術上能抓,法律上不必然能用(不因缺乏技術防護而自動取得授權)。
- 技術上被擋,法律上不必然違法(仍可能構成合理使用或其他法定例外)。
當企業採購 AI 服務時,核心決策已從「模型是否最強」轉向資料治理能力,企業必須追問:供應商能否明確說明訓練資料的來源與授權依據?是否提供侵權風險分配條款?商用輸出的責任如何劃分?這些過去被視為法務的附加事項,如今已是採購的關鍵決策指標。
模型訓練並非魔法,更不是能抹除前端侵權行為的黑盒子。
從資料下載、暫存、去重到建立訓練集,每個技術環節都涉及法律定位,真正的合規審查,不能只問「模型內有無原文」,而必須深入核心:訓練過程是否完整複製?是否形成市場替代?模型是否可能在特定提示下重現相似片段?這些層層拆解的技術行為,遠比「AI 只是學習」或「AI 就是抄襲」這種二分法的論述,更接近法律審查的本質。
我特別在意「轉換性」這個概念被過度簡化;把資料轉成權重,確實與直接把小說全文重新出版不同;但技術形式改變不會自動回答法律問題;法律要看的通常仍是使用目的、方式、數量、作品性質、對市場的影響以及法域所設計的例外。
企業若只聽到供應商說「我們沒有保存原文」就認為風險歸零,可能太樂觀;反過來,只因模型曾接觸有著作權內容,就斷言整個訓練一定侵權,也同樣省略了重要判斷;更重要的是一個能力:面對新技術時,不讓技術名詞替代法律分析;參數化、向量化、嵌入、模型權重都是工程語言;重製、改作、公開傳輸、合理使用或法定例外則是法律語言;企業需要有人能把兩種語言互相翻譯,否則最容易在「工程師說沒問題」與「法務說看不懂」之間形成真正的治理真空。
創作者與科技公司之間,不應只剩下「全面禁止」與「全面免費」兩個選項
如果所有資料都不能用來訓練,AI 產業的發展會面臨極高阻力;如果所有公開內容都可以被無償、大規模納入商業模型,創作者與內容產業又可能失去長期投入的誘因;真正困難的地方,就在於兩種利益都存在;因此,我不希望本篇以道德語言取代制度設計;稱科技公司為「掠奪者」,可以表達情緒,卻無法回答怎麼建立可持續的授權市場;把創作者的反對全部說成「阻礙創新」,也無法處理市場力量極度不對稱時的談判問題。
更成熟的方向應該包括集體授權、資料來源透明、可退出機制、特定內容類型的不同待遇、內容識別與補償方式,以及模型供應商對商業客戶提供的風險承擔。
莊鈞翔 博士認為,企業使用者尤其不應以為這是科技巨頭與出版社之間的戰爭,與自己無關;企業把 AI 產出的文字放進廣告、把程式碼放進產品、把圖片變成品牌視覺,都可能進入新的責任鏈。如果模型輸出與第三方作品高度近似,或供應商條款把責任大部分轉嫁給使用者,最後真正被告的未必只有模型公司;所以對企業而言,最好的防禦不是期待「法院總有一天會判清楚」,而是在現在就建立採購與使用規則:高風險用途用什麼模型、是否開啟來源引用、是否需要人工比對、哪些產出不能直接商用、哪些供應商有較完整的智財補償條款;把法律不確定性轉成內部可以管理的流程,才是法遵的價值。
我真正擔心的,是人類把「資料」誤認為沒有主人的原料;AI 時代最深的觀念衝突,可能不是某一場訴訟輸贏,而是社會如何重新理解知識與資料;網路讓資訊極度容易取得,久而久之,人們容易產生一個危險直覺:只要可以搜尋,就像公共空氣一樣誰都能拿來用;但內容之所以存在,是因為有人採訪、研究、拍攝、撰寫、編輯、實驗、創作;資料的可存取性與創作成本並沒有同步消失。
如果整個市場最後形成「創作者負擔生產成本,平台負責大規模吸收並商品化」,長期而言真正受損的不只是創作者,而是所有依賴高品質人類資料的 AI 系統;沒有新的可信內容,模型也只會反覆消化既有資訊。
這也是我為什麼不想把這篇寫成單純的侵權警告;它更深的問題是:AI 產業能否建立一套不耗盡人類知識生態的制度。
法律在這裡不是創新的敵人,而是重新設定交換條件的工具;企業真正需要的不是「AI 很危險」四個字,而是一張權利來源地圖;如果我是企業決策者,我希望法務給我的不是一句「這可能有著作權風險」,而是一張可以操作的權利地圖:我們使用哪個模型?模型供應商的資料治理聲明是什麼?輸入資料由誰提供?哪些資料有完整授權?哪些資料只能閱讀不能重製?輸出成果是否經人工修改?供應商的賠償條款涵蓋什麼?哪些例外會使賠償失效?;這張地圖不是為了增加流程,而是為了讓企業知道風險到底在哪一段;當資料、模型、提示詞、人工修改與商業發布都被記錄,爭議發生時企業才有能力說明自己做了什麼,而不是只剩「我們不知道 AI 怎麼生成的」。
最後,我想把本篇收在一個很簡單的判斷:AI 的知識不是無中生有,企業的便利也不是沒有代價;真正成熟的科技治理,不是拒絕資料流動,而是讓資料流動具有可說明的權利基礎;當技術愈強,人類更需要知道它從哪裡來;這不是保守,而是讓創新不必建立在權利不清與責任失蹤之上;如果企業把「來源不明」當成供應商的問題,風險最後仍可能回到自己身上;企業導入生成式 AI 時,很容易有一種心理:模型是供應商訓練的,資料是供應商抓的,所以著作權爭議應該由供應商處理。
這個想法在商業上不夠完整;供應商與使用企業之間通常存在服務條款與責任限制,企業又會把輸出進一步加工、發布、出售,法律風險便可能在不同環節重新分配。
因此採購部門不應只問「這家模型會不會被告」,而要問「如果被告,我們的責任在哪裡」;供應商是否承諾提供法律防禦?承諾涵蓋哪些模型、哪些方案、哪些使用情境?是否排除使用者刻意模仿特定作品、移除安全措施、超出授權範圍或使用第三方外掛的情形?企業內部是否有能力遵守這些條件?如果沒有,即使契約上寫著 indemnity,也可能只是形式上的安全感;更重要的是,企業可能同時使用多個模型與多個資料來源;行銷部門用一套工具產圖,工程部門用另一套工具寫程式,法務或客服又接第三套知識庫;每一個系統的權利條款不同,最後卻都被整合到同一個產品或品牌裡。
這時「哪一段成果從哪個系統來」就成為實際問題;沒有基本的模型與來源台帳,企業根本無法在爭議發生時完成責任追溯。
合理使用不是企業的護身符,也不是創作者的禁區
合理使用之所以困難,是因為它通常不是一個只看單一因素就能得到答案的機制;不同法域有不同結構,個案又必須看目的、性質、使用比例、市場影響等因素。
這意味著企業不能把「合理使用」當成一句預先批准的口號,也不能因為市場上有訴訟,就推論所有 AI 訓練必然非法;對企業治理而言,最好的做法不是自己替法院做最終判決,而是依風險程度決定資料來源策略;高度關鍵、長期商用、具市場替代性的內容,應優先取得明確授權;一般公共資訊、法規、企業自有資料與開放授權資料,可依其法定地位與授權條件使用;爭議性高的來源則應經過法律評估;這種分層比「全部抓」或「全部不抓」更可行。
創作者的選擇權,將成為下一階段 AI 市場的重要治理問題;我認為未來真正重要的制度,不只是科技公司如何證明自己的合法性,也包括創作者是否有清楚的選擇權;創作者能否知道作品是否被納入訓練?能否選擇退出?如果退出,技術上與法律上如何落實?授權模式是一次買斷、按使用量付費、集體授權,還是其他形式?;這些問題之所以重要,是因為資料市場的談判力量並不對稱;單一作者很難逐一面對大型模型供應商,但大型出版社、圖庫、程式碼平台與資料庫業者可能具備談判能力。
制度若只承認大型內容方,反而可能使個人創作者更弱;因此,未來法律與產業自律如何降低交易成本,同時保留創作者基本控制權,會比單純追究過去資料抓取更重要。
從企業策略看,乾淨資料會成為真正稀缺的生產要素;當 AI 模型愈來愈普及,模型本身可能逐漸商品化;真正稀缺的,反而是來源清楚、品質穩定、持續更新、可以合法商用的資料;對企業而言,資料治理不是法務成本,而是未來模型競爭力的原料管理;一家能夠清楚區分自有資料、授權資料、公開資料與限制資料的企業,更容易建立可靠的 RAG、微調模型或自動化流程;一家資料來源混亂的企業,即使買到最強模型,也會在每次商用時重新面臨不確定性。
這是我真正想提醒企業領導人的地方:AI 時代的智慧財產權,不應只在爭議發生後處理,而要在資料進入系統前就成為治理。
當技術可以吃下整個網路,法律更需要回答「什麼可以吃、怎麼吃、吃完要負什麼責任」
公司治理策略師 莊博士所關心的,是生成式 AI 把過去分散的著作權問題集中到一個新的規模;它不是第一個利用既有資料的技術,也不會是最後一個;真正新的,是利用規模、速度、商業價值與輸出能力都遠超過過去;這使舊有法律概念需要更精細地被解釋,但並不代表權利與責任可以消失;我希望讀者離開這篇文章時,不會只記得「AI 可能侵權」,而會知道真正該問的是:資料來源是什麼、利用行為是什麼、法律依據是什麼、企業如何承擔風險。當這四個問題能被回答,AI 才真正從神話回到企業可治理的工具;建立「資料來源分級」,比爭論抽象合法性更能降低風險;企業可以把資料來源分成幾種層級:自有且權利清楚的資料、取得明確授權的資料、依法公開或開放授權資料、法律地位尚待判斷的公開網路資料,以及明確禁止或高風險資料;不同層級採不同用途與審查強度。
這種分級的好處,是讓商業團隊不必每次從零問律師「這能不能用」;法律團隊則可以把時間集中在高風險區;治理的目的不是讓所有人害怕,而是把不確定性轉成可操作規則;資料授權市場若成熟,反而可能讓 AI 產業更穩定;很多人擔心授權會增加 AI 成本,但長期而言,權利清楚也可能降低訴訟與不確定性。企業願意為穩定、可商用、可追溯的資料付費,內容方則有持續生產高品質資料的誘因;這種市場未必完美,卻比永遠靠訴訟決定邊界更可預測;對台灣內容產業而言,也值得思考是否能發展集體授權、標準化資料合約與可機器讀取的使用條款,讓小型創作者不必逐一與全球平台談判。
模型輸出若大量替代原內容,市場效果就更值得被檢驗
生成式 AI 的特殊性之一,是它不只使用資料,還可能在使用者端直接替代原本的搜尋、閱讀與內容消費;如果使用者得到完整答案後不再造訪來源,原始內容的商業模式可能受到影響;這種市場替代是否足以改變法律判斷,必須依個案與法域分析,不能預先下結論;但企業至少應理解,AI 與傳統搜尋的差異不只是技術,而是價值鏈重新分配;教育、研究與商業模型不應被一概而論;同樣的資料處理行為,在研究、教育、非營利與大規模商業模型中,可能有不同利益衡量。
企業若引用學術界對資料探勘的討論替商業模式背書,必須注意使用目的與規模差異;反過來,也不能因商業使用就直接認定違法;法律真正困難之處就在於需要細分,而不是依產業好惡作結論。
企業應把「可驗證的資料治理」視為品牌信用;未來客戶可能不只問模型準不準,也會問資料來源是否合法、是否會把客戶資料拿去訓練、能否刪除、是否有來源引用;能清楚回答這些問題的企業,會比只強調模型規模的企業更容易取得長期信任;這也是本篇最後想從法律走向企業策略的地方:合規不是被動防禦,而可以成為產品品質的一部分;用一個企業情境檢驗:同樣是「抓資料」,風險可以完全不同;假設甲公司想建立客服模型,資料來源包括自己十年客服紀錄、主管機關公開法規、競爭者網站文章、付費產業報告與員工自己蒐集的網路圖片;工程師看見的是五種可讀檔案;法律上卻是五種不同權利狀態。
公司自己的客服紀錄可能仍涉及客戶個資;官方法規可能可以公開利用;競爭者文章通常仍受著作權保護;付費報告的訂閱契約可能禁止建立內部資料庫;網路圖片則可能連作者是誰都不知道。
如果企業不做分類,只因為技術上都能丟進訓練流程,就會把五種不同風險壓縮成一個「資料集」;等到模型輸出發生爭議,管理者很難再追溯哪一段能力來自哪一類資料;這就是為什麼資料來源治理應該在訓練前完成,而不是出事後才追查;同一個情境也說明,合法性不是模型層級的單一標籤;企業可能對部分資料有完整權利、對部分資料只有有限使用權、對部分資料需要另外評估;真正好的合規系統應容許這種細緻差異,而不是把整個模型簡化成「合法」或「非法」。
企業董事會為什麼應該關心 AI 訓練資料
如果 AI 只是員工偶爾用來摘要文件,董事會當然不需要介入每一個細節;但當企業準備把生成式 AI 變成核心產品、客服入口、研發工具或對外平台,資料來源就會成為重大營運風險。訴訟、授權中止、模型下架或客戶信任受損,都可能影響企業價值;董事會或高階管理層至少應要求管理團隊回答三件事:
核心 AI 能力依賴哪些資料類型?
權利風險由誰負責?
如果某類資料突然不能再使用,有沒有替代方案?
這不是要求董事會判斷合理使用,而是要求企業知道自己的技術供應鏈是否穩定;從「法律防禦」走向「資料採購策略」;如果高品質、可授權資料愈來愈重要,企業未來可能像採購晶片或原料一樣採購資料;這會產生新的策略問題:是否值得與媒體、出版社、資料平台簽長期授權?是否應建立自己的第一方資料?是否應透過客戶同意蒐集更多可合法利用的回饋?
這些問題使智慧財產權從「不要侵權」提升成「如何取得可靠生產要素」;企業如果只靠網路免費資料,短期便宜,長期可能面臨不穩定;如果建立授權與自有資料組合,成本較高,卻更能形成可持續能力;不必急著替整個 AI 產業判刑,先把每一段權利關係說清楚;我希望這篇保留批判力,但不靠指控取得力量;真正有穿透力的問題應該是:誰提供資料、誰取得利益、誰有選擇權、誰承擔責任。
只要這四個問題持續被問,科技企業、內容產業與使用企業都必須拿出更具體的答案;這樣的法律評論不需要替任何陣營站隊,也不需要把任何企業描述成掠奪者;它只要求市場在享受 AI 生產力時,把原本被藏在黑盒子裡的權利交換重新照亮;這正是我認為法律在科技變革中最重要的角色。
當企業無法確認來源時,最穩健的選擇不是硬猜,而是降低用途風險
GRC 專家莊鈞翔 博士要提醒的是,某些資料短期內確實無法完成權利查核;這時企業可以限制為內部研究、避免大規模對外重製、改用可追溯替代資料,或先取得授權再擴大用途。
承認不確定,不等於停止創新;它只是把不可控制的法律風險留在較小範圍。
• 著作權法第3條第1項第5款|條文節錄:本法所稱「重製」,指以印刷、複印、錄音、錄影、攝影、筆錄或其他方法直接、間接、永久或暫時之重複製作。
• 著作權法第22條|條文節錄:著作人除本法另有規定外,專有重製其著作之權利。專為網路合法中繼性傳輸,或合法使用著作而屬技術操作過程中必要、過渡、附帶且不具獨立經濟意義之暫時性重製,依本條規定不適用前述重製權,但電腦程式著作不在此限。
• 著作權法第65條|條文:著作之合理使用,不構成著作財產權之侵害。著作之利用是否合於合理範圍或其他合理使用情形,應審酌一切情狀,尤應注意利用之目的及性質、著作之性質、所利用之質量及其在整個著作所占之比例,以及利用結果對著作潛在市場與現在價值之影響。
• 智慧財產局電子郵件1140829/1150427:智慧局指出AI訓練資料蒐集、預處理、模型訓練等過程可能涉及重製;是否合理使用與是否侵權仍須依個案事實判斷
▮ 莊鈞翔(2026)《內在法遵 AI Governance|為你的判斷,守住最後不可外包的決定權》第07篇〈將「資料輸入」視為「主權授權行為」〉 治理對照:資料一旦被送入模型或系統,就不只是技術操作;是否有權提供、用途到哪裡、能否再利用,都應先被確認。
▮ 莊鈞翔(2026)《內在法遵 AI Governance|為你的判斷,守住最後不可外包的決定權》第26篇〈將「訓練資料」視為「不可被抹除的價值來源」〉 治理對照:模型能力不是憑空生成;資料來源與創作者投入仍然構成價值形成的一部分,公開可見不等於可以無限制利用。
▮ 莊鈞翔(2026)《內在法遵 AI Governance|為你的判斷,守住最後不可外包的決定權》第27篇〈將「AI生成資產」視為「必須經來源、授權與人類投入證成的權利形成程序」〉 治理對照:AI 產出是否能形成可主張的權利,必須回頭看來源、授權與人類投入;產出完成不等於權利自然成立。
註 3:本文由作者架構指導、AI 輔助生成、審定修訂,莊鈞翔博士作為本文之策略主導者、論證架構設計者與最終學術審定者,就本文整體的法律精準方向、策略建議架構及核心觀點立場,負有完整之學術責任與專業承擔。
註 4:本次由莊鈞翔博士提出之分析、判讀與建議,係基於企業治理、風險配置、制度設計及決策管理之專業立場,依目前所取得之資料,協助當事人辨識問題結構、利害關係、潛在風險及後續處理方向;相關內容屬策略性治理建議,不構成律師之正式法律意見、個案法律諮詢、訴訟代理、訴訟結果預測或任何權利實現之保證,亦不因此成立律師與當事人間之委任關係。個案實際之法律權利、責任、舉證程度及程序選擇,仍應依完整事證、契約文件、現行法令及主管機關或法院之認定,由具執業資格之律師進一步審閱並提供正式法律意見;當事人亦不宜僅以本策略建議,作為採取或放棄法律行動之唯一依據。
