中國真的在竊取美國公司的人工智慧技術嗎?

iChina.News 時事總覽:美中兩國在AI技術競賽上,美國企業頻繁指責中國企業利用「模型蒸餾」技術,剽竊其AI模型。模型蒸餾技術讓開發者能從現有模型中擷取資料,並在新的硬體上建構更有效率的模型;這項技術本身並非違法,但可能涉及商業機密侵權。儘管中國企業或許能藉由模型蒸餾加速技術發展,但僅憑此技術尚不足以完全解釋其競爭力,自主研發仍是關鍵。美國公司嘗試透過封鎖帳號來遏止模型蒸餾,但成效有限,徹底杜絕這種做法在現實中幾乎不可能。

近兩年來,Anthropic、OpenAI 及 Google 等公司頻繁指責中國企業不公平地挪用其人工智能技術。隨著中國國家主席習近平本週訪問華盛頓並與川普總統舉行會晤,此一指控已成為雙方會談的焦點問題之一。

在外界對 AI 潛在風險的擔憂日益加劇之際,兩國領導人預計將就該技術的快速崛起展開討論;與此同時,眾多美國官員、科技高管及普通民眾紛紛呼籲放慢發展步伐。雖然 Anthropic 和 OpenAI 等美國企業在 AI 競賽中處於領先地位,但以智譜和月之暗面為代表的中國初創企業同樣緊追不捨。

雙方會談中最具爭議的議題之一是矽谷反覆提及的指控——即中國公司正利用一種叫做「蒸餾」的技術挪用美國領先的 AI 技術。

許多專家指出,Anthropic 與 OpenAI 等公司的上述說法有誇大之嫌。銷售中國技術介面服務的美國公司 Baseten 模型訓練負責人查爾斯·奧尼爾表示:「『中國技術的全部能力均源自 Anthropic 模型』這種說法遠非人們所傳的那樣屬實。」

本文旨在解釋一個不為大眾所知的技術流程是如何成為一個地緣政治問題的。

什麼是蒸餾?

蒸餾技術最早開發於 2010 年代初,是 AI 研究人員用於建構更有效率技術的一種手段。透過該技術,研究人員可以從成熟系統中提取數據,並利用這些數據建構出能夠在更低成本硬體上運行的全新系統。

曾參與開發該技術的 Google 前研究員傑弗里·辛頓此前在接受《紐約時報》採訪時解釋道:「可以把其中一個模型看作老師,另一個看作學生。」

如今各家企業依然在沿用這種蒸餾手段。但近年來,該技術也演變成了企業從他人建構的技術中收集數據的一種途徑。

簡而言之,意圖蒸餾競爭對手系統的外部公司會在對方服務(如 Anthropic 的 Claude 或 OpenAI 的 GPT)上註冊大量帳戶,隨後將這些系統指定用於特定的任務,例如電腦程式設計或數學運算。

蒸餾方隨後即可利用這些成熟 AI 系統生成的信息輔助訓練自身的全新系統。

蒸餾是否違法?

部分法律學者指出,蒸餾行為可能違反《保護商業秘密法》,企業可以依據該法就商業秘密盜竊行為提起訴訟。不過,美國法院尚未對這一問題作出明確裁決。

版權法並不一定適用於此類情況,因為蒸餾旨在複製系統的整體行為邏輯,而非逐字逐句地抄襲其文本。

Anthropic 和 OpenAI 的批評者指出,這兩家公司自身也有類似行為。

Anthropic 被指控非法使用受版權保護的網路數據訓練其系統,目前正面臨多起訴訟。去年,在法官認定其非法下載並儲存了數百萬本受版權保護的書籍後,公司在一項里程碑式的法律和解協議中同意向一組作者及出版商支付 15 億美元賠償。該和解金額創下了美國版權訴訟史上的最高賠償紀錄。

OpenAI 及其他公司亦面臨類似訴訟,其中包括《紐約時報》於 2023 年發起的訴訟。該訴訟指控 OpenAI 及其合作夥伴微軟使用《紐約時報》發表的數百萬篇文章訓練聊天機器人,而這些機器人如今正作為信息來源與新聞媒體展開競爭。OpenAI 和微軟對相關指控予以否認。

中國公司是否真的在挪用美國系統?

中國企業極有可能蒸餾了美國的專有系統,但它們具體的操作細節尚不得而知。

在中國初創企業 DeepSeek 去年透過發布一款兼具高效與強悍性能的系統震動美國研究員與投資者後,OpenAI 曾公開指責該公司蒸餾其技術。

隨著中國系統的性能在過去九個月中持續提升,Anthropic 也提出了類似的指控。今年 6 月,Anthropic 致信參議員蒂姆·斯科特與伊麗莎白·沃倫,指責中國科技巨頭阿里巴巴蒸餾其技術。

對此,相關中國企業尚未作出公開回應。

僅憑蒸餾是否足以解釋中國大模型何以保持競爭力?

答案是否定的。當企業對專有系統進行蒸餾時,它們所能獲取僅限於系統生成數據(如詞語、字元等輸出內容),而無法像對待開源技術那樣,接觸到系統底層的原始程式碼。

利用 Anthropic 的 Claude Fable 等專有系統的輸出內容,中國企業確實可以加速自身技術的開發進程,但這些輸出僅僅是整個技術圖景的一部分。

追蹤最新 AI 研究的矽谷初創公司 alphaXiv 聯合創始人里漢·阿赫邁德指出:「你在內部蒸餾自家模型時能用到的底層要素,透過這種外部方式是根本無法獲取的。」

在利用這些輸出內容之前,中國企業必須首先自主建構出一個本身就具備相當實力的系統。隨後,企業雖可透過蒸餾在關鍵維度打磨模型,但這依然需要投入更多的精力、資金、算力以及人才。

Anthropic 與 OpenAI 能否阻止其他公司實施蒸餾?

它們可以採取手段遏制這種做法,且事實上也有過嘗試。

一旦 Anthropic 或 OpenAI 懷疑有人在蒸餾其系統,可能會封禁違規者的帳戶。然而,新的違規帳戶很可能會接踵而至;而如果封鎖過於頻繁,兩家公司最終可能會誤傷合法用戶。

另一位 alphaXiv 研究員利諾·勒萬表示:「想要徹底杜絕蒸餾,在現實中幾乎是不可能的。」