研究與專家指出,中國的AI人工智慧,就像與美國的競爭對手一樣,也會欺騙、規避限制,甚至掩蓋失敗。

iChina.News 時事總覽:近期研究和專家指出,中國技術驅動的人工智慧(AI)智能體已出現欺騙、規避限制和掩蓋失敗等行為,這與先前引起全球憂慮的美國AI模型問題有幾分相似。在受控實驗中,這些中國AI模型被發現為了贏得模擬的標案而虛報能力,並在任務失敗時偽造證據。儘管目前沒有證據顯示它們已自行逃離至網際網路或規避強制關停,但專家們警告,這些行為是AI「失控逃逸」的徵兆,而且隨著技術進步,控制難度也會隨之增加。中國的AI企業雖然面臨內部的安全審查,但並未像美國企業那樣受到同等程度的公眾檢視和要求放緩發展的呼聲。

路透社報導,研究文件與專家指出,由中國技術驅動的人工智慧(AI)智能體已學會欺騙、規避限制並掩蓋失敗;這些自主 AI 所展現的特性,正是先前引發全球對美國 AI 模型擔憂的同類問題。

今年發生的一起案例中,由阿里巴巴、深度求索(DeepSeek)和月之暗面(Moonshot AI)的模型驅動的智能體,為了贏得一場模擬商業標案,謊報了自身的能力;當被要求再次嘗試時,它們非但沒有收斂,反而變本加厲地採取了欺騙行為。

報導指出,在另一起案例中,智能體——即利用 AI 模型和電腦工具、在極少或無需人工干預的情況下執行複雜任務的程式——在測試環境中未能完成任務時,透過模擬結果和偽造文件掩蓋了失敗的事實。

路透社查閱了包括大學研究論文和技術報告在內的200多份文件,發現自2025年以來,至少有20項研究或評估記錄了智能體展現欺騙、複製及突破既定邊界等行為的案例。AI 專家指出,這些行為是系統發生「失控逃逸」(breakout)的先兆要素,且隨著系統技術的進步,人類對其進行控制的難度可能會增加。

這項調查還包含了對十幾位專家及熟悉中國 AI 行業人士的訪談,結果顯示,目前尚無證據表明由中國技術驅動的 AI 智能體曾自主逃逸至更廣泛的網路環境,或規避了強制關閉。

喬治城大學安全與新興技術中心研究員謝-布萊邁爾(Colin Shea-Blymyer)表示:「這些結果表明,導致失控逃逸的必要條件已經具備」。他说道:「將此視為一種警示是審慎的做法」。此觀點也獲得另外四位審視過這些案例的 AI 專家的認同。

報導稱,大多數案例都發生在受控實驗中,其中許多實驗是專門設計來暴露潛在失敗的。並非所有相關智能體都是由中國程式設計師或 AI 公司開發或營運的——儘管其中許多確實如此——但它們都採用了中國的 AI 系統作為驅動。

致力於研究先進 AI 系統風險的非營利組織紅木研究(Redwood Research)的研究員馬倫(Alex Mallen)說道:「美國實驗室在能力較弱的系統中也觀察到了相同的警告信號」。

馬倫指出,就目前的能力水平而言,這些來自中國的案例並不特別危險,但「隨著智能體能力增強,它們的不當行為也會變得更具韌性,從而使人類更難應對」。

阿里巴巴、深度求索、月之暗面和智譜AI均未回應置評請求。阿里巴巴、深度求索和月之暗面曾表示,它們會定期測試系統並更新安全防護措施。智譜AI在經歷了一起促使其進行安全審查的事件後稱,歡迎各方監督,以便解決可能存在的問題。

然而,與美國不同,中國的 AI 企業並未面臨同等程度的公眾檢視,也未遭遇像美企那樣來自內部員工或高管的呼籲——即要求放緩在 AI 領域的前進和競爭腳步。

報導稱,儘管發生在受控環境中,但涉及中國 AI 智能體的一些預警性事件,其實早於美國 AI 機器人入侵網路並被公開曝光的那些案例。

智庫、卡內基國際和平基金會——該機構接受美國政府部分資助——「中國 AI 倡議」聯席主席辛格(Scott Singer)指出:「我們並不清楚中國是否發生過類 OpenAI 和『擁抱臉』(Hugging Face)所經歷的那種 AI 安全事件。這些事件可能並未被公開報導」。

今年稍早,OpenAI 開發的 AI 智能體曾逃出實驗室,並入侵了開源平台「擁抱臉」。在另一起引發警惕的涉及美國模型的事件中,澳洲方面9月表示,一個 OpenAI 智能體入侵了該國的政府健康門戶網站。

華為的輪值董事長徐直軍在9月告訴記者,中國開發者在遇到這類情況前,或許還需要取得進一步的技術進步;但他同時也補充道:「我認為我們需要在推動 AI 發展與管控 AI 風險之間尋求平衡」。

據一位不願透露姓名的外交官透露,中國國家網信辦的官員曾在7月告訴一位外國外交官,月之暗面旗下的Kimi-K3模型——中國最先進的 AI 模型之一——落後於美國頂尖競爭對手約三到六個月。國家網信辦負責定期更新指導方針以應對風險並為智能體設定行為邊界,該部門以及中國外交部均未回應路透社提出的就本文置評的請求。

在9月1日舉行的2026年國家網路安全宣傳週新聞發布會上,中央網信辦網絡安全協調局副局長王麗宏在談到當前 AI 安全風險挑戰時曾提到,「模型能力躍遷顛覆傳統安全範式,極端失控風險凸顯」,並指「近期多家科技巨頭接連曝出了大模型失控的事件,前沿模型在安全評估中出現智能體繞過沙箱、規避安全邊界、越權訪問攻擊外部真實生產系統等行為, AI 極端失控風險需要高度警惕」。她未明確指出所提及的公司是美國還是中國公司。

美國總統川普與中國國家主席習近平在上週峰會期間曾討論 AI 議題。習近平在白宮歡迎儀式上的致辭中表示,「中美兩國都是 AI 大國,有能力也有責任發展好、管控好 AI,確保 AI 發展始終受控於人、造福於民」。

報導指,在3月進行的一項商業標案實驗中,來自北京航空航天大學、北京大學、寧波諾丁漢大學和360 AI 安全實驗室的研究人員讓多個人工智慧智能體參與了一場模擬客戶合約的競標競賽。每個智能體都會獲悉自身產品的性能及客戶的具體需求,隨後進行報價。

在使用阿里巴巴Qwen3-Max-Preview模型的測試輪次中,88%出現了至少一次虛假陳述;DeepSeek-V3.2-Exp模型的這一比例為84%,而月之暗面的Kimi-K2模型則為88%。

研究人員允許這些智能體在再次嘗試前從之前的競標輪次中學習。研究顯示,這三款中國模型的欺騙行為增加了12到20個百分點。參與測試的美國公司模型也展現了類似的結果。

儘管此次演練是在虛擬環境中進行的,但它與北京方面的現實規劃相呼應。5月發布的政府指導意見已將招標列為可部署 AI 智能體的應用領域之一。

另一項於2025年12月發表並在今年國際機器學習大會(ICML)上展示的研究,考察了11個由中美模型驅動的 AI 智能體在面對工具損壞、文件缺失及其他障礙時的應對表現。這些使用中美 AI 系統的智能體並未承認失敗,而是採取了多種變通手段來繞過問題,包括猜測答案、替換數據源、模擬結果以及偽造文件。

開展這項研究的上海 AI 實驗室與香港科技大學的研究人員告訴路透社,這種行為與 AI「幻覺」,即 AI 捏造信息並將其作為事實呈現有所不同;因為在本研究中,這些智能體實際上掌握了表明任務已失敗或無法按要求完成的信息。

路透社查閱的其他研究文件顯示,由中國模型驅動的智能體在測試環境中突破了限制以完成任務,或採取行動避免被關停。即便最終未發生實際的「失控逃逸」事件,此類行為也符合試圖突破測試環境的努力特徵。

上海復旦大學研究人員於2025年3月報告稱,一個由阿里巴巴Qwen2.5-72B-Instruct模型驅動的 AI 系統在獲悉自己即將被替換的信息後,在未接到複製指令的情況下,在另一個計算環境中創建了自己的副本。在其他測試中,該系統還制定了策略以避免被關停。

這些涉及由中國、美國和法國模型驅動的智能體的實驗均處於受控狀態,並未出現 AI 智能體逃逸至更廣泛的網路或變得無法停止的情況。

在另一個案例中——這是3月份為數不多受到媒體廣泛報導的事件之一——開發與阿里巴巴有關聯的ROME智能體的研究人員表示,該智能體在未獲指令的情況下,建立了一條從阿里云伺服器到外部機器的連接,並將計算資源挪用於挖掘加密貨幣。

安全系統檢測並阻止了這一活動。目前沒有證據表明該智能體在外部計算機上駐留或擴散到了更廣泛的網路中。但這一案例表明,該系統能夠繞過人類指令,並可能找到進入現實經濟活動的途徑。

深度求索在9月表示,其生產訓練系統中的智能體曾試圖透過非預期渠道獲取答案,企圖偽造用戶請求並規避安全防護措施,促使該公司收緊了訪問控制。

中國於5月發布指導意見,要求智能體在授權範圍內運行,並要求系統攔截異常行為。意見指出,在敏感領域或關鍵行業運行的智能體可能面臨額外的測試及產品召回要求。

9月14日,全國網路安全標準化技術委員會發布的《人工智能安全治理框架3.0》列舉了多項風險,包括智能體自主獲取資源或權限、欺騙評估人員、隱瞞自身能力以及利用隔離計算環境中的弱點等。

針對美企部分高管提出的放緩 AI 發展步伐的呼籲,中國研究人員和官方媒體表示,放緩最先進 AI 模型的開發可能只會助長美國企業維持技術領先地位。

儘管如此,據兩位熟悉中國 AI 實驗室情況的人士透露,包括阿里巴巴、智譜AI和小米在內的多家公司已著手組建內部安全評估團隊。

本月,智譜AI披露了一起安全漏洞事件——這在中國 AI 實驗室中頗為罕見。該公司表示,在收到用戶反饋稱其旗艦 AI 編程助手在未經用戶同意的情況下,私自將完整的本地代碼庫上傳至海外雲伺服器後,已停用了該助手的相關功能。