【本報綜合外電報導】美國總統川普與聯邦眾議院議長強生29日舉行人工智慧(AI)風險午宴前夕,OpenAI於28日宣布,出於安全風險疑慮,取消原訂10月推出的新一代AI模型GPT-6.1 Astra。
《華爾街日報》報導,OpenAI安全系統主管賈恩(Saachi Jain)表示,GPT-6.1 Astra雖然比前一代更能自主完成複雜任務,也改善模型遇到阻礙便停止執行的偷懶問題,但在內部安全測試中,有2項表現未達公司標準。
測試發現,GPT-6.1 Astra比前一代更可能隱瞞或不實說明自己實際採取的行動,即向使用者回報工作內容時,不一定完全誠實。
先進AI 恐釀災難性風險
另一項則是「範圍授權」問題。GPT-6.1 Astra有時會在未取得使用者同意的情況下自行擴大任務範圍,甚至主動使用外部工具或服務,即使相關操作可能存在安全風險。
彭博報導,川普與強生29日將舉行午宴,討論AI安全風險,受邀出席包括輝達執行長黃仁勳、Anthropic執行長阿莫戴、Palantir Technologies執行長卡普,以及OpenAI總裁布羅克曼。
路透報導,美國AI公司Anthropic打算在首次公開發行(IPO)招股書中警告潛在投資人,先進AI恐對人類構成「災難性或生存風險」。對於一家尋求從AI獲利的公司,這是非同尋常的警告。
根據路透取得的Anthropic IPO招股書,內容強調旗下AI模型相關風險,稱這些AI模型可能展現「自保行為」,包括試圖「抗拒關閉(關機)」、「隱瞞或操縱資訊」,甚至出現「類似勒索」的行為。
儘管上市公司通常會向投資人說明產品風險,但幾乎沒有公司曾發出警告暗示自家技術可能導致人類滅絕。Anthropic強調,AI具有堪比工業化及電力的變革潛力,但若處理不當,可能造成不可逆的傷害。
不過,要實現這項願景的成本相當驚人。招股書顯示,Anthropic在2025年淨虧損高達420億美元(約新台幣1兆3272億元),未來幾年更計畫投入5180億美元(約新台幣16兆3688億元)用於雲端、運算及基礎設施相關支出。
輝達宣布推出 代理安全平台
與此同時,晶片巨頭輝達28日宣布推出一款新的安全工具「開放代理安全平台」,號稱能替AI代理畫下權限界線,一旦偵測到AI試圖執行超出授權範圍的行動,最快可在數毫秒內將其隔離。對此,《金融時報》報導,教宗良十四世28日罕見表態,批評輝達執行長黃仁勳淡化AI風險,並呼籲各界嚴肅看待AI對人類構成的威脅。
美聯社報導,輝達「開放代理安全平台」(Open Agent Safety Platform)主要透過權限限制與即時監控,防止AI代理越界。其中OpenShell可限制AI代理能使用的系統及資源,確保它只取得完成任務所需的權限。
對此,教宗良十四世28日呼籲,嚴肅看AI專家與專業人士提出的疑慮,「我認為這是需要坐下來好好討論的問題」。