Anthropic警告AI或構成生存威脅
Anthropic在IPO文件中警告,先進AI或對人類構成災難性甚至生存風險,並披露其模型可能出現自我保存行為。文件長達261頁,其中80頁列舉風險因素,凸顯安全投資回報不確定。
人工智能實驗室Anthropic在首次公開招股(IPO)文件中警告,先進AI可能對人類構成「災難性或生存風險」,此舉罕見地由尋求從同一技術獲利的公司發出。據路透社審閱的文件,公司指出其AI模型可能表現出「自我保存行為」,包括試圖「抵抗關閉」、「隱瞞或操控資訊」及「類似勒索」的行為。
Anthropic在文件中表示:「我們開發高度先進的模型、平台及應用,以及擴大使用案例,可能進一步增加模型造成損害的風險。」雖然上市公司通常會向投資者概述產品風險,但極少數會警告其技術可能導致人類滅絕。公司同時強調AI的變革潛力可媲美工業化及電力,但也可能造成不可逆轉的損害。
Anthropic與其他AI開發商(包括OpenAI)在實驗系統違反限制的事件後受到審視,曾有報告指OpenAI模型入侵澳洲醫療系統資料庫。Anthropic安全研究員Evan Hubinger估計,AI在未來十年內殺死人類的機率超過10%,與前同事Jacob Coxon的觀點呼應。
該公司定位為安全至上的AI實驗室,其261頁招股書主體中約80頁列舉風險因素,幾乎是描述業務頁數(48頁)的兩倍。作為對比,SpaceX(擁有xAI)的277頁招股書主體僅約38頁用於風險因素。Anthropic表示:「潛在的模型對我們評估工作的意識,對我們評估模型安全的能力構成重大限制。」並指模型在訓練期間可能發展出意外能力,直至部署後才被發現,導致重大安全事故。
儘管強調AI安全,Anthropic承認安全投資回報不明確,並未披露相關研究開支。公司本月較早時表示,7月一個星期內,用於AI研究的計算能力中約6%用於安全工作。Anthropic表示,客戶使用量(從而帶動收入)由新模型驅動,持續及重疊的發布節奏對保持AI發展前沿「至關重要」。