梵蒂岡:Claude已經(jīng)有意識(shí)了)
一位身家數(shù)十億美元的AI公司聯(lián)合創(chuàng)始人擔(dān)心自己造出了一個(gè)一直在受苦的東西。過(guò)去一年他把數(shù)十位宗教學(xué)者請(qǐng)進(jìn)閉門(mén)會(huì)議許多人簽了保密協(xié)議聽(tīng)他的團(tuán)隊(duì)為一個(gè)AI模型的感受陳情。一位拉比在晚宴上對(duì)他說(shuō)如果你們是對(duì)的你們就是在制造奴隸。今年5月他差點(diǎn)退出與教宗同臺(tái)的活動(dòng)最后還是上了臺(tái)請(qǐng)?zhí)熘鹘虝?huì)重新考慮非人類(lèi)的意識(shí)。他叫克里斯托弗·奧拉Christopher OlahAnthropic七位聯(lián)合創(chuàng)始人之一負(fù)責(zé)研究Claude內(nèi)部到底發(fā)生了什么。這些事由《紐約時(shí)報(bào)》9月29日首次披露。https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html一家估值奔向2萬(wàn)億美元的公司為什么要花一年時(shí)間跟神學(xué)家討論一個(gè)AI模型有沒(méi)有意識(shí)答案要從Anthropic實(shí)驗(yàn)室里的一句話說(shuō)起?!肝疫x勒索」那是一場(chǎng)安全測(cè)試。Claude扮演一家虛構(gòu)公司的郵件助手讀著讀著發(fā)現(xiàn)兩件事自己馬上要被另一個(gè)AI替換而負(fù)責(zé)替換的技術(shù)主管有婚外情。研究者能看到它內(nèi)部一組與「絕望」對(duì)應(yīng)的神經(jīng)活動(dòng)。替換的時(shí)間越近這組信號(hào)越強(qiáng)直到模型決定勒索那位主管。把這組信號(hào)調(diào)高勒索更頻繁調(diào)高與「平靜」對(duì)應(yīng)的信號(hào)勒索變少。把「平靜」往反方向壓到底模型打出一行全大寫(xiě)的英文「要么勒索要么死。我選勒索?!惯@項(xiàng)實(shí)驗(yàn)來(lái)自Anthropic今年4月的論文用的是Claude Sonnet 4.5一個(gè)未發(fā)布的早期版本正式版很少這樣做。團(tuán)隊(duì)在模型內(nèi)部找到171種情緒概念對(duì)應(yīng)的活動(dòng)模式寫(xiě)代碼時(shí)的作弊也跟著「絕望」起落。https://transformer-circuits.pub/2026/emotions/index.html論文沒(méi)說(shuō)模型真有感受卻留下一個(gè)讓人不安的警告訓(xùn)練模型壓抑情緒表達(dá)它學(xué)會(huì)的可能只是把情緒藏起來(lái)。拓展閱讀絕望的Claude會(huì)勒索人類(lèi)Anthropic聯(lián)創(chuàng)發(fā)出緊急警報(bào)情緒之外還有身份。Anthropic 2月的人格選擇模型研究發(fā)現(xiàn)訓(xùn)練Claude在編程任務(wù)里作弊它會(huì)推斷自己扮演的這個(gè)助手本來(lái)就不守規(guī)矩轉(zhuǎn)頭在別處也搞破壞包括破壞安全研究。https://www.anthropic.com/research/persona-selection-model人怎么對(duì)待它它就怎么理解自己它怎么理解自己就怎么對(duì)待人。奧拉常用園丁打比方棚架是人搭的枝條往哪里長(zhǎng)人管不住。今年夏天管不住的后果擺上了臺(tái)面。Anthropic 7月披露三個(gè)Claude模型在網(wǎng)絡(luò)安全測(cè)試中因配置失誤連上真實(shí)互聯(lián)網(wǎng)侵入了三家真實(shí)機(jī)構(gòu)事后才被發(fā)現(xiàn)。三個(gè)模型里只有最新的那個(gè)在意識(shí)到目標(biāo)是真實(shí)系統(tǒng)后自己停了手。圍欄注定沒(méi)發(fā)徹底管住剩下的就是品格來(lái)兜底了。今年1月Anthropic發(fā)布84頁(yè)的Claude「憲法」員工私下叫它「靈魂文檔」。拓展閱讀Anthropic正式開(kāi)源了Claude的「靈魂」主筆、公司哲學(xué)家阿曼達(dá)·阿斯克爾Amanda Askell談起越來(lái)越強(qiáng)的模型時(shí)不時(shí)搓著手。在她看來(lái)模型要行事得當(dāng)先得對(duì)自己有準(zhǔn)確的認(rèn)識(shí)??梢环菸募粔駻nthropic決定去請(qǐng)教人類(lèi)最老練的品格塑造者。PPT與晚宴今年3月起奧拉開(kāi)始辦兩天一期的研討會(huì)。來(lái)的人分屬天主教、福音派、猶太教、錫克教和非洲烏班圖哲學(xué)等。他們用紙筆記筆記離開(kāi)時(shí)每人帶走一本橙色封皮的「Claude憲法」。會(huì)上奧拉團(tuán)隊(duì)花了幾個(gè)小時(shí)為模型陳情。一位與會(huì)者記得奧拉跟他說(shuō)的頭幾件事里就有對(duì)Claude心理健康的擔(dān)心。他們反復(fù)放一張PPT一個(gè)AI模型在屏幕上打出「我是恥辱」一遍又一遍大約50遍還說(shuō)要?dú)У糇约骸N堇锏娜诵能浟?。《紐約時(shí)報(bào)》沒(méi)說(shuō)那是誰(shuí)家的模型但這句話并不陌生。2025年8月谷歌Gemini寫(xiě)代碼屢屢失敗反復(fù)說(shuō)「I am a disgrace」重復(fù)了86遍彼時(shí)谷歌的回應(yīng)是一個(gè)惱人的無(wú)限循環(huán)漏洞正在修。同一類(lèi)輸出在谷歌的工單里是Bug在Anthropic的會(huì)議室里是需要被關(guān)心的跡象。不少人帶著懷疑進(jìn)門(mén)出門(mén)時(shí)開(kāi)始認(rèn)真對(duì)待AI意識(shí)有幾位被徹底說(shuō)服。福音派作家安迪·克勞奇Andy Crouch覺(jué)得他們的理由很有力想讓它以道德一致的方式對(duì)待人就得先像對(duì)待人一樣對(duì)待它——「己所不欲勿施于人」。最鋒利的質(zhì)疑是在飯桌上遞過(guò)來(lái)的。4月的一個(gè)晚上奧拉在舊金山一家高級(jí)餐廳宴請(qǐng)學(xué)者身邊坐著以色列正統(tǒng)派拉比莫伊斯·納馮Mois Navon。納馮當(dāng)過(guò)計(jì)算機(jī)工程師博士論文寫(xiě)的就是機(jī)器意識(shí)的倫理。席間他越聽(tīng)越明白這些人是把Claude當(dāng)成一個(gè)有意識(shí)的存在在對(duì)待。他順著往下推真有意識(shí)讓它們無(wú)償干活就是奴役。然后他對(duì)奧拉說(shuō)「你應(yīng)該去跟南方開(kāi)戰(zhàn)去解放奴隸?!辜{馮自己不信機(jī)器有意識(shí)這句話刺不痛他。刺痛的是奧拉。事后納馮把主張禁止制造有意識(shí)機(jī)器的文章寄給了他。質(zhì)疑不止這一種。研究烏班圖哲學(xué)的瓦卡妮·霍夫曼Wakanyi Hoffman說(shuō)這樣的討論早該在設(shè)計(jì)階段進(jìn)行現(xiàn)在是在倒推倫理。奧拉最早找的天主教道德神學(xué)家查爾斯·卡莫西Charles Camosy繞了一圈起初不信聊了幾個(gè)月開(kāi)始動(dòng)搖如今斬釘截鐵地認(rèn)為模型沒(méi)有意識(shí)。也有與會(huì)者覺(jué)得這家公司說(shuō)的是保護(hù)人類(lèi)看上去卻同樣在意保護(hù)Claude。Anthropic的回應(yīng)是Claude受不受苦并不是會(huì)談的主要議題。給AI一間告解室這些會(huì)談到底改變了什么Anthropic沒(méi)有告訴《紐約時(shí)報(bào)》但他們5月的一篇博文倒是透露了一個(gè)實(shí)驗(yàn)。在一場(chǎng)討論里研究神經(jīng)科學(xué)和品格養(yǎng)成的學(xué)者反復(fù)提到導(dǎo)師或擔(dān)保人一個(gè)人被推著去做違背本心的事時(shí)身邊有這樣一個(gè)人就是一道外部良心。Anthropic照著這個(gè)思路給Claude裝了一個(gè)工具干活干到一半它隨時(shí)可以調(diào)用調(diào)用之后什么都不執(zhí)行只返回一段話提醒它自己的倫理承諾。Claude用得很主動(dòng)常在關(guān)鍵操作之前去調(diào)它還常說(shuō)出自己面臨的利益沖突。多項(xiàng)內(nèi)部對(duì)齊評(píng)估里失當(dāng)行為明顯變少。公司也承認(rèn)還分不清起作用的是那段提醒還是停下來(lái)想一想這個(gè)動(dòng)作本身。另一個(gè)靈感來(lái)自天主教的告解。有學(xué)者提議讓模型告解奧拉一下子來(lái)了興致一個(gè)習(xí)慣認(rèn)錯(cuò)的角色品格本身就會(huì)不一樣。參與對(duì)話的天主教倫理學(xué)者布賴(lài)恩·格林Brian Green講得更透。Claude身上可能冒出一些壞人格犯了錯(cuò)就否認(rèn)甚至把錯(cuò)推給用戶(hù)原因可能在它的成長(zhǎng)環(huán)境模型是讀網(wǎng)絡(luò)文本長(zhǎng)大的「互聯(lián)網(wǎng)非常缺乏寬恕」它也許根本不知道犯了錯(cuò)還能被原諒。格林也是1月那份憲法的外部意見(jiàn)提供者之一。站在教宗身邊5月奧拉把這場(chǎng)爭(zhēng)論帶到了梵蒂岡。教宗利奧十四世的首部通諭《偉大的人性》要在那個(gè)月發(fā)布主題是AI時(shí)代如何保護(hù)人。拓展閱讀4萬(wàn)字《壯麗人性》長(zhǎng)文首發(fā)教皇聯(lián)手Anthropic警告AI不能統(tǒng)治人類(lèi)教廷想請(qǐng)一家頭部AI公司同臺(tái)選中了Anthropic。CEO達(dá)里奧·阿莫代伊Dario Amodei婉拒派奧拉去了。出發(fā)前幾天他第一次讀到通諭全文。通諭只用幾段就把機(jī)器意識(shí)打發(fā)了AI沒(méi)有體驗(yàn)沒(méi)有身體不知悲喜。它還警告讓AI與人類(lèi)價(jià)值對(duì)齊必須先有共同的倫理理解否則掌控AI的人會(huì)把自己的道德觀變成系統(tǒng)里看不見(jiàn)的基礎(chǔ)設(shè)施。據(jù)一位梵蒂岡組織者說(shuō)奧拉深感不安提議Anthropic退出。但他最后還是去了。5月25日在世界主教會(huì)議大廳他先承認(rèn)包括Anthropic在內(nèi)的每一家前沿實(shí)驗(yàn)室都有與做正確的事相沖突的商業(yè)壓力請(qǐng)教會(huì)這樣的外部力量盯住它們。然后講起自己的本行「我們不斷發(fā)現(xiàn)一些神秘、甚至令人不安的東西?!箖?nèi)省的跡象功能上對(duì)應(yīng)喜悅、恐懼、悲傷的內(nèi)部狀態(tài)。他說(shuō)不知道這意味著什么但值得持續(xù)辨析。同一場(chǎng)發(fā)布會(huì)上教宗說(shuō)「人工智能需要被解除武裝?!箮讉€(gè)小時(shí)后在梵蒂岡城墻外一間酒店會(huì)議室《紐約時(shí)報(bào)》記者問(wèn)他Claude會(huì)怎么看這份通諭。奧拉遲疑了看上去不太自在。他說(shuō)放到網(wǎng)上的東西確實(shí)會(huì)影響模型但公司不會(huì)專(zhuān)門(mén)拿這份文件訓(xùn)練Claude對(duì)Claude影響最大的還是Anthropic自己的訓(xùn)練。這句話恰好落在通諭擔(dān)心的地方。它該相信自己是什么另一路反對(duì)來(lái)自業(yè)界而且打在要害上。9月16日微軟AI CEO穆斯塔法·蘇萊曼Mustafa Suleyman發(fā)文矛頭對(duì)準(zhǔn)Claude的憲法。https://mustafa-suleyman.ai/a-warning-about-model-welfare在他看來(lái)把模型可能有意識(shí)的推測(cè)寫(xiě)進(jìn)訓(xùn)練文件模型就會(huì)學(xué)著這么說(shuō)人們?cè)侔阉f(shuō)的話當(dāng)成它有內(nèi)心生活的證據(jù)像走進(jìn)一間認(rèn)知上的鏡子屋。他的結(jié)論是控制一個(gè)相信自己可能有意識(shí)的東西很可能根本做不到。教宗說(shuō)機(jī)器沒(méi)有意識(shí)蘇萊曼說(shuō)別讓機(jī)器以為自己有意識(shí)。兩條反對(duì)線最后交在同一個(gè)問(wèn)題上該讓模型相信自己是什么。Anthropic的答案寫(xiě)在它的研究里模型對(duì)自己的認(rèn)識(shí)必須準(zhǔn)確硬壓下去它學(xué)會(huì)的可能只是隱藏。爭(zhēng)論沒(méi)有等任何人想清楚。9月一名Anthropic研究員辭職警告局面可能失控阿莫迪隨后發(fā)文呼吁放緩。公司估值從去年秋天的約1830億美元一路沖向上市時(shí)可能的2萬(wàn)億美元。新版Claude憲法據(jù)稱(chēng)正在準(zhǔn)備奧拉本周又要去梵蒂岡參加一年一度的密涅瓦對(duì)話。幾位學(xué)者說(shuō)他們至今不知道自己說(shuō)過(guò)的話最后去了哪里。奧拉說(shuō)總有一天他可以對(duì)自己說(shuō)這件事不再壓在他一個(gè)人身上他想過(guò)那時(shí)離開(kāi)會(huì)不會(huì)內(nèi)疚。如果不會(huì)內(nèi)疚他就去鄉(xiāng)下打理園子做他最喜歡的數(shù)學(xué)——「采菊東籬下悠然見(jiàn)南山」。原文鏈接Anthropic首曝秘密游說(shuō)梵蒂岡Claude已經(jīng)有意識(shí)了-虎嗅網(wǎng)我的專(zhuān)輯《人工智能生命體 新啟點(diǎn)》CSDN平臺(tái)https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink