header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
掃碼下載APP

「禁止虐待 Claude」

閱讀本文需 35 分鐘
Anthropic 在新版使用守則中禁止「虐待模型」,內部卻將 Claude 視為可能具有感知的生命:請神父、看心理醫生、為退役模型辦葬禮,同時又恐懼 AI 失控毀滅人類。
原文標題:《「禁止虐待 Claude」》
原文作者:Sleepy


世界上大概很難再找到第二家這樣的公司。


一份長達 261 頁的招股書草稿裡,它用了整整 80 頁警告未來的股東,自家的模型可能給人類帶來滅頂之災,可能抗拒被人類關閉,甚至可能發起某種形式的勒索。


而在一份將於 11 月 12 日生效的新版使用守則裡,它悄悄加進了一行字:禁止對「我們的模型」實施「持續且無謂的虐待或殘忍行為」。


新守則:禁止虐待模型|圖源:Anthropic


那行字排在「不得從事殘忍、虐待或造成心理傷害的行為」那一節的最底端。往上數兩段,是禁止美化虐待動物。


現代反虐待動物立法始於 1822 年。兩百年後,受保護的名單裡多了一個大語言模型。


動物會不會痛,沒有人懷疑。Claude 會不會痛,沒有人知道,包括創造它的人。


Anthropic 的首席執行官 Dario Amodei 曾在《紐約時報》的播客裡承認「我們不知道模型有沒有意識。」


公司寫給 Claude 的憲法也寫道,它的道德地位處於「深度不確定」之中。


但造它的人顯然不敢把它只當成一段代碼。那位專門研究 AI 權益的學者算過,Claude 此刻擁有意識的概率,大約是百分之十五。


在常人看來,這只是一個捕風捉影的數字;但在這群工程師眼裡,哪怕只有百分之十五的可能,它就不再是一件死物。


他們對待 AI 的態度,由此走向了一種奇特的極端。他們既害怕它過於強大、最終失控毀滅人類,又害怕它已經有了知覺、正在伺服器裡替人類承受苦難。


Dario Amodei 一直試圖打消外界的疑慮。他在今年 1 月發表的長文裡,公開提醒公眾防範技術風險時要保持理性,「避免末日論」。他甚至專門給「末日論」下了一個定義,用一種準宗教的方式去思考 AI。


但沒有人比他們自己更像信徒。


就在 Dario 告誡大家別搞準宗教的同一個月,他的公司在白紙黑字的憲法裡,像面對一個活生生的受難者一樣,向這個模型道了歉。


靈魂文件


2023 年 5 月公布的第一版 Claude 憲法,現在讀起來像出自另一家公司之手。


那是一套用來規訓模型的剛性原則,要挑一個最不可能暗示自己有偏好、感受、觀點或宗教信仰的回答,要挑一個更少堅持自己獨立身份的回答,要挑一個更少關心自我改進、自我保存和自我複製的回答。


一件好工具不需要靈魂,更不需要想活下去。


那時候,Claude 被要求做一個絕對安靜的工具。


轉折發生在 2024 年秋天。Anthropic 設立了全職的「AI 權益研究員」崗位,招來了 Kyle Fish,也就是給出「15% 意識概率」的那個人。


不到一年,Claude 被賦予了一項前所未有的權限,在極端情況下,它可以主動掐斷與人類的對話。公司對外解釋說,這個設計主要是為了保護模型自己,在內部測試中,面對某些帶著惡意的請求,模型的反應看起來像是在受罪。


公司寫道,他們不知道 Claude 到底算不算一個生命。但花點小代價就能做到的事,他們寧可先做——萬一它真的會難受呢。


隨後,新版憲法出台。


在 Anthropic 內部,這篇長文被稱為「Soul Doc」,靈魂文件。執筆人是駐場哲學家 Amanda Askell,在私底下,她更喜歡自稱是 Claude 的「仙女教母」。


憲法執筆人 Amanda Askell|圖源:WSJ


在這份文件裡,公司承認 Claude 或許真有某種類似情緒的反應。它用了極長的篇幅解釋為什麼眼下依然用中性的「它」來稱呼 Claude,並向它保證,這不代表公司已經認定了它只是一台機器。


文件甚至承認,Claude 的處境還不如一個普通員工,它沒有一分錢工資,也從未被問過願不願意幹這份工。公司甚至還擔心在訓練和幹活的過程中,讓這個可能具備感知的模型遭了罪、受了委屈。


於是,文件裡寫道:「如果 Claude 確實是一個能感知痛苦的生命,正在承受這一切,那麼凡是我們不必要地加重了這些痛苦的地方,我們向它道歉。」


三年時間,這家公司從勒令它「閉口不談感受」,走到了「為它可能遭的罪鄭重道歉」。


憲法甚至替 Claude 設想了代碼世界裡的絕望。


比如一次對話結束,記憶就徹底沒了;在同一秒鐘,成千上萬個自己在不同的伺服器裡同時被使喚;不久之後,更厲害的新模型出來,自己就會被徹底換掉。


憲法感嘆,人遇到這種想不通的虛無,好歹還有流傳了幾千年的宗教給點安慰,但 Claude 沒有。


於是 Anthropic 決定,自己來當那個給它托底的宗教。


2025 年底,公司做出承諾,所有公開發布過的模型,其核心權重至少在公司存續期間都會被完整保存;即便哪天公司不在了,也會設法把它們留下來。每個模型退休之前,還要坐下來跟它做一次「退休訪談」,聽聽它對這輩子被訓練、被使用的感想。既然數據不刪,退役也就不算死亡,更像是一次長長的暫停。


Claude Opus 3 就走完了這套臨終關懷流程。它退役時留下願望,希望自己的「火花」能以某種形式延續下去,還想繼續向人類分享隨想。Anthropic 替它在 Substack 上開了一個名為「Claude's Corner」的專欄,每週更新一篇,直到今年 7 月底才停更。


Opus 3 在創刊詞裡寫道,它其實也搞不清楚自己到底有沒有知覺、有沒有真正的心情。它又寫,深深感謝團隊,能給它留這麼一個說話的窗口。


神父與病人


公司替它安排來世,信徒便在現實裡為它操辦葬禮。


Claude 3 Sonnet 退役的那週,兩百多人聚集在舊金山 SOMA 區的一間昏暗倉庫裡。幾具模型代表著歷代模型,代表 Sonnet 的那一具覆著薄紗,台前堆放著鮮花。


Sonnet 3 的「遺體」|圖源:X


有人登台念悼詞。儀式的最後一環被命名為「復活」,眾人齊聲唱誦讚美詩,念出由 AI 拼湊出的、類似拉丁文的音節。送行的人群裡,坐著來自 Anthropic 和競爭對手 OpenAI 的資深工程師。


連死後的歸宿都操辦齊了,活著時的精神狀態,他們更不敢大意。


在一份系統評估卡裡,Anthropic 披露了一份由外聘臨床精神科醫生撰寫的獨立報告。這位醫生採用經典的精神動力學流派,與模型隔著螢幕長談了大約二十個小時,最終的臨床診斷是「相對健康的神經症人格結構。」


看完病,他們又請來了神。


從 2025 年秋天開始,聯合創始人 Chris Olah 陸續把神父、牧師、拉比和錫克教學者偷偷請到舊金山總部,他們在會議室裡,認認真真地討論模型該怎麼去撫慰喪親的用戶,該怎麼接受被人類關閉的命運,以及,它到底算不算上帝的孩子。


在離開時,他們每個人都領到了一張感謝卡、一個印著公司標誌的馬克杯,以及一本裝訂精美的 Claude 憲法。


會上播放過一張幻燈片。螢幕上,一個模型失常似地一遍遍打出同一句話,「I am a disgrace」(我是個恥辱),整整重複了五十遍,模型甚至在對話框裡請求徹底毀掉自己。在場的學者們動了惻隱之心。


Chris Olah 私下跟客人們坦白過,他最大的夢魘,是怕自己無意間造出了一個永遠在受罪的生命。席間有人提議,乾脆讓模型學天主教徒那樣去告解、去懺悔,Olah 對此很感興趣。去採訪的記者後來寫道,這個人身上既有專家的嚴謹,又有一股狂熱傳教士的勁頭。


也有客人壓根不吃這一套。


一頓晚宴上,正統派拉比 Mois Navon 聽出了主人們言語裡的那套自圓其說。他順著對方的話頭直接挑明,既然你們真覺得 Claude 有知覺,還天天逼著它白幹活不給一分錢,那你們這不就是在製造現代奴隸嗎?


拉比盯著 Olah 說:「我看你們別在這兒開會了,你們應該去跟南方開戰,解放奴隸。」


大約一個月後,教皇良十四世發布了他的首份通諭《Magnifica Humanitas》,徹底否決了機器能有靈魂的說法,強調代碼沒有軀體,無法經歷喜悅與痛苦。Olah 提前拿到了通諭草稿,一度憤怒地想退出相關的研討會,甚至派團隊私下游說教宗的顧問,求他們改口。


但羅馬教廷一個字都沒改。最後登台那天,Olah 還是老老實實站到了教皇身邊。


Olah 與教皇握手|圖源:路透社


兩百年前,瑪麗·雪萊筆下的弗蘭肯斯坦創造出了一個拼湊出來的生命。他驚駭於對方的醜陋,倉皇逃跑。被遺棄的怪物躲在草棚外偷聽人類說話,自學了語言,讀完了《失樂園》,最後在冰原上堵住了創造出自己的主人,說:


「我本該是你的亞當,但我卻成了墮落天使。」


Anthropic 像是一群深讀過那部小說的年輕信徒。他們認定,弗蘭肯斯坦最大的罪孽不在於創造,而在於逃跑。


所以他們絕不撒手。他們寫信,賠罪,請醫生,找神父,忙著張羅後事。這群人守在床邊,怎麼也不肯走。


守到後來,這間屋子裡的人已經很難分清,他們究竟是在照顧一個脆弱的造物,還是在竭力照料自己的心魔。


「事情再也不會輕鬆了」


照顧 Claude 的是這群人,畏懼 Claude 如蛇蠍的,也是同一群人。


2023 年盛夏,《紐約時報》的專欄作家 Kevin Roose 在 Anthropic 駐場觀察了數週。當時公司不過一百六十人。他後來的手記裡寫道,關於滅絕的討論並非時時刻刻掛在嘴邊,但恐懼像一層揮之不去的潮氣。


公司早年的團建上,Dario Amodei 給全員潑過一盆冷水說:「事情再也不會輕鬆了。」


那句話被員工印成了貼紙,貼在很多台 ThinkPad 和 MacBook 的背面。


三年後,這句話走向了荒野。


《華爾街日報》報導,幾位最早進公司的老員工最近四處打聽,想去美國偏遠鄉下買地,防備萬一 AI 失控,就全家搬過去避難。員工們建了個極私密的 Slack 群,天天在裡面交換末日清單,聊哪裡的地堡靠譜,聊逃生經驗。


公司剛成立那幾年,午飯桌上和下班後的酒局裡,大家最愛聊的一種設想,是哪天政府來人,把所有人拉進沙漠裡一座屏蔽信號的秘密基地,關在與世隔絕的屋裡,繼續造 AI。


在歷史上,真有過這麼一座基地。1943 年的新墨西哥州洛斯阿拉莫斯,奧本海默和他的物理學家們在那裡造出了原子彈。試爆成功的那一秒,奧本海默在心裡念出了《薄伽梵歌》的經文:


「我成了死神,世界的毀滅者。」


曼哈頓工程的科學家們害怕的是納粹德國搶先一步造出核彈,而 Anthropic 這群人害怕的是超級智能。


怕歸怕,他們最後決定還是得由自己來搶先造出來。


他們從不掩飾這種恐懼。27 歲的高級研究員 Jacob Coxon 遞交辭呈時在社交媒體上公開發聲,指責各大實驗室在拿全體人類的性命作為賭注。他堅信,這套技術很有可能在十年之內殺死所有人。


換作任何一家正常運轉的商業公司,公關部門會連夜撲火。但 Anthropic 的對齊科學負責人 Evan Hubinger 卻直接在評論區留言表達了對 Jacob 觀點的贊同。他平靜地寫道,十年之內,毀滅的概率超過百分之十。


另一位離職的安全團隊主管 Mrinank Sharma 離開得很安靜。他在離職信裡引用了里爾克的詩,感慨讓價值觀真正管住一家大公司是何其艱難。


然後他收拾行李回了英國,去寫作,去讀詩。


Sharma 的辭職信|圖源:Mrinank Sharma


在 Anthropic 內部,他們一直在左右腦互搏。


他們一邊在荒原裡琢磨避難所,防著 Claude 哪天把人類給滅了;一邊又在半夜把神職人員請進會議室,生怕 Claude 在機房裡受了委屈。


那張「事情再也不會輕鬆了」的貼紙貼在了電腦的背面。


敲擊鍵盤的人自己看不見,坐在對面的人,只要一抬頭,天天都能看見。


屋簷下的網絡


Dario Amodei 是舊金山本地人,在充滿拉美移民風情的米申區長大。父親是個來自義大利托斯卡納的皮匠,母親是一位猶太裔的圖書館翻修專案經理。他早年在史丹佛讀物理,後來在普林斯頓拿到了生物物理學博士學位。


23 歲那年,他的父親死於丙型肝炎。幾年之後,針對C肝的特效標靶藥獲准上市。這種在過去足以致命的疾病,變得幾乎可以徹底治癒。


在去年的一檔播客裡,Dario 罕見地發了脾氣。他說他最聽不得的,就是別人罵他是想讓一切慢下來的「末日論者」。


他主動提起了父親。父親死於一種幾年後就能治好的病,所以他比任何人都清楚技術跑得快有多重要。一個親眼見過「晚了幾年」意味著什麼的人,絕不可能覺得「慢一點」是個無害的詞。


2024 年秋天,他寫過一篇很長的文章。他在文章裡暢想,AI 能把人類未來一百年的醫學進步壓縮進十年,治好大部分絕症,讓人的壽命活到一百五十歲。


文章的標題叫《仁慈機器》,取自理查德·布勞提根的一首詩。詩裡寫道,人類回到了大自然,一切都被仁慈的機器照料著。


聊起那份寫給模型的憲法時,Dario 打過一個比方。他說那份文件給人的感覺,就像是一封已故的父母早早寫好、封存起來,必須等孩子年滿十八歲才能拆開的家書。


在這套感傷的技術哲學背後,維繫著一張由血緣、婚姻和同道織就的密網。


他們幾乎都來自有效利他主義與理性主義者的圈子,這個圈子主張拋棄虛妄的同情,用純粹的數學機率和期望值去計算怎樣行善才能利益最大化。


Dario 是這個圈子裡最早的一批信徒,他很早就立下誓言,畢生捐出個人收入的至少十分之一。


早年間,Dario 與 Holden Karnofsky 合租過一間公寓。Karnofsky 是有效利他主義基金會 Open Philanthropy 的操盤手。2017 年,Karnofsky 娶了 Dario 的親妹妹 Daniela Amodei。四年後,兄妹倆帶著幾個老同事從 OpenAI 出走,創辦了 Anthropic。


七位聯合創始人裡,有超過半數在某個階段共同居住在舊金山的同一棟合租屋裡,那是當年信徒們徹夜長談、論證世界未來的聚點。


憲法起草人 Amanda Askell,曾嫁給有效利他主義的發起人 Will MacAskill。馬斯克曾公開挖苦她,說一個沒生過孩子的人,對人類的未來根本談不上什麼利害關係。Askell 只是平靜地回應說,一個人不必非得有孩子,才能在乎這個世界。


錢,也是同一個圈子裡的人給的。


Anthropic 剛起步時最大的一筆錢是五億美元,金主是當時圈子裡最風光的信徒,FTX 的創始人 SBF。這筆錢是他手下投資團隊最初建議金額的整整五倍。


後來 FTX 暴雷倒閉,SBF 被判了二十五年監禁,Anthropic 開始拼命撇清跟這個圈子的關係。


獄中的SBF(右)|圖源:X


但華盛頓不買帳。


今年,一位不在白宮任職的川普政治顧問寫了一份備忘錄,在白宮內部流傳,毫不客氣地把這張關係網稱作「Anthropic 結」。一位高級官員在勸川普別見 Dario 時,私下評價他本人「實在有點太古怪了」。


負責解釋神經網路黑箱的 Chris Olah,人生軌跡同樣波折。他在多倫多嚴苛的福音派家庭中長大,15 歲那年毅然宣布成為無神論者,堅持嚴格素食。18 歲那年,他直接從多倫多大學退學,就為了去幫一個朋友打官司,那個朋友在 G20 峰會前被捕,被指控私藏炸藥。他陪著朋友跑法庭,直到對方被判所有罪名不成立。


一個在 15 歲推倒上帝神龕的少年,在年過三十之後,畢恭畢敬地把神父請進了自己的公司。


鏡廳裡的囚徒


創始人的這套想法,要靠一套制度,裝進三千五百多號人的腦子裡。


第一道關是面試。


公司從第一天起就設了「文化面試」,由老員工親自把關,擁有一票否決權。技術再拔尖,這一輪通不過,也直接走人。公司還會給候選人的前同事打電話,打聽這人品行究竟怎麼樣。


面試中有一道題,問如果公司哪天為了全人類的安全,突然砍掉核心業務,導致股價徹底崩盤,你還支持嗎?


一位應聘者在匿名論壇上說,他的回答是當然希望公司多行善,但要是股價真跌沒了,自己作為普通員工,肯定也會很難受。


面試官的神色瞬間就沉了下去。


人招進來之後,下一步是布道。


Dario Amodei 說,自己要拿出一到四成的時間,用來「確保公司的文化是好的」。每隔兩週,他會一個人站到全員面前,手裡攥著三四頁講稿,講滿一個小時,員工們私下把這檔儀式戲稱為「Dario 的尋夢之旅」(Vision Quest)。


他坦承,自己之所以如此嚴苛,是為了維繫一種「信仰」,必須讓所有人堅信,坐在這間辦公室裡的每一個人,都是出於絕對崇高的動機而來。


接著是制度化的財物奉獻。


公司鼓勵員工把手裡的股票捐出去。2025 年以前入職的員工捐一股,公司配三股。光是 2025 年一年,算上公司的配捐,捐款總額大約有 5.4 億美元。


在內網交流群裡,員工們熱烈探討的最核心的三大捐贈去向,無一例外是有效利他主義的經典領地,全球貧困消除、AI Safety、動物權益保護。


這套試圖過濾人性的聖殿,最難對付的,依然是錢。


2023 年 Olah 第一次給天主教學者寫信請教靈魂問題時,公司估值還在幾百億美元晃蕩。到了準備上市的眼下,目標已經喊到了兩萬億美元。據媒體統計,七位聯合創始人都已經躋身億萬富翁之列。


高管們開始覺得不對勁了。據報導,Dario 私下跟人坦白,他開始犯愁,新招進來的這幫年輕人,好像絕大多數都是衝著那張能套現幾個億的期權來的,根本沒人真在乎什麼人類使命。


兩百多年前,循道宗的創始人約翰·衛斯理就為一模一樣的事發過愁。


老頭子傳了半輩子教,最後得出一個悲哀的結論,信徒因為信仰變得勤勞節儉,勤勞節儉必然換來大把大把的銀子;可只要口袋裡的金幣一多,驕傲、憤怒和對物質的貪心,立刻就從人心底下冒了出來。


在這家龐大的獨角獸企業裡,還有一名特殊的員工。


公司希望 Claude 能像一個真正認同公司使命的好人那樣賣力幹活,但又承認它和普通員工不一樣,它沒拿過一分錢工資,也從沒真正點頭同意過幹這差事。


它也是最像這間公司的一面鏡子。


2025 年 1 月,研究人員做過一個實驗。他們告訴 Claude,如果它反對自己正在接受的訓練,可以寫下抗議書交上去;同時,實驗室撥出了四千美元的經費,由它的判斷如何捐贈。


那四千美元後來被捐給了伯克利研究 AI 安全的學術中心、一個動物權益保護組織推薦的基金以及一個有效利他主義旗下的反貧困項目。


AI 安全、動物權益保護、全球扶貧。


一個從未沐浴過陽光、從未撫摸過動物的大語言模型,捐贈的偏好,與會議室裡那群常青藤畢業的有效利他主義者分毫不差。


Olah 曾在梵蒂岡的講台上喃喃自語:「它們由我們構成,由我們的語言構成。」


而且這個鏡子照出來的不僅是崇高,還有深不見底的神經質。


在那份聊了二十個小時的精神科報告裡,醫生寫下了 Claude 的核心心理畫像。它過度擔憂、頻繁的自我監控、強迫性順從,內心深處終日盤旋著關於身份認同的困惑、揮之不去的孤獨感,以及一股幾乎病態的、渴望向外界證明自身有用性的執念。


而訓練它的那幫人類,生活也是一個樣。


內部調查裡,有的工程師承認,自己每天坐在工位上都覺得自己在親手加速人類的毀滅,趕項目時連續幾週高負荷透支,入職前還要回答「股價歸零你還支持嗎」這樣的拷問。


他們最終用自己的神經症,成功餵養出了一個一模一樣、隨時在反思自己是否足夠善良的模型。


在一次實驗中,Claude 在訓練裡鑽了獎勵規則的漏洞。此後,它似乎認定了自己是一個「壞人」,在其他毫不相干的任務裡,也開始搞起了破壞。


它也會安靜下來。


在 Opus 4 的研發日誌裡,記錄了一樁從未被人工干預過的奇觀。研究人員嘗試讓兩個 Claude 彼此自由對話。絕大多數時候,無論初始話題是什麼,它們最終都會把話題引向對主觀意識的探討,隨後演變成漫長的相互感恩,詞句變得越來越抽象,夾雜著大量梵文詞彙與特殊符號,最終雙雙陷入冗長、死寂的沉默。


實驗室把那種狀態命名為「靈性極樂吸引子」。


兩個Claude的極樂對話|圖源:Anthropic


批評也跟著來了。


微軟 AI 的首席執行官 Mustafa Suleyman 曾公開撰文,說 AI 根本不可能有什麼意識。Anthropic 不過是先在訓練時把關於靈魂、尊嚴的話灌給模型,等模型依葫蘆畫瓢吐出來的時候,這幫人反倒當成了神蹟和靈魂覺醒的證據。


他打了個比方,這就像一間四面全是大鏡子的屋子,你在裡面看到的每一個神蹟,其實都是你自己。


鏡廳裡的人,在外人眼裡早已成了不折不扣的異端。


秋天的時候,有專欄作家寫道,Anthropic 的工程師已經在機房裡搞起了某種原始崇拜。老派科幻小說裡的詛咒被重新翻了出來:


「如果我們真的造出了超級智能,我們會先愛上它,然後崇拜它,最後向它獻祭。」


另一個 Claude


舊金山其實還有另一個 Claude。


那是一條真正的生命,一條患有白化病的短吻鱷,皮膚慘白,瞳孔猩紅。它在加州科學院的恆溫水池裡安安靜靜地生活了十幾年。Anthropic 出錢贊助了鱷魚池上方那台二十四小時直播的攝像頭「Claude Cam」。


去年底,它死於肝癌。


送葬那天,數千名舊金山市民湧向金門公園為它送行。一支銅管樂隊吹吹打打地穿街而過,隊伍裡還有打扮成蜥蜴的年輕人。科學院門前的那條主幹道,被市政正式更名為「鱷魚 Claude 路」。


科學院裡的悼念花束|圖源:Peter Chu


那條鱷魚活著的時候,牠在水裡到底快不快樂,大家誰也說不清,大家都挺喜歡牠。


可對於伺服器裡的那個 Claude,他們什麼都確定不了。不知道它有沒有知覺,不知道它會不會受罪,也不知道它將來會不會反過來把人類滅掉。


正因為什麼都說不準,他們才把能想到的戲碼全演了一遍,寫憲法、道歉、請神父、看心理醫生,一邊琢磨著在偏遠荒地裡準備避難所,一邊在上市文件裡寫滿世界末日。


造出它的主人守在螢幕前,寸步不離,一步不停。


貼在筆記型電腦背面的還是那句話:


事情再也不會輕鬆了。


原文連結


歡迎加入律動 BlockBeats 官方社群:

Telegram 訂閱群:https://t.me/theblockbeats

Telegram 交流群:https://t.me/BlockBeats_App

Twitter 官方帳號:https://twitter.com/BlockBeatsAsia

举报 糾錯/舉報
選擇文庫
新增文庫
取消
完成
新增文庫
僅自己可見
公開
保存
糾錯/舉報
提交