
納西姆·尼古拉斯·塔勒布在《黑天鵝》中講過一個著名的“火雞問題”。一只火雞每天都會得到主人的喂養(yǎng)第一天如此第一百天如此第五百天依然如此。隨著時間推移如果這只火雞會做統(tǒng)計它會發(fā)現(xiàn)一個無比穩(wěn)定的規(guī)律主人每天出現(xiàn)隨后帶來食物過去的樣本越多這條規(guī)律看起來就越可靠。到了第一千天火雞對這個世界的信心甚至可能達(dá)到頂點因為它已經(jīng)積累了足夠多的歷史數(shù)據(jù)來證明“人類是來照顧我的”。可真正諷刺的是它最相信這條規(guī)律的時候可能恰恰距離感恩節(jié)最近。這個故事真正討論的不是火雞而是人類一個極其頑固的認(rèn)知習(xí)慣我們總是傾向于把“過去沒有發(fā)生”逐漸理解成“未來不會發(fā)生”。今天當(dāng) AI 從一個回答問題的工具逐漸變成能夠調(diào)用 API、訪問數(shù)據(jù)庫、操作云資源、發(fā)送郵件、執(zhí)行支付甚至連接現(xiàn)實設(shè)備的 Agent 時這個古老的問題正在以一種新的方式重新出現(xiàn)。一、真正危險的可能不是 AI 經(jīng)常犯錯而是它長期不犯錯假設(shè)一家企業(yè)剛上線一個 AI Agent。最初階段所有人通常都會非常謹(jǐn)慎它只能讀取信息不能直接修改數(shù)據(jù)高風(fēng)險操作需要人工確認(rèn)轉(zhuǎn)賬有明確限額刪除操作需要額外審批所有執(zhí)行都有完整記錄。然后 Agent 連續(xù)運行一個月沒有嚴(yán)重問題半年以后已經(jīng)成功完成幾十萬次任務(wù)一年以后甚至成為業(yè)務(wù)流程里最穩(wěn)定的一部分。于是原本合理的安全邊界開始被重新審視既然每一次人工確認(rèn)最終都是“同意”為什么不能取消既然 Agent 從來沒有濫用過權(quán)限為什么不能開放更多工具既然過去十萬次執(zhí)行都沒有嚴(yán)重錯誤為什么還要讓它在關(guān)鍵步驟停下來等待額外檢查從效率角度看這些問題都很合理甚至每一步都有歷史數(shù)據(jù)支持但這恰恰也是火雞理解世界的方式。過去一千次有人喂食于是第一千零一次似乎也應(yīng)該如此Agent 過去十萬次執(zhí)行正確于是第十萬零一次似乎也應(yīng)該正確。真正危險的地方并不只是這種推斷可能失敗而是過去的成功會不斷改變我們愿意給系統(tǒng)多少權(quán)力。隨著信任增加人工確認(rèn)減少權(quán)限擴大執(zhí)行范圍延伸原本存在的隔離逐漸被視為低效率和歷史包袱。因此一個非常反直覺的風(fēng)險出現(xiàn)了AI 越穩(wěn)定我們越愿意撤掉限制AI 越可靠我們越愿意擴大它的執(zhí)行半徑而真正錯誤發(fā)生時它能夠造成的后果反而可能比最初更大。長期成功本身可能成為制造脆弱性的過程。二、99.99% 的正確率不能回答最重要的問題現(xiàn)代技術(shù)世界特別喜歡準(zhǔn)確率、成功率和可用率。當(dāng)一個 Agent 的任務(wù)成功率達(dá)到 99.9% 或 99.99% 時人們很自然地會把這個數(shù)字與“安全”聯(lián)系在一起。但在高風(fēng)險執(zhí)行系統(tǒng)里這種平均值往往不能回答最重要的問題因為不同錯誤的后果并不是線性的。一個 AI 助手答錯一道普通問題代價可能只是用戶重新問一次一個 Agent 發(fā)錯一封內(nèi)部郵件也許只是一次溝通事故。但如果同一個系統(tǒng)擁有生產(chǎn)數(shù)據(jù)庫刪除權(quán)限、企業(yè)資金支付能力或關(guān)鍵設(shè)備控制接口那么一次錯誤就可能造成完全不同量級的損失。前 99999 次操作都正確最后一次誤刪了生產(chǎn)數(shù)據(jù)從統(tǒng)計意義上看系統(tǒng)依然接近完美可對于企業(yè)而言這個平均值可能已經(jīng)沒有多少意義。這也是《黑天鵝》中最值得重新理解的地方之一在某些領(lǐng)域一個極端事件足以壓過大量正常樣本。AI Agent 越來越接近這樣的世界它的真正風(fēng)險不一定來自“經(jīng)常犯錯”而可能來自一次低概率、不可逆、具有巨大外部性的執(zhí)行。所以當(dāng) AI 開始擁有改變現(xiàn)實的能力以后我們真正應(yīng)該問的不只是“它平均有多可靠”而應(yīng)該增加另一個問題它最壞的那一次能夠走多遠(yuǎn)前一個問題關(guān)注正確率后一個問題關(guān)注錯誤的影響半徑。模型當(dāng)然應(yīng)該越來越可靠但如果所有安全信心最終都建立在“模型已經(jīng)足夠可靠所以可以取消邊界”上我們只是換了一種方式重新犯火雞的錯誤。三、事故能夠被解釋不代表事故能夠被預(yù)測另一個常見錯覺是把事后解釋能力誤認(rèn)為事前預(yù)測能力。金融危機發(fā)生以后人們可以回頭指出杠桿率、流動性和資產(chǎn)泡沫系統(tǒng)故障發(fā)生以后工程師可以在日志里找到幾小時前已經(jīng)異常的指標(biāo)AI Agent 越界以后我們也可以重新檢查 Prompt、上下文和工具調(diào)用鏈然后指出某個時刻其實已經(jīng)出現(xiàn)了風(fēng)險征兆。這些分析當(dāng)然有價值但它們很容易帶來一種過度自信既然事故發(fā)生以后能夠找出原因那么下一次只要監(jiān)控得更聰明、模型看得更多、異常檢測做得更細(xì)就應(yīng)該能夠提前發(fā)現(xiàn)同類問題。問題在于事后解釋和事前預(yù)測從來不是同一種能力。一個異常指標(biāo)在事故發(fā)生以后看起來非常明顯在事故發(fā)生以前卻可能只是大量噪聲中的一個一種 Agent 行為事后看起來明顯越界當(dāng)時卻可能與普通探索行為沒有本質(zhì)區(qū)別。因此AI 安全不能把最后一道防線全部建立在“我們一定能夠提前看懂它什么時候要犯錯”這個假設(shè)上。真正重要的問題應(yīng)該變成如果有一天我們沒有提前發(fā)現(xiàn)系統(tǒng)還能不能承受這正是預(yù)測和控制之間的區(qū)別。預(yù)測試圖告訴我們未來會發(fā)生什么而控制承認(rèn)我們可能無法知道未來卻仍然可以限制未來能夠造成什么后果。我們不知道 Agent 下一次會不會誤判但可以限制單次支付金額不知道哪一種上下文會被污染但可以規(guī)定某些生產(chǎn)對象不能被單一主體直接刪除不知道哪一種未知狀態(tài)第一次出現(xiàn)但可以讓缺失、沖突和不確定本身成為拒絕繼續(xù)執(zhí)行的理由。不能預(yù)測錯誤不等于不能限制錯誤。四、真正侵蝕安全邊界的往往不是失敗而是成功安全機制有一個天然困境如果它長期有效人們反而很難感受到它的價值。消防通道絕大多數(shù)時間沒有人使用備用電源可能幾年都不會真正啟動一個最終否決機制也許連續(xù)數(shù)年都沒有拒絕過一次執(zhí)行。于是從組織效率的角度看這些東西很容易逐漸變成“低利用率資產(chǎn)”。如果三年都沒有觸發(fā)為什么還要維護如果 Agent 從來沒有誤操作為什么還需要這個限制如果人工審批每次最終都是同意為什么不能取消問題在于這種邏輯把“事故沒有發(fā)生”和“防止事故的機制沒有價值”混成了一件事。現(xiàn)實中經(jīng)常恰恰相反長期沒有出現(xiàn)嚴(yán)重后果可能正是因為那些看起來低效、保守、冗余的機制一直存在。于是安全會形成一種微妙的悖論成功會逐漸侵蝕產(chǎn)生成功的條件。事故少了預(yù)算開始削減邊界很少被觸發(fā)邊界開始被取消人工極少否決 Agent于是人工被視為可以自動化掉的最后摩擦。直到第一次真正不同于過去的問題出現(xiàn)人們才重新問為什么當(dāng)初沒有留下最后一道保護對于 AI 系統(tǒng)而言真正危險的時刻也許不是它表現(xiàn)很差的時候而是它已經(jīng)表現(xiàn)得足夠好讓組織開始相信那些原本用于限制極端錯誤的機制已經(jīng)沒有必要的時候。五、AI 系統(tǒng)真正需要為“第 100001 次”設(shè)計今天的大部分 AI 優(yōu)化都在努力改善前十萬次執(zhí)行讓模型更聰明、更穩(wěn)定降低幻覺提高任務(wù)成功率讓工具調(diào)用更加準(zhǔn)確。這些工作當(dāng)然重要但一個真正進入高風(fēng)險現(xiàn)實系統(tǒng)的 Agent還必須為另一個數(shù)字設(shè)計——第 100001 次。那一次可能來自一種訓(xùn)練數(shù)據(jù)里沒有出現(xiàn)過的組合可能是兩個原本安全的系統(tǒng)發(fā)生意外交互也可能是環(huán)境狀態(tài)突然變化或者某個很小的理解錯誤被高速自動化放大。更重要的是那一次問題發(fā)生以前可能沒有任何人能夠清楚解釋它為什么危險。一個成熟系統(tǒng)的價值應(yīng)該在這里體現(xiàn)出來。它并不承諾 AI 永遠(yuǎn)不會犯錯而是保證某些錯誤即使真的發(fā)生也無法無條件穿透所有邊界。這并不是只屬于 AI 的新思想我們無法保證司機永遠(yuǎn)不犯錯所以汽車有剎車、護欄和安全氣囊無法保證電網(wǎng)永遠(yuǎn)正常所以有斷路器無法保證建筑永遠(yuǎn)不失火所以保留消防通道。它們的共同點不是能夠提前預(yù)測下一次事故而是承認(rèn)事故終究可能發(fā)生因此提前限制事故可以造成的最大后果。AI Agent 最終也需要進入這樣的工程階段安全不能只停留在證明模型越來越值得信任而應(yīng)該進一步保證即使模型在絕大多數(shù)時候都值得信任系統(tǒng)也不會把所有現(xiàn)實變化的權(quán)力集中在某一次判斷之上。六、《黑天鵝》真正教我們的不是如何預(yù)測下一只黑天鵝很多人讀完《黑天鵝》以后本能地會問既然黑天鵝如此危險那我們怎樣找到下一只黑天鵝但真正重要的并不是成為一個越來越厲害的預(yù)言家而是接受一個不太舒服的事實世界里始終存在一些我們看不見、算不到也無法提前解釋清楚的東西。成熟并不意味著越來越確信自己能夠預(yù)測未來而是知道即使預(yù)測失敗系統(tǒng)也不能因此失去全部邊界。今天的 AI 正在獲得越來越強的能力它們能夠理解更長的上下文、規(guī)劃更復(fù)雜的任務(wù)也越來越能夠直接參與真實世界執(zhí)行。但能力越強我們越容易產(chǎn)生另一個危險的心理既然它已經(jīng)這么可靠也許那些限制可以慢慢取消既然十萬次都沒有出事也許下一次不用再檢查既然模型越來越聰明也許最終只需要相信模型本身?!逗谔禊Z》真正令人不舒服的提醒就在這里過去不斷重復(fù)的事實只能證明過去它不能替我們消滅未來的未知。所以真正成熟的 AI 系統(tǒng)不應(yīng)該以“終于造出了一個不會犯錯的智能”為最終目標(biāo)。更現(xiàn)實、更重要的目標(biāo)是即使它在最意外的那一次犯了錯我們?nèi)匀粵]有把全部現(xiàn)實交給它。安全邊界的價值也從來不應(yīng)該通過它平時觸發(fā)了多少次來衡量。它存在的意義是為那個我們無法提前指出時間、無法預(yù)先描述形式、甚至今天根本還想不到的“第 100001 次”留下空間?!逗谔禊Z》真正提醒我們的從來不是如何準(zhǔn)確預(yù)測下一次意外而是不要因為暫時看不見意外就把承受意外的能力一起拿掉。AI 時代我們正在重新面對這個古老的問題。不同的是這一次我們所信任的系統(tǒng)已經(jīng)不只是越來越會判斷它也正在越來越有能力直接改變現(xiàn)實。