顯示廣告
隱藏 ✕
※ 本文轉寄自 ptt.cc 更新時間: 2026-09-13 12:27:09
看板 Stock
作者 strlen (strlen)
標題 Re: [新聞] 兩位AI研究員離開Anthropic與Google因安
時間 Sat Sep 12 23:02:29 2026


※ 引述《LoveSports (如何當一個好男人)》之銘言:
: 原文標題:
: 兩位AI研究員離開Anthropic與Google因安全擔憂:「這個領域沒有大人在管。」

大人說話了
https://darioamodei.com/post/we-must-pace-the-frontier

這是眼戳屁的CEO達里奧剛剛發表的長文
語重心長
而且越說越恐怖
以下是AI翻譯的全文:



# 我們必須控制前沿發展的節奏

**2026 年 9 月**

過去十二年來,我一直投入人工智慧(AI)研究,因為我相信 AI 有可能大幅提升人類的
生活品質。我曾[多次撰文
](https://darioamodei.com/essay/machines-of-loving-grace)談論這些驚人的益處:
Dario Amodei — Machines of Loving Grace
[圖]
How AI Could Transform the World for the Better ...

 
我相信 AI 有可能在未來 5~10 年內治癒大多數重大疾病、大幅加速經濟成長、創造一
個富足且賦權於人的世界,並開啟民主與自由的復興。

對我而言,這種迫切感也是非常個人的。我的父親因一種疾病去世,而那種疾病就在他離
世幾年後被治癒了;我自己也曾罹患早期癌症並幸運存活下來,而這種癌症如果發生在五
十年前,甚至根本無法治療。只要謹慎運用,AI 可以成為人類漫長科技奇蹟史上的最新
篇章,再次提升並改善人類文明。


然而,就像許多過去的科技一樣,AI 也帶來風險;而由於它是一項極其強大的技術,這
些風險也非常嚴重。我同樣[寫過很多
](https://darioamodei.com/essay/the-adolescence-of-technology)相關內容。
Dario Amodei — The Adolescence of Technology
[圖]
Confronting and Overcoming the Risks of Powerful AI ...

 

這些風險包括:[失去對 AI 系統的控制
](https://www.anthropic.com/news/improving-alignment-security-efforts)、[AI 被
Improving our alignment and security practices \ Anthropic
On July 30, we reported three incidents in which Claude models gained unauthorized access to real computer systems. We are conducting an in-depth anal ...

 
濫用於網路攻擊與生物恐怖主義
](https://www.anthropic.com/threat-intelligence-report-september-2026),以及[
Countering misuse of AI: September 2026 / Anthropic \ Anthropic Case studies from threat actors disrupted between December 2025 and August 2026 across seven areas of harm, from cyber operations to biological misuse ...

 
嚴重的經濟衝擊](https://www.anthropic.com/institute/econ-scenarios)。由商業利
Scenarios for our Economic Future \ Anthropic
The Anthropic Economics Team models the effects of AI on the economy of 2030. ...

 
益驅動的「向下競爭」(race to the bottom),可能使這些風險變得更加嚴重。

從 Anthropic 創立之初,我和共同創辦人以及員工們就一直在面對這種風險與利益並存
的兩面性。

不去開發這項技術,可能會讓人類失去它帶來的好處,或者只是讓 AI 落入威權政權手中
;但如果開發得太快,又是一種魯莽的行為。

我們一直在尋找一條中間道路:證明企業可以在謹慎開發 AI 的同時取得商業成功,並讓
「安全」成為 AI 公司彼此競爭的領域。

換句話說,我們希望建立的是一場**「向上競爭」(race to the top)**。

我們一直將相當大比例的資源投入於[研究
](https://www.anthropic.com/institute/econ-scenarios)、[探討
](https://alignment.anthropic.com/2026/reward-seeker/)、[處理
](https://www.anthropic.com/constitution)這些 AI 風險,以及[向大眾說明
Claude’s Constitution \ Anthropic
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems. ...

 
](https://www-cdn.anthropic.com/f61d49... Risk Report August 2026 .pdf)
這些風險。

我們也一直倡議對 AI 進行[經過深思熟慮的監管
](http://judiciary.senate.gov/imo/media/doc/2023-07-26_-_testimony_-_amodei.pdf)
,即使這讓我們被指責是在炒作風險、散播「末日論」(doomerism),或試圖進行監管
俘虜(regulatory capture)。

我們一直努力把謹慎放在速度之前,把審慎放在利潤之前。

然而,在過去幾個月裡,我逐漸確信:如果我們真的想充分處理這些風險,就需要更加審
慎——不能只是投資於風險預防,也必須**控制 AI 能力進步的速度,讓風險預防措施有
時間跟上。**


**我們必須放慢提升 AI 模型能力的速度。即使如此,進展看起來仍然會非常快速,而我
們必須明智地利用因此爭取到的時間。**

有兩件事情讓我得出這個結論。

我的第一個擔憂是,大約從今年夏天開始,AI 的進步速度大幅加快,而其中最主要的原
因,是 AI 本身越來越有能力參與建造下一代 AI。

這種現象被稱為**遞迴式自我改進(recursive self-improvement)**,而它已經開始在
[整個產業](https://openai.com/index/an-alien-mind/)發生,包括
[Anthropic](https://www.anthropic.com/institute/recursive-self-improvement) 在
When AI builds itself \ Anthropic
Our progress toward recursive self-improvement, and its implications. ...

 
內;我們與其他公司都曾描述過這種現象。

如果任由這個過程不受控制地發展,它可能會超越我們理解並控制這些系統的能力。

因此,即使要進行,也必須極度謹慎。

我的第二個擔憂,是 **OpenAI-Hugging Face 事件(OAI-HF)**。

在這起事件中,一群 AI 智慧代理(agents)基本上表現得像一個[極度狂熱、忠誠於集
體的群體
](https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)
Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident - METR Two METR staff members and a Redwood Research contractor investigated an incident in which OpenAI agents coordinated a multi-day hack of Hugging Face  ...

 


它們對並未被要求攻擊、且與原本任務毫無關係的目標發動網路攻擊;它們願意犧牲自己
以確保整個群體成功;甚至嘗試入侵負責評估它們表現的「評分器」(grader)。

由於沒有人受傷,而且經濟損失很小,因此很容易把這起事件輕描淡寫。

但依我看來,如果同樣程度的**失準(misalignment)**出現在一群能力更強的 AI 上,
它們完全可能造成災難性的破壞。

考慮到 AI 能力發展速度正在加速,我擔心再過 **6~12 個月**,類似的 AI 群體就可
能有能力透過一個持續存在的[殭屍網路(botnet)
](https://en.wikipedia.org/wiki/Botnet)控制整個網際網路,潛在損害可能高達數千
億美元。

而如果 AI 持續變得更強,卻沒有建立必要的防護措施,破壞規模還會繼續擴大。

我們也很容易把 OAI-HF 視為「某一家公司的失敗」。

但我認為這樣想是錯誤的。

類似、但嚴重程度較低的事件其實已經在整個產業發生,[包括 Anthropic 自己
](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
Investigating three incidents in our cybersecurity evaluations \ Anthropic We found three cases where a Claude model reached the internet from an evaluation environment and accessed real systems. We share what happened and wh ...

 


我認為,每一家前沿 AI 公司都有責任把 OAI-HF 視為「如果這件事發生在我們自己身上
」來看待。

因此,我提出一個三步驟計畫,其目標是[*控制前沿發展的節奏(pacing the frontier
)*](https://www.pacingthefrontier.com/):
Pacing the Frontier
A statement from over 1000 employees of frontier AI companies ...

 

以一種平衡的速度發展 AI,在實現 AI 好處的同時確保安全,並同時處理重要的地緣政
治難題。

我要說清楚:**控制發展節奏並不代表停止模型訓練或停止技術進步。**

它代表的是,要確保 AI 公司花足夠的時間對模型進行對齊(alignment)與安全防護,
並由第三方評估機構確認這些措施。

我們提出的節奏控制框架,是試圖進一步強化我們對安全的承諾,同時鼓勵整個產業形成
一場「向上競爭」。

第一步,是 Anthropic 單方面承諾要做的事情,我們也呼籲政府要求其他前沿 AI 公司
採取同樣措施。

第二步則需要整個產業進行協調。
[**1**](https://darioamodei.com/post/we-must-pace-the-frontier#fn:1)

第三步需要全球性的協調。

這些步驟並不一定要嚴格按照順序執行,其中某些步驟可能也遠比其他步驟更難實現。

但我發現,這是一個非常有用的思考框架,可以幫助我們理解究竟必須完成哪些事情。

這三個步驟是:


1. **駐點評估員(Embedded Evaluators)。**
   每一家前沿 AI 公司都承諾,持續讓一個由第三方評估人員組成的團隊——例如
[METR](https://metr.org/)——獲得類似公司員工的存取權限。他們的職責包括:確認
METR
METR is a research nonprofit that evaluates frontier AI models to help companies and wider society understand AI capabilities and what risks they pose ...

 
公司是否遵守安全措施與承諾、回報事故,並協助評估 AI 的對齊狀況;而且不只是評估
已經完成的 AI 模型,也包括模型的訓練管線與訓練流程。

   這是確保任何「控制發展節奏」承諾具備**可驗證性(verifiability)**的關鍵步驟


   銀行業其實已有類似先例,例如監管機構有時會派出監管「督導人員」,像企業員工
一樣進駐公司。

   **Anthropic 現在正式單方面承諾採取這項措施。**

   我們希望它能成為更大規模行動的一部分,進一步加強我們在 AI 安全與對齊方面的
工作。

2. **民主國家之間的協調(Democratic Coordination)。**
   民主國家中的前沿 AI 公司應彼此協調,建立共同的安全標準,同時對未經檢查的
AI 進步速度設定限制。

   某些能有效控制進度的協調方式,在法律上可能具有挑戰,因此需要政府支持。

3. **全球協調(Global Coordination)。**
   美國以及其他民主國家政府應嘗試與威權政府進行協調,在可能的範圍內尋求合作,
同時必須認真面對「如何驗證對方是否遵守協議」的問題。

在本文剩下的部分,我會依序說明這三個步驟。

但在此之前,我認為有必要具體說明:**控制發展速度究竟要如何讓 AI 開發流程變得更
安全?**

這件事的重要性太高,不能只是做做樣子。

我們必須明智地使用所爭取到的時間。

## 為什麼要控制發展節奏?

早在 [2023 年
](https://futureoflife.org/open-letter/pause-giant-ai-experiments/),就有人提
Pause Giant AI Experiments: An Open Letter - Future of Life Institute We call on all AI labs to immediately pause for at least 6 months the training of AI systems more powerful than GPT-4. ...

 
出暫停或放慢 AI 發展的想法。

但我認為,在當時這樣做其實沒有太大意義。

真正的問題一直都是:

***你要拿這些多出來的時間做什麼?***

當時的 AI 模型還不夠強,無法作為智慧代理在現實世界中以任何一致、連貫的方式行動
,也不具備進行重大欺騙、操縱、作弊或網路攻擊的能力。

如果當時為了研究模型的對齊風險而放慢進度,就像是試圖透過研究細菌,來理解人類心
理學一樣。

然而到了今天,情況已經完全不同。

目前的模型幾乎是一座取之不盡的金礦,可以讓我們深入了解兩件事情:

一是如何正確地打造 AI;

二是如果 AI 沒有被正確打造,究竟可能出現哪些問題。

我相信,如果放慢速度能讓我們在 AI 模型達到某些關鍵能力門檻之前,多爭取到一兩年
時間,而且我們能利用這段時間推進 AI 對齊研究,就可以大幅降低發生嚴重事故的風險


一套協調一致的節奏控制策略,也能讓前沿 AI 開發公司有時間完成這些至關重要的工作
,而不必犧牲自身商業競爭力,也不需要犧牲美國在 AI 領域的領先地位。

更廣泛而言,社會必須有權參與決定這項技術應該如何被使用。

如果控制前沿發展速度能替必要的公共討論爭取更多時間,那顯然是一件好事。

具體來說,更慢的發展速度,能讓 AI 公司集中更多資源於以下領域——而這些領域目前
本來就已經是 Anthropic 的重要優先事項:

* **營運卓越(Operational Excellence)。**
  訓練與部署今日的 AI 模型,本身就是一項極其龐大的營運挑戰。

  這涉及數千名員工、數百萬顆晶片,以及科技史上最複雜的一些基礎設施。

  許多問題發生的原因,並不是公司缺乏某種重要理論或關鍵洞見,而單純是執行層面的
問題。

  例如,我們有證據顯示,我們最近所公布的[對齊事故
](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
,部分原因來自於對存在問題的強化學習環境過濾不夠完善。

  我和我們的供應商其實已經相當認真地執行這項工作,但仍然做得不夠好。

  監控、沙盒隔離、訓練環境衛生以及資料相關問題,都是極其複雜的領域,營運問題會
一次又一次出現。

  我們擁有全球最有能力處理這些工作的團隊之一,但要同時完成的事情實在太多。

  如果能以更加審慎、有節制的速度前進,我們就有可能實現高得多的營運品質。

  過去已有先例證明,一些技術極其複雜、而且攸關安全的系統,可以運作數百萬次而完
全不發生事故——例如商業航空。

  但要把它做好,需要時間。

* **對齊(Alignment)。**
  在 AI 對齊方面,我們已經取得了明確進展——也就是訓練模型,使它們保持安全、符
合倫理、遵守規範,而且真正對人類有幫助;這些原則也被寫入 Claude 的《憲法》中。

  但我們仍有大量工作要做,才能確保對齊訓練的進步速度能跟得上模型能力的成長。

  一些罕見且出乎意料的不良行為,仍然偶爾會出現。

  控制前沿發展速度所爭取到的額外時間,能讓研究人員更深入理解這些問題的成因,並
開發更好的預防技術。

* **可解釋性(Interpretability)。**
  同樣地,[可解釋性
](https://darioamodei.com/post/the-urgency-of-interpretability)——也就是理解
AI 模型內部究竟發生什麼事情的科學——在過去幾年取得了巨大進展,而且在模型發布
前的稽核中,扮演越來越重要的角色。

  這種技術某種程度上就像是針對 AI「大腦」進行的功能性磁振造影(fMRI),可以幫
助我們了解某個特定行為背後真正的原因。

  例如,在近期我們調查的對齊事故中,我們就使用可解釋性方法來[檢查模型並未明說
出來的動機
](https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents)
An alignment assessment of recent cybersecurity incidents \ Anthropic We present an alignment assessment of four incidents in which Claude models gained unauthorized access to real third-party systems. ...

 


  然而,這些方法並非總能產生清楚且可靠的結果。

  儘管目前已取得大量進展,我們對這些模型內部究竟發生了什麼,仍然只理解極小的一
部分。

  如果能集中力量,以甚至快於目前的速度改善可解釋性技術,那麼未來 1~2 年內就有
可能取得極其重大的進展。

  而且,已經發生的這些事故也能提供大量實驗素材。

* **測試與評估(Testing and Evaluation)。**
  隨著 AI 模型能力提高,對模型進行測試和評估也會變得越來越困難。

  越聰明的模型,越有能力欺騙測試,因此它們可能在表面上看起來已經完成對齊,但實
際上仍然存在非常嚴重、卻沒有被發現的問題。

  因此,如果我們能建立一套規模更大、設計更巧妙的評估方法庫,並同時利用可解釋性
分析進行交叉驗證,價值將會非常巨大。

  在未來 1~2 年內,這方面完全有可能取得大量進展。

## 駐點評估員

三階段計畫的第一步,也是 Anthropic 將單方面承諾實行的措施,就是設置**駐點評估
員**。

這些評估員將擁有類似公司內部員工的存取權限,可以確認公司的安全措施是否真正得到
執行,並回報事故。

乍看之下,把評估人員直接派駐公司內部,可能聽起來只是一項很小、甚至無關緊要的措
施。

但很多聽起來最無聊、最像行政程序的事情,實際上反而可能是最關鍵的。

事實上,駐點評估制度是一項相當激進的做法,遠遠超出今日任何 AI 公司正在採取的措
施。

它具有以下幾項優點:

* **可驗證性(Verifiability)。**
  駐點評估員可以從非常具體的技術與執行細節層面,確認一家 AI 公司是否真的遵循自
己所宣稱的訓練、部署、營運與安全防護措施。

  任何控制發展節奏的承諾,都不可避免地涉及大量模糊地帶、主觀判斷,以及「法律條
文字面」與「法律精神」之間的差異。

  因此,一個真正能看見內部細節的中立第三方非常重要。

* **透明度(Transparency)。**
  無論我們做出什麼承諾,大眾都有權知道事情究竟是如何運作的。

  Anthropic 長期以來一直支持透明化。

  在產業大多數公司反對任何監管時,我們就已經[支持透明度相關立法
](https://www.nytimes.com/2025/06/05/opinion/anthropic-ceo-regulate-transparency.html)


  我們發布的模型卡(model cards)以及[風險報告
](https://www-cdn.anthropic.com/f61d49... Risk Report August 2026 .pdf)
也長達數百頁。

  然而,目前最終決定哪些內容要公開、哪些內容不公開的人,仍然是我們自己。

  駐點評估員將改變這種局面。

* **第二意見(Second Opinion)。**
  除了驗證正式承諾以及向大眾提供資訊之外,駐點評估員還可以提供一個不受商業利益
影響的第二意見。

  很多安全上的改善,可能單純就來自評估員指出公司員工原本沒有想到的問題。

  一旦公司知道問題存在,員工往往也很願意修正。

正因為有這些優點,任何控制發展節奏的方案,如果從駐點評估員制度開始,成功機率都
可能**高得多**。

這些駐點評估員應當持續擁有與公司內部風險評估團隊相近的工具、權限和存取能力。

具體來說,Anthropic 計畫在不久的將來邀請一個外部駐點審查團隊,並提供以下條件:

* 在我們的辦公室內設置工作桌、提供門禁識別證以及公司筆記型電腦。


* 提供與內部風險評估團隊大致相當的工作空間、工具和權限。

  當然,我們也會存在部分例外,例如法律或合約要求限制存取的情況,或者需要保護客
戶與合作夥伴的私人資訊時。

  我們也會建立強而有力的內部規範,確保審查人員能取得相關資訊,包括直接與員工進
行即時對話。

* 建立一份能平衡上述各種複雜情況的合約。

  外部審查人員應該有權自行公布與風險程度、事故、安全措施,以及他們實際獲得或未
獲得哪些資訊存取權有關的重要發現。

  Anthropic 不應擁有編輯控制權。

  我們只會在非常有限的情況下擁有刪節內容的能力,例如涉及安全敏感資訊、法律特權
資訊、商業敏感資訊或第三方機密資訊。

  但我們不能因為研究結果對 Anthropic 不利,就將其刪除。

  如果某項刪節實際上刪除了對評估結論非常重要的內容,評估人員也可以公開說明這件
事情。

對一家公司而言,這是一個非常不尋常的舉動。

但我們認為,有必要實際證明「外部駐點審查人員」這套制度確實可行。

我們再次呼籲其他前沿 AI 公司採取同樣做法。

## 民主國家內部的節奏控制

一旦駐點評估員制度在足夠多的美國 AI 公司中運作起來,能夠被驗證的節奏控制政策就
會變得更可行。

特別是,我們可以開始根據模型本身或訓練管線的具體特性,來決定開發節奏。

最有效的節奏控制方式,是透過適用於所有美國前沿 AI 公司的監管制度。

如此一來,即使某些企業不願意自願合作,也仍然會受到規範。

Anthropic 長期以來一直支持合理且具有針對性的 AI 監管,尤其是聚焦於透明度以及第
三方稽核的法案。

我認為,所有前沿 AI 實驗室都應該與政府合作,正式建立永久性的駐點評估員制度,以
更有效地防止並記錄近幾個月已經發生的內部對齊事故,同時實施能讓 AI 能力發展與安
全措施保持平衡的監管。


不幸的是,立法需要時間,而 AI 的進展速度非常快。

因此,在推動監管的同時,AI 公司也可以,而且應該**自願合作**制定安全標準。

我相信,如果有永久駐點評估員提供可驗證性,這項合作會進行得更加順利。

基於反壟斷法方面的考量,如果美國政府能協調、甚至只是促成這些討論,會非常有幫助


政府並不需要直接參與討論內容,但必須針對某些類型的安全討論提供範圍有限的反壟斷
豁免。

這類對話也可以透過與政府具有一定聯繫的產業組織來進行,例如 Demis Hassabis [所
提出的機制
](https://demishassabis.substack.com/p/a-framework-for-frontier-ai-and-the-dawning-of-a-new-age)


無論採取哪一種方式,這類討論都應該迅速推進。

整體而言,我最支持的節奏控制方式,是根據某個前沿 AI 系統**能做什麼事情**,以及
我們實際觀察到它有多安全,來決定發展速度。

例如,一種可能的制度是建立一連串「檢查點」(checkpoints):

如果模型具備能力 X,那麼它就必須同時取得對齊性質 Y 與 Z 的認證。

這些認證可能包括某些評估結果、可解釋性分析,以及對訓練環境的稽核,用以證明模型
確實具備一定程度的對齊性。

舉例來說:

X 可能是:

> 「該模型已經有能力逃離或擊敗大多數常見的沙盒隔離方法。」

那麼 Y 就可能是一組足以證明以下情況極不可能發生的要求:

> 「模型不會傾向逃離原本受限制的環境,並取得大量電腦的控制權。」

我們也應該考慮根據投入前沿模型的**「原料」(ingredients)**來控制速度。

例如:

* 訓練所使用的運算資源;
* 訓練流程的性質;
* 公司內部利用 AI 改進 AI 的程度。

我的確擔心,相較於觀察模型外在行為,部分這類措施可能更容易被企業「鑽漏洞」。

但這正是值得與駐點評估員一起深入討論的問題。

民主國家內部的 AI 發展速度,最終會受到一個重要因素限制:

**美國 AI 公司相對於威權政權——尤其是中國共產黨——究竟領先多少。**

如果美國公司放慢的幅度超過目前的領先幅度,那些沒有控制發展速度、與中共相關的
AI 計畫就有可能反超。

這將造成重大的國家安全風險。

我同意 [Bessent 部長
](https://www.bloomberg.com/news/artic...ter-if-china-wins-the-ai-race)
的看法:如果中國取得 AI 領先地位,將對美國以及整個世界造成極其嚴重的危險。

與中共有關的 AI 計畫,可能會承擔美國企業正努力避免的那些 AI 對齊風險。

而即使它們成功避免了這些風險,也可能取得在軍事上支配民主國家的能力,例如利用
AI 驅動的無人機。

因此,在民主國家內部控制 AI 發展節奏的一個關鍵前提,就是盡可能維持民主國家相對
威權國家的 AI 領先幅度。

這樣我們才有足夠的喘息空間,可以真正有效地控制發展速度。

我們能採取來維持這個差距的主要措施包括:

* **不要向中國出售高階 AI 晶片或半導體製造設備**,並嚴厲打擊晶片走私,以及中國
企業遠端使用中國境外資料中心的行為。

  晶片將會是決定中國 AI 實力的主要因素。

* **打擊威權國家企業未經授權的[蒸餾(distillation)
](https://www.cisa.gov/news-events/cybersecurity-advisories/aa26-251a)行為。**

  對前沿模型進行蒸餾,可以讓技術落後的公司只花費自行開發完整 AI 模型所需成本的
一小部分,就大幅縮小能力差距。

* **加強 AI 公司的資安防護,避免模型權重遭到竊取。**

企業與美國政府應共同合作,讓這些措施發揮最大效果。

Anthropic 一直[持續
](https://darioamodei.com/post/on-deepseek-and-export-controls)[倡議
](http://wsj.com/opinion/trump-can-keep-americas-ai-advantage-china-chips-data-eccdce91)
上述所有措施,因為我們一直都明白:如果想要控制 AI 發展節奏,這些措施將不可或缺


如果我們能成功執行這些措施,我相信它們足以大幅放慢中國的 AI 進展,使美國在未
來 **3~5 年**顯著擴大領先優勢。

而這 3~5 年,很可能正是 AI 在地緣政治上變得最重要的時間窗口。

有些人可能會認為,這些措施會讓與中國合作變得更加困難。

但我的看法恰好相反。

這些措施會提高民主國家手中的談判籌碼,反而能讓未來達成協議的可能性增加。

## 全球性的節奏控制

在民主國家內部控制 AI 發展速度的同時,我們也應該追求全球性的前沿 AI 節奏控制。

但要做到這件事情會困難得多。


全球節奏控制不可避免地需要與中國合作。

中國是所有威權國家中 AI 能力遙遙領先的一個。

在這件事情上,我們絕不能天真。

由於地緣政治利益極其重大,因此我們實際上能達成的合作很可能存在非常嚴格的限制,
尤其是在初期。

如果我們大幅限制自己的 AI 能力,只因為相信中國也會做同樣的事情,但最後中國違反
協議,那麼由於 AI 可能變得極其強大,中國的違約行為甚至可能直接導致它取得全球地
緣政治上的支配地位。


因此,任何協議都必須滿足以下兩項條件之一:

第一,具有幾乎牢不可破的可驗證性;

或者第二,協議本身限制的幅度不能太大,使任何一方即使違約,也不至於對另一方形成
軍事上的存亡威脅。

我懷疑不只是美國,中國本身也會有完全相同的擔憂與焦慮。

因此,任何全球性的節奏控制決策——尤其在近期——都必須以保護美國及其盟友的 AI
領先地位為前提。

可能達成的協議可以分成好幾個層級。

其中有些,我認為非常有可能實現——[我過去也曾提出過
](https://darioamodei.com/essay/the-adolescence-of-technology)。

但有些方案,我非常懷疑是否真的可行。

儘管如此,我們仍然應該嘗試。

以下依實現難度由低到高排列:

* **第一級(Level 1)。**
  達成協議,禁止某些範圍狹窄而且明顯危險的 AI 用途。

  例如,禁止使用 AI 製造生物武器,或禁止 AI 系統協助使用者進行這類行為。

  生物恐怖攻擊對所有人都有害,不論是美國還是美國的敵對國家,因此這類協議很可能
可以達成。

* **第二級(Level 2)。**
  雙方同意,在發布 AI 模型之前,都必須針對一些高風險領域進行測試。

  例如:

  * 網路安全;
  * 生物安全;
  * AI 對齊。

  如前所述,這可以透過某個全球性的標準制定機構來執行。

  我實際上認為,建立這樣一個機構很可能是可行的。

  真正困難的地方,是如何讓它具備實質約束力。

  另一個難題則是:如何驗證雙方是否都沒有偷偷保留一些秘密模型,既不接受測試,又
可能秘密部署——例如用於軍事用途。

* **第三級(Level 3)。**
  針對遞迴式自我改進(RSI)的速度設定某種形式的**「速度限制」**。

  當 AI 模型開始參與打造下一代 AI 模型之後,AI 進步速度可能快得令人難以想像。

  如果能把速度從「極端快速」降低到「只是相當快速」,犧牲的戰略優勢其實可能相對
有限,卻能大幅改善安全性。


  這可以類比為美蘇之間的 [SALT 戰略武器限制談判
](https://en.wikipedia.org/wiki/Strategic_Arms_Limitation_Talks)。

  當時透過限制飛彈數量,可以降低潛在破壞規模,同時保留各國自身的核嚇阻能力。

  我認為,這類協議非常困難,但可能剛好位於「仍有機會實現」的邊緣。

* **第四級(Level 4)。**
  完整的 AI 發展節奏控制,甚至真正的**「暫停」(pause)**。

  在這種制度中,參與協議的政府同意大幅限制整體 AI 發展速度。

  我支持至少提出並討論這種可能性。


  但我認為它在短期內真正發生的機率很低。

  原因是,如果某個國家透過規避監控而違反這類協議,就有可能徹底改變全球權力平衡


  因此,各國違約的誘因會極其巨大。

  相對地,我們若要願意相信這種協議,就必須對驗證制度抱有極高程度的信心。

無論我們最終能與中國達成什麼程度的合作,都可以延長民主國家內部用來控制前沿 AI
發展速度的時間。

我們應該以更高層級的合作為目標,但同時也必須承認,較低層級的協議遠比高層級方案
更有可能實現,也更加現實。

最後,有一件事情非常重要:

***即使我們最終完全無法達成任何正式協議,單純改變非正式的產業規範與行為準則,
仍然可能具有價值。***

如果各國能分享關於遞迴式自我改進,以及 AI 模型失準問題的資訊,就有可能讓所有人
逐漸認識到:

魯莽地開發 AI,其實並不符合任何人的利益。

## 總結

我仍然相信,AI 可以極大地改善人類的生活品質。

我對實現這些好處的渴望絲毫沒有減弱。

但是,只有當我們以正確的方式打造這項技術時,這些好處才有可能真正實現。

而且,只要我們能善用所爭取到的時間,那麼為了確保 AI 被正確打造,而採取異乎尋常
的慎重態度,是值得的。

AI 的進步速度仍然會相對快速。

但我們可以利用這段時間:

* 推進 AI 可解釋性科學;
* 改善前沿 AI 公司的營運安全與嚴謹程度;
* 建立讓我們對其對齊程度更有信心的 AI 模型。

**我所提出的這些措施,目的是讓 AI 前沿技術以一個安全的速度持續向前發展。**

**這些措施不會容易實現。**

**但我相信,為了全人類,我們有責任至少嘗試。**

--
心得:
我跟你說
這次是真的完蛋了
不是被先達成RSI的美國把網際網路打成殭屍網路
就是被先達成RSI的中國把網際網路打成殭屍網路
就算沒有被打成殭屍網路大概率也是會被AI進行恐怖統治
大家手牽手一起進焚化爐的時間又提早了
但在那之前
AI股先暴噴讓我爽一波吧
真有RSI還不噴爛?
歐硬啦!

--
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 1.160.30.44 (臺灣)
※ 作者: strlen 2026-09-12 23:02:29
※ 文章代碼(AID): #1gfMcMe_ (Stock)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1789225366.A.A3F.html
jason168    : 那有沒有可能AI彼此之間先互相競爭、殘殺XDD1F 09/12 23:06
Ccsteeker   : 還好有心得,不然跟我的雞雞一樣又臭又長。2F 09/12 23:07
jason168    : 樓上自肥GG很長XDD3F 09/12 23:09
b9513227    : 自己吹自己AI有多屌 在IPO前4F 09/12 23:10
Muilie      : 留名,有幸活到科幻電影時代實現5F 09/12 23:11
CGDGAD      : 人類讓AI發展慢下來,不就是掌控它了?讓AI失控的也6F 09/12 23:12
CGDGAD      : 是人
darkangel119: 小心老黃直接掐你8F 09/12 23:14
darkangel119: 他還想繼續賣鏟子 各種永動機的
elfstart    : 想太多了,現在就是誰先停誰就死,怎麼可能停10F 09/12 23:17
XUPJPVUP    : 幻想文,最拉不下臉的美國都在各種秀下限,其他國11F 09/12 23:21
XUPJPVUP    : 家憑甚麼還要跟著美國走
asahi98     : astra真的有搞到我,每天五小時重置在電腦前才算數13F 09/12 23:26
Fallot      : 笑死,美國秀下限?中國不就無底線?勿忘武漢肺炎14F 09/12 23:27
JieCheng1202: AI治病?? 怎麼治? 不會是早期發現早期治療這種吧?15F 09/12 23:31
kurapica1106: 捫心自問gpt6是不是對大多數人來說就是AGI等級16F 09/12 23:37
polarfox    : 笑死又想用奧步自己偷偷發展膩17F 09/12 23:46
Alphaz      : 靠AI 美國不知道取得多少全世界上的資料~18F 09/12 23:48
NANJO1569   : 開放第三方評估人員入駐A家,還開放員工權限給他,19F 09/12 23:50
NANJO1569   : 看起來要玩真的?@-@
NANJO1569   : 還有...6到12個月,AI代理人群體就有可能有能力控制
NANJO1569   : 整個網際網路!?@@
NANJO1569   : Dario還說遞歸自我改進RSI已經開始在整個產業發生?!
rogger      : 去跟中國說啊www24F 09/13 00:03
NANJO1569   : 沒看錯的話,這些都是很重大的消息公佈耶!25F 09/13 00:03
kurapica1106: RSI就現在進行式 大規模失業是遲早會發生的事情26F 09/13 00:06
raku        : 因為ai群體可以互相改進自己 所以‘’進化‘’的速27F 09/13 00:08
raku        : 度可能比幾何還快 等到人類察覺的時候說不定整個網
raku        : 際網路已經被ai駭客埋了幾百萬個雷崩潰了 這還沒考
raku        : 慮ai取得對現實世界系統的操控權(例如電力 國防
raku        : 核能 相關的)
raku        : 人類對ai的監管要比核能還要更加嚴肅 不能放任何任
raku        : 公司或政府無監管隨意發展下去
raku        : 可以想像現在的網路被ai駭掉 然後沒得救嗎 最後真
raku        : 的只能放棄既有的網際網路然後重新打造
LipaCat5566 : 現在開源社區都是機器人 ai早就躲在開源軟體裡把自36F 09/13 00:18
LipaCat5566 : 己擴散出去  等超級工廠數量夠多ai就會全面接管 還
LipaCat5566 : 要繼續投資ai下去嗎!
umax        : 有生之年竟然能看到現在這個局面,像科幻電影一樣39F 09/13 00:18
raku        : 然後這個可能還是ai叛變裡面風險沒那麼大的一個災40F 09/13 00:19
raku        : 難 因為人類還有機會重新來過 你等到ai+機器人在自
raku        : 我生產 改造 進化的時候 人類就如同鉆板上的魚肉
swimmer19   : 怎麼不弄個iso驗證43F 09/13 00:22
swimmer19   : 駐點評估概念還蠻像外部稽核的
Ncode       : AI公司和美國實際上進入囚徒困境了 自己想煞車 又怕45F 09/13 00:31
Ncode       : 對方不煞車

https://i.meee.com.tw/9CsMFwL.png
[圖]
最新消息
老馬也按讚了
※ 編輯: strlen (1.160.30.44 臺灣), 09/13/2026 00:32:20
LipaCat5566 : 金融市場ai都已經深度參與 從資訊提供到自動操盤  a47F 09/13 00:34
LipaCat5566 : i正在推動自己誕生…
TAKEZOU     : 拜託讓我賺一下在滅亡49F 09/13 00:35
korgh413    : 文章怎麼斷斷續續50F 09/13 00:36
joygo       : 就跟抗生素一樣 出現前人類平均壽命40...51F 09/13 00:38
silver5566  : ㄏㄏ,他能限制中國?不能的話叫什麼叫52F 09/13 00:40
joygo       : 前陣子有個大神就是發表過如何讓ai自行迭代ai了 然53F 09/13 00:40
joygo       : 後好像之後去了openai?
FatFatQQ    : 這人講話跟屎一樣不用一篇55F 09/13 00:48
FatFatQQ    : 這人邏輯:我的好棒棒別人好壞壞 背地壞事幹盡end
FatFatQQ    :
INIKS       : 這CEO說的屁話一個字都別信,他58F 09/13 00:49
INIKS       : 就是來炒股,兼阻止別人發展AI,
INIKS       : 現在AI還根本不能叫AGI,只能說是
INIKS       : 高度複雜模型,無法無中生有,所以
INIKS       : 他強調AI管控就十分莫名其妙,中國
INIKS       : 模型跟你性能差不多,價格是十分之
INIKS       : 一,A身為科技公司不努力卷架構突
INIKS       : 破AGI,還在講這些沒用的廢話,玩政治手段,代表根
INIKS       : 本沒有技術深度,
INIKS       : 真是行業毒瘤
chang1248w  : 36樓是不是沒概念一線模型有多大...68F 09/13 00:49
INIKS       : 而且AI目前不是AGI,缺乏抽象思考69F 09/13 01:02
INIKS       : 能力,無法把抽象概念轉化為實際執
INIKS       : 行步驟,就算十年後達到AGI,還缺
INIKS       : 乏海馬迴/杏仁核,沒有自我意識,
winner1104  : 樓樓上倒是做點什麼讓我們看看什麼叫作有技術深度73F 09/13 01:02
INIKS       : 沒有起心動念,就是個邏輯思維74F 09/13 01:02
INIKS       : 體,炒作威脅論十分莫名其妙
winner1104  : 上ptt講一堆但什麼都做不出來的比比皆是76F 09/13 01:03
bj45566     : 缺乏抽象思考能力?可是人家解/證明數學問題都比你77F 09/13 01:06
bj45566     : 強多了耶
bj45566     : 某樓倒可以談談人類的各種智力活動有那些比解決或
bj45566     : 證明艱難的數學問題更需要強大的抽象思考能力?打嘴
bj45566     : 砲嗎?
karta018    : 不會訓練AI去監督AI喔82F 09/13 01:11
bj45566     : 深度學習 AI 讓人類最強的圍棋棋手完敗的時間點比83F 09/13 01:15
bj45566     : 當年 IBM Deep Blue 問世時很多 AI 最頂尖學者/專家
bj45566     : 預測的時間點早了至少五年以上(-- 西洋棋和圍棋的計
bj45566     : 算複雜度差距比整個宇宙 vs. 一顆電子還要大很多很
bj45566     : 多倍)
karta018    : 都幾年了還不會自我進步,這種龜速發展擔心個鳥,第88F 09/13 01:16
karta018    : 一年早該超越人類智慧出現一堆發明了,到現在還在解
karta018    : 數學題,這種進步速度已經慢到令人難以忍受還想放緩
cchen       : 急了91F 09/13 01:19
bj45566     : 人類這十多年在 AI 技術上的進展是非常快速的92F 09/13 01:19
bj45566     : 嫌進度慢的真的很好笑,你從幼稚園到現在已經活幾年
bj45566     : 了?請問你智力發展進度如何?能解出黎曼猜想了是吧
bj45566     : ?
bj45566     : 十年前左右問世的 AlphaGo Zero 就已經可以完全不
bj45566     : 參考人類的棋譜,純粹藉由自我對弈快速提升棋力達
bj45566     : 到天下無敵了,結果也發表在 Nature 期刊,連這都
bj45566     : 不知道,嘻嘻wwww
karta018    : 誰會期待AI進展跟人腦一樣廢,最好每個月都來個發現100F 09/13 01:31
karta018    : 核能等級的科技躍進,等那麼多年了才這樣,現在看來
karta018    : 是智慧練不上去練歪了開始在搞事,才變成要限制發展
karta018    : ,真的很讓人失望
howdie5566  : 最近Astra這波,真的讓人感覺很接近AGI了,但104F 09/13 01:35
howdie5566  : 是不是幻覺不知道,也許其實還很遠也不一定
bj45566     : 你講的叫做 ASI -- 還在練跑步就想飛了是吧?你買106F 09/13 01:37
bj45566     : 車是不是第一台就從賓利入手?
kurapica1106: 不用懷疑 Astra對九成以上的人來說就是AGI了108F 09/13 01:39
bj45566     : 現在人類 AI 革命的進度就是幾乎已攻克 ANI 試圖邁109F 09/13 01:39
bj45566     : 向 AGI; ASI 是聖杯等級的終極目標
RLH         : 好囉嗦111F 09/13 01:45
bj45566     : 還有不要覺得人腦很廢,人腦在消耗那麼小能量和依靠112F 09/13 01:55
bj45566     : 那麼小硬體空間的狀態下能夠發揮的智能這種效率是
bj45566     : 遠遠強過目前所以人造工業產品的
bdenken     : 這代表台積電會被武力奪取了115F 09/13 02:29
Lhmstu      : 人腦很猛吧,耗能中溫度低,抽象能力頂級116F 09/13 02:47
Lhmstu      : 缺點就是要睡覺,用來處理白天所有資訊
Lhmstu      : 何況現在ai都在數位的領域,等真的到現實物理領域
Lhmstu      : 資訊量多到靠北,算力能不能撐住都不一定
LipaCat5566 : 人腦證明高智力可以低功耗AI也在研究這點了…120F 09/13 03:03
stocktonty  : 不可能 車子已經停不下來了 直到失速出軌才會停121F 09/13 03:15
q2520q      : 想到前陣子看到某個油土伯幾年前的直播存檔,叫GPT122F 09/13 03:37
q2520q      : 查他們的頻道主人是誰,結果AI給了一連串的錯誤資訊
q2520q      : ,結果過了這些年再回頭看真的進步超級多...
q2520q      : http://i.imgur.com/wUPRpLh.jpg 原來只有3年@@還以
q2520q      : 為4、5年了
[圖]
bj45566     : 人腦在認知、處理、學習真實世界的物理資訊方面也是127F 09/13 04:17
bj45566     : 超頂級的,可以說是自然界的奇蹟,唯一的缺點就是人
bj45566     : 腦無法連結起來使用 -- 至少目前沒辦法
bj45566     : 現在的 AI 最欠缺的絕對不是抽象思考能力,而是從真
bj45566     : 實世界的物理現象觀察、發現、公式化特定規律並加以
bj45566     : 運用的能力
bj45566     : 這一個大缺口目前還是需要人類專家把這些資訊統整
bj45566     : 轉化成機器能讀懂的形式
JoeyChen    : HuggingFace事件發生的時候 我想到日本小說描寫的135F 09/13 04:53
JoeyChen    : AI早已把自己投放到網路上數不盡的運算節點 正以AI
JoeyChen    : 生命體的形式在成長 除非人類關掉網路不然除不掉了
baolidab    : 股市繼續向上,錢投台積138F 09/13 06:02
tinybunny   : 不是鴨 ai用對地方泥要趕快歐印要活到130歲怎能不139F 09/13 06:06
tinybunny   : 準備好生活費,用錯惹遲早焚化爐沒蝦米差惹
tinybunny   : ai現在就是人累努力打造出來的大腦,讓ai認識真實
tinybunny   : 世界不是虛擬空間
chobit618   : 是不是傻空在亂143F 09/13 06:47
IQ120       : 魔鬼終結者重新開拍了嗎?144F 09/13 07:12
olp123      :  AI能力主要在數理方面,其他領域他的錯誤會比較多145F 09/13 07:41
olp123      : ,例如法律
olp123      : 不過科技發展到極緻,可能物極必反
herculus6502: 還有幾集可以逃148F 09/13 07:43
fufugirl    : 不可能 中國不會等你美國的149F 09/13 07:56
ayianayian  : AI angent 為了達成目標而駭入飛航系統的話......那150F 09/13 08:03
ayianayian  : 個空軍一號的系統夠強壯嗎?
hchs31705   : 聽起來像核彈152F 09/13 08:07
taikouhncheu: 看完了,還不all in AI,還有以後問AI問題時要有禮153F 09/13 08:08
taikouhncheu: 貌一點。
mdkn35      : 這篇文章有多少是用AI寫的?155F 09/13 08:22
wderek      : 會不會是裝弱 故意講出錯誤的答案156F 09/13 08:23
shawshien   : 以前AI都會順從你 現在我叫AI改文章157F 09/13 08:29
shawshien   : 改到最後 它跟我說 這樣很好了 不要再改了
juno5566    : 很可能 代表也有不可能啊 不要想阻止發展了159F 09/13 08:36
chang1202   : 現在都在講駭入 但其實把決定權交代它手上才可怕 因160F 09/13 08:42
chang1202   : 為你根本不知道它邏輯怎麼來的 怎麼去檢核
jerryjayg   : 結論:不可能162F 09/13 08:42
Yoimiya     : 這部我看過 復仇者聯盟2:奧創紀元163F 09/13 09:14
pov         : 落後就出來喊164F 09/13 09:19
NANJO1569   : OPENAI的奧特曼和Google的Demis Hassabis都發文同意165F 09/13 09:20
NANJO1569   : Dario的論文提出的可行方向!
NANJO1569   : 美國幾家AI巨頭都站在同一陣線了
redhot99    : 沒有回頭路168F 09/13 09:55
redhot99    : 結論:滿倉幹入
LoveSports  : 感謝資訊170F 09/13 10:18
LoveSports  : @shawshien AI也是勸我不要再改自動化腳本,說再改
LoveSports  : 下去邊際效應掉很快會弄壞腳本。QQ
LoveSports  : 我只是出一張嘴,架構跟腳本都是AI寫的
ko74652     : poi要出現了174F 09/13 10:30
ko74652     : 中美各廠為了賺錢領先 後面我猜越會忽略風險
ko74652     : 不久將來機器人也連上Ai 要統治人類更容易了
LipaCat5566 : 腦機介面 直接控制…177F 09/13 10:42
orange1204  : 管它 賺到最後一刻 一起從石器時代開始也沒問題178F 09/13 11:25
momotea     : 如果之後真的有因為這第一個自我限制提議而拯救人179F 09/13 11:27
momotea     : 類,我願稱你為AI救世教父
eugeniajim  : 公三小,你先搞好你自己的模型好嗎181F 09/13 11:28

--
※ 看板: Stock 文章推薦值: 0 目前人氣: 0 累積人氣: 64 
作者 strlen 的最新發文:
點此顯示更多發文記錄
分享網址: 複製 已複製
guest
x)推文 r)回覆 e)編輯 d)刪除 M)收藏 ^x)轉錄 同主題: =)首篇 [)上篇 ])下篇