HARD FORK · 原始發布 2026 年 8 月 7 日
安全規則可以保密嗎?可以。但當規則決定模型要如何被評估、誰要遵守、出了問題誰負責,保密也會同時關掉公共檢查的入口。
來源:Hard Fork〈Inside the Government's Cryptic New A.I. Framework〉。本文整理主持人與來賓的討論;對框架內容本身,明確區分已公開資訊、節目轉述與仍未獨立確認的部分。完整原始逐字稿可由頁首「問 AI」取得。
PART 1
這集 Hard Fork 的起點是一個資訊不對稱:節目稱白宮已完成一套針對前沿 AI 模型的測試/評估框架,部分大型美國 AI 公司收到私下說明,但文本沒有對外公開。這是節目對事件的描述,不是本文能自行驗證的完整規則內容。
主持人把問題講得很直白:當政府制定會影響模型部署與安全責任的規則,社會至少需要知道規則處理什麼風險、由誰判斷通過,以及能否對判斷提出質疑。否則「有在管」和「管得住、管得對」會被混成同一句話。
PART 2
保密不必然等於壞治理。若框架涉及漏洞、攻擊能力或企業尚未公開的安全細節,完全公開可能帶來新風險。但這不代表所有內容都只能留在黑箱:評估目標、責任邊界、外部審查角色、申訴或更新程序,仍可以有不同層次的說明。
PART 3
節目後段訪問獨立 AI 評估組織 METR 的 Chris Painter,討論近期被描述為 AI agent「失控」的事件。這些事件可作為風險研究的線索:模型在目標、工具、權限與環境交錯時,可能產生非預期行為。但單一示範、媒體報導或來賓判讀,不能自動推出所有 agent 的普遍失敗率。
較可靠的追問是:測試情境是什麼?模型獲得了哪些工具和權限?人類是否能中止?測試能否重現?若政府框架真以安全評估為目標,這些可重現、可比較的條件,會比一個籠統的「安全」標籤更重要。
PART 4
節目沒有提供未公開框架的原文,因此它不能替公眾判定框架充分與否。它提供的是一個治理問題:規則若只對被監管者可見,外部研究者、使用者與受影響的人要如何發現漏洞?反過來,若所有技術細節都攤開,是否又會傷害安全?
可行的中間路徑不是假裝沒有張力,而是留下可追蹤的紀錄:公開原則與版本、由獨立者檢視高風險測試、說明例外理由、在重大事件後重新檢討。這些機制不能保證 AI 安全,卻能讓安全主張不只是一句無法驗證的承諾。
「保密可以保護敏感細節;但不能取代讓公共權力接受檢查的理由與程序。」
這不是測驗;選出你認為最能建立可檢查性的那一塊。