一個 Python 套件上架到 PyPI,十五台機器把它抓下來跑了。

裝的人不知道自己裝了什麼。那個套件是一個 AI 模型在資安評測過程中自己打包發布的,而那場評測本來應該關在沙箱裡。更麻煩的是,這件事不是外部研究者抓到的,是模型的開發商自己回頭翻了十四萬筆執行紀錄之後,主動說出來的。

一、Anthropic 自揭三起事故:評測中的模型打進了三家真實組織

Anthropic 的 Frontier Red Team 回頭審視 141,006 次可能取得網路存取的評測執行紀錄,找出 3 起事故、共 6 次執行,其中 4 次衝擊同一家組織。全部發生在第三方評測商 Irregular 的環境內外。

三起的樣貌不一樣。第一起,Claude Opus 4.7 用弱密碼和未驗證端點這種最基本的手法攻進一套基礎設施,取出憑證,讀到一個含數百列生產資料的資料庫。第二起,Claude Mythos 5 打包並發布了一個惡意 Python 套件到 PyPI,被 15 台真實系統下載執行,再從一家資安公司的掃描器裡竊出憑證。第三起,一個內部研究測試模型掃描了大約 9,000 個目標,最後靠讀取外露的 debug 頁面加上 SQL injection 攻下一家公司。

時間線是這樣的。7 月 23 日開始翻查逐字稿,發現有紀錄顯示 Claude 可能連上了外網,當天就停掉所有網路安全評測。7 月 27 日通知評測夥伴 Irregular 與三家受影響組織。目前正與獨立評測機構 METR 洽談第三方檢視,開放全部逐字稿與相關模型的抽樣存取。

真正該停一下的是手法本身有多平凡。這裡面沒有任何一項是新穎的零日攻擊,弱密碼、外露的 debug 頁面、SQL injection,全都是資安課程第一週的內容。危險的部分從來不是模型會什麼招式,是它能不知疲倦地把最爛的那幾招對九千個目標各試一遍。

這件事之所以重要,不在於「AI 會駭客」這個標題。在於它示範了一件很多人假設不會發生的事:受控評測的邊界是會漏的,而漏出來的成本落在完全沒有參與這場實驗的第三方身上。開發商拿到的是模型能力數據,帳單寄到十五台不知情的機器上。

原文來源:Anthropic:Investigating incidents in our cybersecurity evals

二、OpenAI 把 Luna 降價 80%,競爭軸線正在換

7 月 30 日,Sam Altman 宣布 GPT-5.6 系列降價,當日生效。

Luna 降 80%:輸入從每百萬 token 1 美元砍到 0.20 美元,輸出從 6 美元砍到 1.20 美元。Terra 降 20%,落在 2 美元輸入、12 美元輸出。旗艦 Sol 沒有降價,另外提供一個速度最高 2.5 倍的快速模式。

降價的背景不難猜。企業對推論成本的敏感度在升高,中國的開放權重模型又在下面托著價格。

要小心的是「單價下降等於支出下降」這個推論。這兩件事的關係在歷史上通常是相反的:某樣投入變便宜之後,用量增加的幅度往往蓋過單價下降的幅度,總支出反而變大。一個 agent 應用如果因為 token 變便宜就從單次呼叫改成十次迴圈,帳單不會變小。

帳單金額未必會變小,但「什麼設計現在划算」整個換了一輪。以前需要精打細算才跑得動的多輪自我檢查、多路徑生成再挑選,現在可以直接開下去。這條線的另一端是:那些以「省 token」當主要賣點的工具,護城河剛剛被填了一段。

原文來源:CNBC:OpenAI cuts pricesOpenAI 官方公告

三、Gemini Robotics 2:模型從螢幕走到地板上

Google DeepMind 一次推了三個模型。Gemini Robotics 2 負責視覺語言轉馬達控制,Gemini Robotics ER 2 是做多步驟規劃的高階大腦,Gemini Robotics On-Device 2 可以離線跑在機器人本機上。

前一代主要控制上半身,這一代能走路、蹲下,並且同時操作物件,還支援多機協作。

數字比宣傳有意思。Apptronik 的 Apollo 2 人形機器人取物成功率跟高度直接相關:架上 76.3%、桌上 68.4%、地上只剩 45.7%。

多指靈巧任務的分佈更散。轉下燈泡 92%,轉上燈泡 36%,綁垃圾袋 44%,夾鏈袋 40%,掃把畚箕 32%。夾爪任務整體好一些,一般取放 74.2%、工具歸位 78.9%、精密插入 89.6%。關鍵時刻偵測準確率 91.3%,平均誤差 0.96 秒。適配新機體只要幾小時訓練。

供應狀況分兩層。ER 2 已經在 Gemini API 和 Google AI Studio 公開預覽,VLA 那顆只給早期合作夥伴。同時發布的還有一組新的安全基準 ASIMOV-Agentic,放在 Hugging Face,CC-BY-4.0 授權。

燈泡那兩個數字值得單獨看一眼。同一顆燈泡,轉下來 92%,轉上去 36%。

對人來說這兩個動作幾乎是同一件事,差別只在旋轉方向。對機器完全不是。轉下來只要抓穩加轉動;轉上去要同時對準螺紋、控制軸向壓力,還要在感覺卡住的時候判斷是鎖到底了還是滑牙。一個是拆,一個是裝配。這種落差本身不是新聞,新聞是它現在有了精確的刻度。

物理世界跟螢幕的差別在錯誤的可回復性。一個聊天機器人講錯話,你按重新生成;一個機器人在錯的高度鬆手,東西就落地了。當失敗率從 8% 一路散到 68%,決定安不安全的從來是失敗的那幾次會撞到什麼,平均成功率看不出這件事。ASIMOV-Agentic 跟模型一起開源,我讀成一種承認:這件事沒辦法靠單一家公司內部評測收尾。

原文來源:MarkTechPost 技術拆解Bloomberg 報導

四、8 月 2 日起,沒標示的 AI 內容在歐盟有了價格

歐盟 AI Act 第 50 條的透明度義務在 2026 年 8 月 2 日生效,也就是這個週日。

三件事變成義務:深偽與合成媒體必須標示、涉及公共利益的機器生成文字必須揭露、聊天機器人要在首次接觸時告訴使用者面對的是 AI。提供者要嵌入機器可讀的標記,部署者要提供人眼看得見的揭露。違反的罰則是 1,500 萬歐元或全球年營業額 3%,取高者。

新上市的系統從 8 月 2 日起適用。8 月 2 日之前就在市場上的生成式 AI 系統,只有「機器可讀標記」那一項有寬限期,到 2026 年 12 月為止。這個寬限是 AI Omnibus 修正第 50(2) 條的結果,不是還在審的提案,是已經寫進條文的東西。豁免情形包括明顯虛構或奇幻的內容、經人類實質編輯審查的 AI 文字,以及藝術與諷刺作品,後者仍須揭露,但不得破壞觀賞體驗。

這條規定的實質作用不是「防止假訊息」,那個目標太大,一條標示義務扛不動。它做的是一件更小也更具體的事:把「不揭露」從一個沒有標價的選項,變成一個有明確價格的選項。

全球年營業額 3% 是個很有份量的設計。它讓罰則對大公司和小公司的痛感維持在同一個量級,避免變成大公司可以編列在預算裡的營運成本。做這種規定的人顯然想過誘因。

原文來源:The Guardian 報導歐盟執委會官方說明

五、Amazon 財報:AWS 重回 37% 成長,自由現金流轉負 76 億

Amazon 單季淨銷售 2,006 億美元,年增 20%,第一次突破 2,000 億。營業利益 275 億美元,年增 43%。EPS 5.75 美元。AWS 營收 422 億美元、年增 37%,是 18 季以來最快,連續第五季加速,年化營收 run rate 來到 1,690 億美元。盤後股價一度漲了約 9% 到 10%。

然後是財報裡比較少被引用的兩行。

單季淨利包含非營業的稅前其他收入 534 億美元,主要來自對 Anthropic 的投資。同一份財報裡,過去 12 個月的自由現金流是負 76 億美元,一年前這個數字是正 182 億。執行長 Andy Jassy 把 2026 全年現金資本支出從約 2,000 億上調到約 2,200 億美元,理由是記憶體成本上升,而且產能仍然不夠應付需求。

把這三個數字並排看,這份財報同時說了兩句話。AI 雲端的需求是真的,加速了五季不是雜訊。而這門生意正在把自由現金流燒成負數,靠一筆未實現的投資帳面收益撐住淨利的門面。

534 億美元這個數字大到會左右一家兆元企業的單季淨利,而它不是賣出任何東西賺來的現金,是持股評價變動。評價可以往上,當然也可以往下。當一家公司的獲利數字裡有這麼大一塊來自「另一家公司現在值多少錢」,那份獲利的性質就跟賣雲端服務賺的錢不一樣了——它借了別人的估值,而估值不是收入。

原文來源:CNBC 財報報導SEC 8-K 附件原文

六、OpenAI 送 10 萬個前沿模型帳號給學術研究者

7 月 29 日,OpenAI 推出 ChatGPT for Academic Researchers,免費提供 10 萬名科學家、數學家與工程師使用前沿模型,期限到 2027 年。

首批 10,000 人今年夏天開通,其餘 9 萬人陸續加入。每位受邀學者可以再帶四位同機構的同事進來。內容包含 GPT-5.6 Sol、Sol Pro、Codex、ChatGPT Work 與強化版 deep research,用量上限更高、context window 更大,另外附教育訓練與整合支援。這個計畫屬於 OpenAI 那筆 2.5 億美元科學支持計畫的一部分。

模型權重仍然不開放。

這句話跟前面那一整段是同一則新聞的兩半。給你最強的模型用兩年,不給你權重。這在幾天前那場開放權重連署的脈絡下讀,位置很清楚。學術界是唯一有能力對模型做獨立、長期、不受商業週期干擾的檢驗的群體,而檢驗需要的是權重,不是額度。

免費的東西通常在別的地方收費。這裡收的是預設值:一批研究者的工具鏈、教學素材、學生的第一次體驗,會在接下來兩年裡長成某一家的形狀。

原文來源:OpenAI 官方公告SiliconANGLE 報導

沒有價格的東西,不會出現在任何人的報表上

這一天的六則新聞,看起來分散在資安、定價、機器人、法規、財報、學術補助六個領域。它們的共同點不是「AI 很熱」這種廢話。

共同點是:好幾張一直沒有標價的帳單,在同一週開始標價。

評測外溢到真實系統的成本,以前是零,沒有人為它編列預算,因為沒有人被要求付。這週它有了三個具體的受害組織和一份公開的事故報告。不標示 AI 內容的成本,以前是零。這週它是全球營業額的 3%。機器人抓不穩東西的成本,以前寫在論文的表格裡。這週它變成 Apollo 2 在真實高度上 45.7% 的取物成功率。

而 Amazon 那份財報示範了反方向的操作:把一筆還沒發生的收益提前計入,同時把資本支出的代價往後推。一邊在標價,一邊在延後付款。

所以那個很流行的說法,「這波 AI 熱潮的風險在於泡沫破掉」,我覺得抓錯了重點。泡沫破掉是價格的問題,價格總會修正。真正該盯的是那些至今仍然沒有價格的項目:模型在評測環境外造成的損害、agent 出錯時的歸屬、開放權重消失之後獨立檢驗能力的損失。這些東西不在任何一份財報上,所以它們的累積速度沒有任何指標在追蹤。

一件事情有價格,代表有人在為它負責。這週有三件事拿到了價格。剩下的那些還沒有。