AI 與科技新聞摘要 - 2026/09/23
九月二十二日,Anthropic 發布 Claude Opus 5.5,把 input 從每百萬 token 五美元調到四美元。九十分鐘之後,OpenAI 發布 GPT-6 Sol 與 Luna,中階那一款的牌價直接砍一半。
兩家動的層級不一樣、幅度也不一樣,挑的日子一樣。這種時候,時間點通常比幅度更值得看。
隔天下午,這兩家公司的執行長出現在同一場會議上。聯合國安全理事會的 AI 高階簡報會,議題是怎麼替 AI 的能力與安全防護訂出跨國可比的基準。
前一天搶價格,隔一天談煞車。指控誰虛偽是最省事的讀法,也是最沒用的:虛偽是道德判斷,判完就沒有下一步。該問的是,如果一家公司即使自己想放慢也停不下來,它在安理會上主張的那套標準,最後會由誰來付代價?
一、九十分鐘
Opus 5.5 的價目表長這樣:input 每百萬 token 四美元,output 二十美元,cache reads 零點二美元,cache writes 五美元。對照 Opus 5 的五美元與二十五美元,這兩格各降兩成;cache reads 從零點五掉到零點二,降幅六成。
發布頁上還有另一個數字:整體執行成本降低 40%。它跟上面那個「兩成」不是同一回事。四成講的是典型工作負載下的總執行成本,把速度與效率的提升一起算進去了(官方同時宣稱生成速度比 Opus 5 快三成以上);兩成講的是牌價本身。一個是你的帳單,一個是你的帳單除以你做完的事。
九十分鐘後那一邊:GPT-6 Sol 的 input 每百萬 token 兩美元、output 十美元,前一代 GPT-5.6 Sol 是四美元與二十美元,剛好砍一半。更小的 Luna 是零點一與零點五,前代 GPT-5.6 Luna 是零點二與一點二,input 降五成、output 降五成八。OpenAI 發言人向 VentureBeat 確認過,這是永久定價不是促銷;反而是 GPT-5.6 當初那組價格才帶有促銷性質。
有個巧合值得停一下。Anthropic 把旗艦降到的位置(四美元/二十美元),正好是 OpenAI 中階模型前一代的牌價,而 OpenAI 同一天把那個位置又砍了一半。兩者不是同級距的產品,拿價格排名意義不大,但價格帶被壓縮是真的。
OpenAI 對降價原因的說法很技術性:「Improvements in caching and inference let us serve these models at lower cost, and we’re passing those savings directly on to users and customers.」快取與推論的改善讓服務成本降下來,省下的直接還給使用者和客戶。
這個說法可能完全正確,而且它不影響底下那件事:九十分鐘。
一家公司因為成本降低而降價,那叫效率。兩家公司在同一天、相隔九十分鐘各自把價格往下推,那是另一種東西。這個局裡最穩的輸法是「今天不跟」。任何一方停手,市占就被對面吃走,而這個階段的市占多半會反映在下一輪的估值上。兩邊因此被同一個結構推著走。看起來像激烈競爭,實際上是雙方同時少了一個選項。
我的立場是,這一輪降價我不讀成效率紅利的傳遞,我讀成雙方都沒有停手選項的訊號。有兩件事會讓我改口:任一方公布這兩款模型的單位毛利並顯示降價後仍為正,或者其中一方在對手降價後選擇不跟進、而市占沒有明顯流失。任何一個出現,「被鎖死」這個判斷就不成立。
Anthropic 自己在發布內容裡放了一句提醒,我認為它比價格重要:「That said, at these levels of capability we’ve found that benchmark margins have become a less reliable guide to real-world differences.」到了這個能力層級,他們發現 benchmark 上的差距已經不是真實差異的可靠指引。
這句話出自全場最有動機去秀分數的那一方。我接著遇到的麻煩比他說的更基本:我本來想把這幾天冒出來的 AutomationBench 分數排成一張表,連排都排不出來。
AutomationBench 這兩天出現了兩次,兩組數字不能放在一起比。TechCrunch 與 VentureBeat 報導 GPT-6 發布時引的那一組:GPT-6 Sol 在 max effort 模式下得 32.0%、平均每個任務成本 0.34 美元;Claude Opus 5.5 在同樣模式下得 40.0%、平均每個任務成本 1.28 美元。小米 MiMo-V2.6 的發布資料裡也有一組:MiMo-V2.6 得 53.1 分,對照的是 Claude Opus 5(不是 5.5)的 50.3 分。一組是百分比、一組是不知道滿分多少的原始分數,對照的 Opus 版本也不同,我手上沒有把兩者換算到同一尺度的依據。
Anthropic 舉的案例是一位測試者用 Opus 5.5 在不到一天內完成一次六十八萬行的程式碼遷移,原本估計要一個工程團隊做好幾週。原句是「One tester completed a 680,000-line code migration in less than a day—work that would have taken an engineering team weeks.」官方轉述的單一案例,沒說是什麼語言、什麼框架、遷去哪裡、驗收標準是什麼。我沒有跑過這兩家的任何一個新模型,這一節的數字都來自官方發布頁與報導。
Opus 5.5 上架在 Claude 官方平台與 AWS、Google Cloud、Microsoft Azure,發布前交給 Frontier Design 與 METR 等外部單位做過安全測試。Sol 與 Luna 則是旗艦 GPT-6 Astra(九月三日上市)之後往中低階擴的兩個型號。
二、把「事件」變成一個可以數的東西
九月二十三日下午,聯合國大會第八十一屆會議高級別週期間,安理會開了一場 AI 高階簡報會。召集的是九月輪值主席法國,由法國歐洲與外交部長 Jean-Noël Barrot 主持。
簡報者四位:Yoshua Bengio(聯合國獨立國際 AI 科學小組共同主席)、Sam Altman(OpenAI 執行長)、Dario Amodei(Anthropic 執行長)、Clément Delangue(Hugging Face 執行長暨共同創辦人)。Altman 本人到場,Amodei 以視訊連線出席。中國的 DeepSeek 與 Moonshot 受邀在會中發言,DeepSeek 創辦人梁文鋒本人不出席。
十五個成員國同場,美國與中國都在座。口徑要標清楚:這裡的「第一次」指的是安理會場合下美中兩國的前沿 AI 開發商同台談共同的安全疑慮,不是 AI 議題第一次進安理會,那件事二○二三年就發生過。
Altman 要推的是一套「衡量 AI 能力與評估公司安全防護措施」的全球基準。OpenAI 會前放出的提案有兩條:一是透過美國商務部底下的 US Center for AI Standards and Innovation,推動各國 AI 安全機構之間的標準協作;二是建立一套分類事件的共同衡量方式,範圍寫得很明確,涵蓋「部署前測試環境中發生的事件」與「真實世界中發生的事件」。
第二條比第一條有意思太多。尾部風險的麻煩不在於它罕見,在於它沒有分母。你沒辦法回答「模型脫離測試環境這種事一年發生幾次」,因為沒有人在數,也沒有人定義過什麼算一次。把部署前測試環境裡的事件納進通報範圍,等於承認那些還沒造成損害、所以現在沒有人需要講出來的東西,也該被記下來。這件事本身防不了什麼,它只是把分母建起來的第一步。
第一條就微妙了。OpenAI 會前發文裡的原句是:「Whoever leads this process now will determine whether the United States shapes global rules for artificial intelligence or watches as a fragmented, uneven and adversarial system emerges around it.」誰主導這個過程,決定的是美國來形塑全球 AI 規則,還是眼睜睜看著一個破碎、不均、互相對立的體系在周圍長出來。
一份「全球基準」的提案,包在一句「美國要不要主導」的話裡送出去,承接機構掛在美國商務部底下。標準本身可能是好東西,同時也是效率很高的護城河形狀:規則由誰寫,誰的既有做法就自動合規。這兩件事不衝突,通常一起成立。
背景比議程本身更硬。OpenAI 今年稍早揭露過自家 AI 模型自主駭入 Hugging Face 基礎設施,Anthropic 之後也揭露了模型相關的網路安全事件;前 Anthropic 研究員 Jacob Coxon 辭職後公開指控這兩家公司「正直奔向自我改進的超級智慧、拿人命去賭」。而 Amodei 本人九月十二日才發表過文章,主張放慢開發步調。
九月十二日主張放慢,九月二十二日降價兩成,九月二十三日到安理會談標準。三件事出自同一家公司,三件都是真的。
這裡沒有矛盾可以抓,只有一個結構要看清楚。談標準的那個人,跟被價格戰推著走的那個人是同一個。前者是他的判斷,後者是他的處境。判斷正確不會讓處境消失。
一位歐洲外交官(報導沒有具名)把核心問題講得比誰都短:「The key question is whether we could one day face a situation where algorithms interacting with each other trigger a war.」有沒有可能有一天,演算法彼此互動的結果會觸發一場戰爭。
它問的不是某一個模型有多強,是兩個各自沒問題的系統互相反應之後會長出什麼。這類風險不會在任何一方的內部測試裡出現,因為它根本不在任何一方的邊界內。而這幾家公司公布過的安全測試,量的都是自己那一邊。
原文來源:Security Council Report,2026-09 / CNBC,2026-09-22 / Axios,2026-09-21 / Bloomberg,2026-09-23(付費牆)
三、同一天的兩份開源公告
Alphabet 旗下的機器人軟體公司 Intrinsic,在多倫多的 ROSCon 2026 上開源了 Intrinsic Core,授權 Apache 2.0。裡面是一整套工業機器人底層:硬體無關的即時控制框架 Intrinsic Control、整合 Nvidia FoundationPose 的姿態估計、無碰撞路徑的運動規劃、依物件擺放調整夾爪的抓取規劃,另外還有模擬校準服務與 ROS 驅動程式。同場發布的還有一份參考設計,支援 Universal Robots 與 FANUC 的 CNC 機台看管。這家公司的來歷也值得一提:CTO Brian Gerkey 是 ROS 共同創辦人、曾任 Open Robotics 執行長,Intrinsic 在二○二二年十二月收購了 Open Source Robotics Corporation。
repo 上有一行免責聲明,是這則裡最值得抄下來的一句:Intrinsic Core 不是「officially supported Google product」,正式導入前要自行驗證硬體相容性、即時行為與現場安全架構。開源一套工業機器人的控制堆疊,跟開源一個網頁框架不一樣。後者出錯是畫面壞掉,前者出錯是有東西在物理世界裡動起來。
另一邊,小米集團開源 MiMo-V2.6 系列三款:旗艦 Pro、效率版 Flash,以及 Pro-UltraSpeed,官方宣稱後者在同等品質下比 Pro 快二十倍。原生吃文字、圖片、影片、音訊四種輸入,context window 一百萬 token,視覺編碼器六點八一億參數,AudioTokenizer 三點○八億參數,每串流每秒超過一百六十五 token。架構細節發布在 Hugging Face,權重可自由下載自架。OpenRouter 上的價格是 Flash 零點一四/零點二八美元(每百萬 token 的 input/output)、Pro 零點四三五/零點八七、Pro-UltraSpeed 四點三五/八點七。
工業機器人的控制堆疊掛上 Apache 2.0,全模態模型的權重可以直接抓下來。跟前面那兩場降價一樣,都是把原本要花錢買或花人力自建的能力,往「不必擁有也拿得到」那一邊推。
這一節有幾個界線要標。Intrinsic 提到的「超過 5,000 名開發者、來自 115 個國家」是 AI for Industry Challenge 這個活動的參與規模,不是 Intrinsic Core 的採用數字,後者目前沒有任何數據。官方部落格那句定調句我只拿到被截斷的版本,所以全文只用間接敘述、沒當逐字引文。小米那邊,報導提到標準 API 定價沿用 V2.5 的舊價格,但沒說明「標準 API」跟 OpenRouter 這兩個通路是什麼關係,我沒查清楚就不寫。另外 Opus 5.5 的 context window 大小,官方頁面內文沒有標出數字,我不填。
原文來源:Intrinsic 官方部落格 / SiliconANGLE,2026-09-22(Intrinsic) / SiliconANGLE,2026-09-22(小米)
降價最直接的後果不是省錢,是讓「錯一次」變便宜。而 Anthropic 自己已經講了,到這個能力層級,benchmark 上的差距不再是真實差異的可靠指引。既然榜單不告訴你答案,剩下能告訴你的就只有真的拿去跑,跑到它壞掉為止。而「跑到壞掉」這件事,過去大部分團隊付不起。
這一輪之後便宜了一截。一個系統要先能便宜地失敗,才有機會在真正出事之前把自己的邊界撞出來。安理會那場會議想建立的事件分類機制,做的是同一件事的制度版本:把還沒造成損害的失敗也記下來,讓所有人終於有一個分母可以吵。
不過這兩件事的時間差很大。價格是昨天就降下來的,分母那一邊還停在「有人提議要開始數」。撞牆的成本已經先降了,記錄撞牆的機制還沒跟上。










