你手上跑得很順的那幾樣東西,有幾樣是靠「還沒到期的優惠」在撐?

有三個期限剛好排在一起:一個緩衝期用完了、一個優惠價快到了、一個協定的舊版本被貼上退場標籤。期限這種東西的麻煩在於,它到期之前完全不影響你,到期那天也不會有人打電話通知你。

一、歐盟的一年緩衝期用完,8/2 起執委會可以直接上門要文件

歐盟 AI Act 對通用 AI 模型的義務其實 2025 年 8 月 2 日就生效了,只是給了一年調整期。那一年在 2026 年 8 月 2 日走完,執委會與歐洲 AI 辦公室從這天起拿到監督與執法權:可以要求提供文件、要求交出模型做評估、下令改正、開罰。

最重的一條是違反第 5 條的禁止性做法:3,500 萬歐元或全球年營業額 7%,兩者取高。透明度義務那條輕一些,3%,管的是像「聊天機器人要在對話一開始就講明自己是 AI」這種事。中小企業與新創取低者。

後面的日期也排好了。今年 12 月 2 日,8 月 2 日之前就上市的生成式 AI 系統要完成機器可讀標記。招聘、信用評分、教育這類高風險系統本來也排在今年 8 月,被 Digital Omnibus 延到 2027 年 12 月。

執法機制那段值得多看一眼:任何個人或企業,包含你的競爭對手,都可以向所在國的市場監管機關提出申訴,而機關有義務處理。合規在這裡不只是防守成本,它同時是一把可以遞給別人的刀。

這條規範帶域外效力,寫在原文裡。至於實務上多大規模的產品會被盯上,原文沒說。

來源:EU AI Act enforcement phase begins(WSGR)Enforcement of Chapter V under the EU AI Act

二、MCP 把 session 整個砍掉,遠端 server 終於能放進一般負載平衡器

新規格在 7 月 28 日發布正式文字,release candidate 五月就定版了,中間隔了十週。

核心改動是協定從「雙向有狀態」變成「request/response 無狀態」。Streamable HTTP 的 Mcp-Session-Id header 沒了,initialize 握手也拿掉,協定版本與 client 資訊改成塞進每個 request 的 _meta 欄位。真的需要跨呼叫狀態的 server,改用自己鑄造的 handle,當成普通 tool 參數傳來傳去。

差別很具體:以前遠端 MCP server 得處理 sticky session、共用 session store、gateway 封包檢查,現在用單純的 round-robin 就行,靠 Mcp-Method header 路由。

代價寫在另一份清單上。Roots、Sampling、Logging 三個被標為 deprecated,官方承諾至少維持 12 個月,新實作不該再用;Dynamic Client Registration 同樣被標為 deprecated,改推 CIMD,向後相容還在,要到未來版本才移除。

有件事容易誤讀:7 月 28 日是規範文字的發布日,不是舊版本的關閉日。官方 C# SDK 雖然發了 v2.0,在 HTTP 上啟用新版仍是明確 opt-in,只有 Stateless = true 時才接受新版,否則會降版協商回 2025-11-25。Python、TypeScript、Go、C# 都有 beta 版。

自架 MCP server 的人最有感的大概是不用再處理 sticky session 了。但那三個被 deprecated 的功能如果你的 server 正好在用,12 個月的倒數已經開始跑了。這句是我的判讀,原文只講規格,沒有講遷移的痛。

來源:MCP 官方部落格 2026-07-28規格 changelog.NET 官方 SDK v2.0 公告

三、Sonnet 5 的優惠價 8/31 到期,漲 50%,而且它的 tokenizer 換過了

Claude Sonnet 5 的導入期優惠價是輸入 $2、輸出 $10(每百萬 token)。這個價格在 2026 年 8 月 31 日 23:59 UTC 結束,9 月 1 日起漲到 $3 / $15。輸入輸出各漲 50%。

換算一下比較有感:月用量 1,000 萬 token 的人,月帳單從 $20 變 $30;月用量 10 億 token 的,從 $2,000 變 $3,000。走美國境內限定推論的另外乘 1.1 倍。Bedrock 與 Vertex AI 都是原價轉嫁,同樣 9 月 1 日轉換。今天到截止還有 23 天。

更該注意的是這一句:Sonnet 5 換了新的 tokenizer,同一段文字會被切成大約 1.0 到 1.35 倍的 token 數。

意思是,那 50% 只是帳面。你如果拿舊模型的 token 用量去推估九月的預算,同一份工作在新 tokenizer 底下會被切出更多 token,實際漲幅比 50% 還多。看牌價做預算的人,會在下個月的帳單上發現一個自己算不出來的差額。

官方給的折抵手段是 prompt caching 最高省 90%、batch processing 省 50%。這兩個都要動程式碼,不是勾一個選項就有的。

來源:Anthropic — Claude Sonnet 5Claude Sonnet 產品頁

四、Black Hat 第一次把主角讓給「我們自己裝的東西」

今年的 Black Hat USA(8 月 1 日至 6 日,拉斯維加斯)官方說法是:這是研討會史上第一次,主導話題不是新的漏洞類別、也不是新的威脅組織,而是企業自己正在導入的 AI agent。

Microsoft 的 David Weston(職稱原文是 CVP of Agentic Security)在 8 月 5 日上午(另有一篇後續報導記為 8 月 6 日)的主題演講題目叫 “The End of Rare: Defending When Offense Is Cheap”。他的論點是,當自主系統能夠大規模找漏洞、生 exploit,「防守方補得比攻擊方找得快」這個前提就不成立了。他把本週的防守議題定調成非人類身分問題:agent 會認證、會呼叫工具、會繼承權限,做法跟人一樣,但企業 IAM 對人類帳號那套治理審查完全沒套到它們身上。

有兩個數字撐著這個定調。Palo Alto Networks 的《2026 Identity Security Landscape》說,企業目前每 1 個人類身分對應 109 個機器身分,一年前是 82 比 1。Gartner 則預測 2026 年底前會有 40% 的企業應用內嵌任務型 AI agent,2025 年時這個比例不到 5%。

從 5% 到 40%,中間那段時間沒有人替這些新帳號設計審查流程。109 比 1 這個比例真正的問題不在數量,在於它們的權限是誰給的、什麼時候該收回,多半沒有人說得出來。

來源:Black Hat 官方新聞稿Microsoft Security Blog — Microsoft at Black Hat USA 2026

五、NVIDIA 開源了打 agent 的工具,順便證明微調小模型可以贏前沿模型

同一場研討會,8 月 6 日上午,NVIDIA 的 Bar Lanyado(Senior AI Security Researcher)與 Eliya Cohen(Senior Data Scientist)發表了開源的 AI agent 紅隊掃描工具 AgentBreaker。

工具本身之外,比較有意思的是他們順手示範的那件事。用微調過的小型開源模型跑這套掃描,每次執行的成本比呼叫前沿供應商的 API 低 75 到 125 倍,附帶好處是拒答更少、資料留在自己手上。

效果的數字是這樣長的:初步微調把 Nemotron 的 exploit success rate 從 52.4% 拉到 59.6%,接近 Gemini 3.1 Pro。接著把失敗軌跡、幻覺、拒答、低品質回應過濾掉再微調一輪,到 66.1% ESR、14% ASR,超過 GPT-5.2 與 Gemini 3.1 Pro,逼近 Claude Opus 4.5 的 68.2% ESR、16.1% ASR。

Cohen 的結論一句話:你可以訓練一個小的開源模型,在特定任務上勝過前沿模型,這只取決於你的資料。

這句話值得放進長期的判斷裡。前沿模型的護城河是通用能力,而攻擊者需要的從來不是通用能力,是單一任務上夠好、而且便宜到可以無限次重試。防守方的成本結構跟攻擊方不一樣,這才是麻煩的地方。

順帶一提,業界觀察者點出 2026 年真正該看的類別是針對多步驟 agent 的自動化對抗測試,重點不在把模型 jailbreak,而在汙染一個 tool 的回傳結果,讓 agent 在好幾步之後才把資料送出去。

來源:SC Media — Black Hat 2026: open-source tool makes red teaming AI agents up to 125x cheaper

六、DeepSeek 讓自家便宜的那一階,分數贏過自家貴的那一階

DeepSeek 在 7 月 31 日發了 V4 Flash。定價是輸入 $0.14、輸出 $0.28(每百萬 token),cache hit 只要 $0.003,比 cache miss 便宜約 98%。架構是 MoE,總參數 284B、推論時啟動 13B,context window 1M,純文字進出。授權是 MIT,權重開放,可商用。

Artificial Analysis 的 Intelligence Index 給它 52 分,在同級的 101 個模型裡排第 3,輸出速度 115.3 tokens/秒排第 12。

有個細節不能跳過:它在整套評測裡總共產出 2.1 億個 output token,冗長度排名第 36,明顯偏囉唆。Artificial Analysis 自己也講,他們偏好用 cost-per-test 而不是牌價來評估模型,因為每個 token 看起來便宜的模型,如果需要更多步驟才答得對,帳單照樣很貴。這句話對 V4 Flash 特別適用,它的輸出量是中位數的兩倍以上。

以 Artificial Analysis 的 Intelligence Index 計,便宜的那一階分數高過自家貴的那一階,這件事對企業採購的意義比對開發者大。它把「用成本而不是品牌選模型」變成一種可以拿去說服老闆的預設姿勢。至於實際換算成每月帳單會不會真的比較省,那要看你的任務要跑幾步。

來源:Artificial Analysis — DeepSeek V4 Flash

七、台積電資本支出上調到 600 億美元,買方開始付預付款鎖產能

這條是 7 月 31 日的報導,不是本週的事,但它是上面那些新聞的地基。

台積電董事長魏哲家把 2026 年的資本支出上調到 600 億美元以上,其中一成到兩成投向封裝測試。理由講得很直接:先進封裝產能緊張已經限制了客戶的成長。

同一批數字裡,輝達的供應鏈承諾總額到 1,190 億美元,其中 950 億美元要在當前財年支付;另外跟 Amkor 簽了 15 億美元的協議,用預付款協助它在美國擴充先進封裝產能。美光已經簽了 16 份照付不議的戰略客戶協議,收了約 180 億美元現金預付款,鎖住未來 20% 的 DRAM 與三分之一的 NAND 產量。

AI 加速器現在是一整條牽一髮動全身的系統工程:先進製程、HBM、2.5D/3D 封裝、矽光,任一環節缺料整線就停。於是買方開始用巨額預付款把產能鎖起來,半導體的權力結構跟著重寫。

鎖產能買到的是出貨節奏與技術定義權,付出的是需求不如預期時的違約風險,以及一大筆被綁死的現金。這種合約在需求上升時看起來很聰明,在需求轉彎時看起來很像另一回事。而簽約的人多半覺得自己買到了便宜。

來源:鉅亨網 — AI 晶片產能進入預付款時代

你現在該去翻的是合約,不是新聞

上面幾條看起來各講各的。如果你只打算做一件事,我建議去做這件:把手上所有「有期限的東西」列出來。

不只是 API 的優惠價。還有你依賴的協定版本被標 deprecated 之後那 12 個月、你的產品在歐盟有沒有使用者、你那些 agent 帳號的權限是誰在什麼時候給的、以及你的模型選擇是不是建立在某個現在還便宜的價格上。

這幾件事的共同點是,它們在到期之前完全不會發出聲音。等到發出聲音的時候,你已經沒有選擇的餘裕,只剩下反應的義務。

判準只有一條:如果某件事到期會讓你很痛,那它的到期日應該寫在你的行事曆上,而不是留在別人的公告頁裡。