系列精選
查看全部工程師日誌
寫 Code 之外的生活觀察 — 理財、旅遊、健康、居住、時事評論
Elasticsearch 完整指南
從零開始學 Elasticsearch — 環境建置到生產環境優化
Claude Code 完整教學
從入門到進階 — Hooks、Sub-agents、MCP、Skills 開發全攻略
AZ-305 Azure 架構師認證
Azure 解決方案架構設計師五日課程筆記
Java / Spring 學習筆記
Java 核心語法、Stream API、併發控制、Spring Boot 實戰
AI Agent 架構全解析
從 harness 骨架拆解現代 AI Agent — 以 Claude Code 為例的 7 層架...
以前它自己衝去做,現在它學會等你喊:Claude Code 把技能改成手動觸發
你在改一段程式,改到一半,Claude 忽然自己開了個 code review,把你還沒寫完的東西整份掃過一遍,列出十幾條建議。問題是你根本還沒寫完,只是想先跑跑看對不對。它那十幾條建議有一半是在嫌你「還沒補上」的東西——你本來下一步就要補。這種好心幫倒忙,用過 Claude Code 一陣子的人大概都遇過。 從 v2.1.215(2026-07-19)開始,這個行為改掉了。/verify 和 /code-review 這兩個內建技能,不再由 Claude 自己判斷時機去跑,改成你明確打 /code-review 或 /verify 它才動手。看起來只是個小改動,背後其實是一個蠻重要的設計轉向:把「何時動手」的決定權,從模型手上收回來一點。 舊做法:一個太熱心的實習生先講清楚舊做法哪裡不對勁。技能(skill)本來的設計,是讓 Claude 自己讀你的意圖、判斷哪個技能派得上場,然後自動載入來用。這對「純查資料」型的技能很棒——你問一個 API 怎麼用,它自動翻出對應的參考技能,你完全不用管。 麻煩出在那些「會動手做事」的技能。/code-review 會花掉一整輪的 token...
AI 與科技新聞摘要 2026/07/22:當把關的也換成 AI,你要跟誰申訴
你的帳號被系統判定違規、直接刪掉,你想申訴,結果發現受理申訴的也是同一套系統。你要跟誰講理?這禮拜有一批新聞,表面上八竿子打不著——一樁平台審核爭議、一份遊說申報、一個國家級 AI 計畫、一次協定改版——可是把它們並排看,浮上來的是同一個問題:把關這件事,正在一件一件被外包出去。外包給另一台 AI,外包給少數幾個集中節點,外包給花最多錢遊說的人。而每外包一次,真人能插手的縫就窄一分。 一、Meta 用 AI 誤刪經營多年的帳號,連申訴都由 AI 審《紐約時報》一篇調查點名 Meta:多位 Instagram、Facebook 使用者的帳號被自動化審核系統誤判、直接刪除,其中不乏靠帳號維生的小商家,最誇張的一個有近百萬追蹤者。更關鍵的不是誤刪,是申訴流程同樣由 AI 處理,使用者根本找不到真人受理,直到記者介入,Meta 才恢復部分帳號。Meta 的回應是,較新的 AI 工具比人工少 13% 錯誤、多抓 10% 違規,還強調這些被封的帳號是「舊系統」處理的。 先別急著吵那 13% 準不準。真正的破口在結構:當犯錯的是 AI、受理申訴的還是 AI,這條迴圈裡沒有一個能推翻機器的真人,...
關掉重開就失憶、跑到一半就崩潰:agent 的記憶與韌性(AI Agent 架構全解析 4/8)
走到系列第四篇,我們的 agent 其實已經滿能打了。前三篇——拆解 harness、核心迴圈、扛住複雜任務的四招——把這台機器的骨架架好,讓它能規劃、拆解、扛下要好幾十步才做得完的複雜任務。但這台機器有兩個很尷尬的破口:你把視窗關掉再開,它完全不記得昨天聊過什麼、你交代過的偏好,每次都要從頭認識你一遍;更慘的是,跑到一半只要某個工具失敗、API 過載、或上下文塞爆,整條任務就當場崩掉,前面的努力全部白費。 這一篇要補的就是這兩塊:記憶(memory) 讓它跨執行不失憶;韌性(error recovery) 讓它在失敗裡活下來。中間再夾一塊很多人沒意識到、但天天在用的機制——system prompt 組裝,它決定了每一回合 agent 到底「知道」哪些事。這三件事湊在一起,才是把玩具迴圈變成能長期陪你工作的助手的關鍵。 記憶:讓 agent 關掉重開還記得你先講一個你每天都在用的活例子。你用 Claude Code 時,那個 CLAUDE.md 和專案底下那堆 memory 檔案,就是這一節在講的東西。你交代過一次「不要用簡體字」,之後它每個 session 都記得——那不是模...
調 Prompt 最有效的第一步,是別自己動手調
你寫了一段 prompt,叫 Claude 幫你把一批客訴分類。跑出來一看,一半分錯。你回頭改措辭,把「請分類」改成「請仔細分類」,再跑,還是錯。第三次你開始加那種強調詞:「務必」「一定要」「非常重要」,彷彿多喊幾聲它就會認真一點。結果呢?該錯的還是錯。 這個場景我猜你不陌生。大部分人卡在這裡,直覺反應都是「我技巧不夠,得去學 prompt engineering」,然後收藏了一堆「50 個 prompt 咒語」的文章。但你有沒有想過,問題可能不在你會的技巧太少,而在「你在自己硬寫」這件事本身。 先試過的那幾條死路加強調詞沒用,這件事其實有道理。模型不是聽你「語氣」做事的,你把「務必」講十遍,對它來說跟講一遍差不多。真正決定輸出品質的,是 prompt 的結構。任務講清楚了嗎?輸入輸出的邊界標出來了嗎?有沒有給它一兩個範例,讓它知道「對的長什麼樣」? 我試的第二條路是狂貼範例。這條有效一點,但很快就亂了:範例格式不統一、跟指令混在一起,prompt 變成一大坨,自己回頭看都眼花。手動整理這些結構是苦工,而且是那種「你知道該做、但很不想做」的苦工。 原來這步不用自己做轉折點是我發現...
AI 與科技新聞摘要 2026/07/21:對手變房東,政府變關卡
AI 公司最愛掛在嘴邊的一句話是「我們不綁死任何單一供應商」。這一週的幾條新聞,剛好把這句話戳出幾個洞。表面上它們互不相干——一樁算力租約、一次模型跳票、幾張晶片出口許可,可是只盯著單一則,你會漏掉底下那件正在發生的事:整個產業的命脈,正一節一節收斂到少數幾個點上。 一、Anthropic 傳向 Meta 租最高 100 億美元算力據 Reuters,Anthropic 正在跟 Meta 洽談租用運算能力,兩年規模上看 100 億美元,用來撐住 Claude 的需求。談判還在早期,Meta 目前也沒有成熟的對外賣算力業務,未必談得成。 真正該注意的不是金額,是關係本身。Meta 的 Llama 和 Anthropic 的 Claude 是正面對打的競品,這筆租約會讓兩家同時變成「對手兼客戶」。當你的算力房東就是你的競爭對手,議價權、優先權、甚至斷租的風險,全都握在對方手上。這種依賴不會出現在任何一季的財報數字裡,但它是實打實的下行風險。上行有限(省點自建成本),下行卻可能是關鍵時刻被掐脖子。 來源:TechFundingNews 二、Meta 推出 Muse Spark 1.1,...
大任務為什麼會壓垮 agent:讓它撐住的四招(AI Agent 架構全解析 3/8)
第一篇和第二篇我們把一個 agent 的骨架搭起來了:核心迴圈會呼叫模型、執行工具、把結果塞回對話,然後再問一次模型。這套流程處理「幫我讀這個檔、改那一行」綽綽有餘。但只要任務一變大,你自己在 Claude Code 裡大概都體驗過那個場景:它跑到一半開始鬼打牆,忘了三步前答應要做的事,或是對話長到某個點突然變慢、變貴,最後乾脆漏掉一半需求。 模型沒變笨,它只是扛不住了。大任務會從兩個方向壓垮一個 agent:一是沒有一份看得見的計畫,走著走著就迷路;二是 context window 被塞爆,該記住的東西被無關的雜訊擠出去。這一篇要講的 Layer 2,就是專門解決「扛不住」的四招:planning & todos、subagents、skills、context management。它們的共同目標只有一句話:讓 agent 在面對真正複雜的工作時,還能保持頭腦清醒。 第一招:planning & todos,先把大任務拆成 ticket你接到一個橫跨十幾個檔案的重構,第一件事會做什麼?不會是打開第一個檔案就開始改,而是先在 Jira 上開一串 ticket,...
該不該幫 Claude Code 設 session 上限?v2.1.212 三道保險絲的取捨
先分清楚:你是坐在旁邊,還是放它自己跑Claude Code 在 v2.1.212(2026-07-17)悄悄加了三個 session 級的資源上限。官方 changelog 講得很平淡,多數人滑過去大概也不會多想。但這三個開關的價值,完全取決於你怎麼用 Claude Code,所以在講該不該動它們之前,得先把使用情境切成兩種。 第一種,你坐在終端機前面,一句一句跟它對話,它每要動一次危險操作你都看得到。這種情況下,這三個上限你幾乎可以當它不存在。第二種,你把一個任務丟給它,關掉螢幕去睡覺,或乾脆掛在排程上每天自動跑。這種情況下,這三個數字就從「裝飾」變成「保險絲」。 我用電箱裡的保險絲來想這件事最順。保險絲不是拿來限制你用電的,你想開幾盞燈、吹不吹冷氣,它一概不管。它只在一種時刻起作用:電線快要走火、整間房子有燒起來的風險時,「啪」一聲把電切掉。這三個上限的角色一模一樣。平常你感覺不到它們,它們只在 agent 陷入某種失控迴圈、準備把你的 token 額度燒到見底的那一刻,跳出來把電閘拉下。 三根保險絲各自防的是什麼火先把三個開關擺出來,順便說清楚每一根防的是哪一種走火。它們...
AI 與科技新聞摘要 2026/07/20:產業的重量,正往少數幾個點集中
軍備競賽這個比喻,這禮拜開始有點不夠用了。如果只看標題,你會覺得又是一輪你追我趕:誰的模型分數高一點、誰的晶片快一點。但把這幾天的消息並排放著看,浮上來的其實是另一個字:集中。運算、模型能力、平台入口,正快速往少數幾個點聚攏。集中會讓整個系統跑得更快,也會讓它更怕單一個點出事。而有意思的是,同一批新聞裡,還藏著一股從反方向推回來的力量——開源。以下六則,就照這條線來看。 一、Kimi K3 登頂前端競技場,開源權重下週落地Moonshot AI(月之暗面)發表了 Kimi K3,一個 2.8 兆參數、支援 100 萬 token 上下文的稀疏 MoE 模型。它在 LMArena 的「前端程式競技場」以 1679 分登頂,據報壓過了 Claude Fable 5、GPT-5.6 Sol 與 GLM-5.2,開源權重預告在 07-27 釋出。DeepSeek 也預告 V4 穩定版將在 07-24 開源,兩波權重擠在同一週。 值得先踩一下煞車:這些名次多半來自廠商自報,獨立測試還指出 K3 的幻覺率升到約五成,權重公開前沒辦法完全驗證。所以「登頂」這件事,比較穩妥的讀法不是「它最強」,...
agent 是怎麼跑起來的:核心迴圈的四塊拼圖(AI Agent 架構全解析 2/8)
一張只會講話的嘴原始的模型呼叫,說穿了很無聊。你把一串訊息送進去,它吐一段文字回來,然後就沒了。你問它「台北今天要不要帶傘」,它可以回你一整段條理分明的「我得先查一下天氣預報、再看看降雨機率」,可是它連一次查詢都發不出去。它是一張很會講話的嘴,沒有手,也沒有記性。 上一篇把一台 agent 拆成兩半:model 負責推理和決策,harness 是包在模型呼叫外圍那一圈程式碼,負責遞工具、幫忙記事、必要時踩煞車。那篇講的是分工的觀念。這一篇要把手伸進去,看 harness 的心臟,也就是迴圈本身,到底怎麼一圈一圈轉起來。 我想先講一件容易被忽略的事:核心迴圈的四個零件,不是誰坐下來一次設計出來的。它是一個痛點逼出下一個零件,這樣累積出來的。看懂這個「一塊一塊長出來」的順序,比背下四個名詞有用得多。所以這篇的順序,跟著它們一個逼出一個的先後走。 先把四個名字報一下,等一下你會看到它們是怎麼接力出場的: 零件 它補上的能力 一句話類比 agent loop 反覆問模型「下一步做什麼」,直到收工 一顆會跳的心臟 tool runtime 把模型講的工具名字接到真正的程式碼...
越覺得自己分辨得出,越容易中招:AI 深偽詐騙時代該重設的信任判準
上禮拜滑臉書,張忠謀跟他太太出現在一支影片裡,笑得很慈祥,說要送書給有緣人,順便帶大家進一個「穩健佈局」的投資群組。畫面很清楚,嘴型對得上,連那個熟悉的溫和語調都在。留言區一堆人在問怎麼加入。 你會不會點? 先講事實:台積電早就發過聲明,張忠謀夫婦、魏哲家都沒有經營任何公開社群帳號,也沒辦過這種活動。那支影片是假的。可是它逼真到連留言區都在排隊。問題來了,真正該問的問題其實不是「這支影片做得多像」,而是你到底憑什麼決定要不要相信螢幕上的一張臉。 眼見為憑,第一次大規模失效人類幾萬年來最省成本的信任機制,就是「我親眼看到、親耳聽到」。它便宜、快、大部分時候夠用,所以我們的大腦把它設成了預設值:看到臉先信,聽到聲音先信,有懷疑再說。 deepfake 幹的事情,是第一次讓這個預設值大規模失靈。以前偽造一個名人站台要成本、要技術、要冒被抓的風險;現在生成一支假影片、複製一段聲音,幾分鐘、幾乎零成本。這裡有個很不對稱的東西:詐騙方的成本趨近於零,你的下行卻可能是畢生積蓄。 只要一件事的下行很大、上行有限,理性的做法就是別碰。你點進那個投資群組,最好的結果是「沒被騙」,也就是回到原點;最壞...









