實測筆記:哪個 LLM 更適合驅動這條流程 — 以及 Vibe-IC 為何預設 Claude

我把自己真的拿來驅動 IC 設計流程的 Claude、Kimi 與 GPT/Codex 組合放在一起看,並盡量平實地說明:Vibe-IC 目前為什麼預設 Claude,卻仍然保持可換模型。我把每個分數都當成標明日期的 run 資料點,只有在保留證據支持時才綁定精確 plugin 版本。這只是一個當下的快照;模型每個月都在變,我也可能看錯。(這是一篇獨立的實測筆記。)

讓我停下來查證的那則新聞

今天有一則被大量轉傳的報導,說 Kimi K3「在 48 小時內完成了一顆晶片設計」。差不多同一時間,Cadence 與 Synopsys 股價一度下跌約 9%——那是市場的一種反應,不是對這些工具下的量測判決。我先講清楚:那個「48 小時」的說法我沒有查證,也不替它背書。我也把話說白:早在今天這則宣布之前,我自己就一直在打造一條 AI-native、end-to-end 的 IC 設計流程,所以這則新聞並不是我的起跑槍——它只是把一個我本來就在意的問題推上了聚光燈,而這是好事。今天一條 AI 驅動的流程,究竟能把一顆晶片推到多遠?對於一個安靜耕耘這個題目好幾個月的領域來說,它被推到陽光下,是值得歡迎的。

我的誠實立場:只測我真的用過的

我不想站在場邊評論,所以先把牌掀開:大約三個禮拜前——遠早於這一切 IC 設計的新聞——我就已經把 Kimi 納為第二個 LLM 來源,訂了 Kimi Code,把真實的工作丟進去跑,不是玩具題目。所以這篇不是對今天那條標題的反應,而是我這一路上本來就得到的觀察;我把日常工作放進不只一個模型裡跑,今天的宣布只是讓我把它寫下來的契機。

有一個但書我只講一次、而且是認真的:這只是一個人、一個專案、幾週的經驗——是一個快照,不是定論,下一季再比一次讀起來可能就不一樣。我先把三組身分釘住、免得含糊。Kimi 這邊,我親手用的是 Kimi Code,前面的 benchmark 數字比的是 Kimi K3。Claude 這邊,幾乎所有日常工作——寫 code、跑流程——我都是用 Opus 4.8 完成的;Fable 5 只用在前一輪 benchmark。GPT 這邊,2026-08-16 的更新是 GPT-5.6-Sol 經由 Codex,搭配 Vibe-IC 外掛 v1.10.45。所以日常使用觀察與 benchmark 資料點,是兩種不同的主張。

我在日常使用中觀察到的

有兩件事特別明顯。

Token 經濟性。我沒有做受控的 token 量測,所以請把這當成親身經驗、而非一個數字:在相近的任務上,Kimi 把我的額度燒得明顯比 Claude 快。

產出品質,RTL、文字、影片都是。最具體的例子就是這個部落格本身:第一版——在 Kimi 上起草的大約 15 篇——沒有過我的標準,於是我請 Claude 重寫,就成了你現在看到的這系列。這不是「Kimi 不會寫」,而是在我的題材、我的標準下,Claude 跨過了一道 Kimi 沒跨過的門檻——在真正的 RTL 工作上也是一樣。影片也是。我自己做的那些教學影片、還有 User Guide 這類引導影片,就穩定度而言 Claude 明顯穩得多;我用 Kimi 試過幾次,最後都還是改回 Claude 來做。

要拿出比我個人手感更客觀的依據,就看 Vibe-IC 的 驗證頁(Evaluation)——獨立的盲測,由各 benchmark 官方 scorer 建立結果;目前可歸因的 cell 都在公開的 benchmark-data repository。在七月那一輪 campaign 快照裡,VerilogEval-v2 上,我為 RTL 作者跑的 Claude 模型 Fable 5 拿到 98.08%(153/156),Kimi K3 為 94.23%(147/156)——單次跑分、領先約四分。兩者在組合邏輯與單暫存器題目上接近平手;差距是在困難的多狀態 FSM 深度上被拉開。這是那幾次已記錄 run 的有用證據,不是跨越所有模型與外掛版本、永遠成立的純模型排名。

但這裡要補一個對 Kimi 公道的更新,而且它推翻了我原本的結論。上面那組數字是單次跑分(pass@1)——一次作答、不給重試。我後來照 Vibe-IC 實際運作的方式重跑了一次:程式先行、失敗的地方閉環修回來,全程仍是盲測。結果 Kimi K3 在 VerilogEval-v2 拿到 154/156 = 98.72%,而且每一次修復都只靠讀題推理,沒有查任何外部資料。

要講清楚的是,這和 Claude 那個 153/156 不能直接對打——一個是單次、一個是多輪;要公平比,得給 Claude 同樣的輪數再跑一次,而我還沒跑。所以正確的讀法不是「Kimi 贏了」,而是:在那個已記錄的七月流程裡,Kimi K3 的閉環結果顯示,單次的差距可以透過修復補回。它推翻了我原本從兩組單次分數下的過強結論。如今 GPT/Codex 增加了第三個、且 plugin 身分已釘住的資料點;我把三者都當成 run 記錄,不當成普遍排名。

證據註記:這次歷史重跑的計分產物尚未落地到拆分後的公開 benchmark-data repository;先前顯示的路徑在 repo 拆分後並不存在。

七月的 Kimi run 仍是歷史 run 記錄,但它沒有把作者模型綁定到一個不可變的 Vibe-IC plugin 版本,因此不會在目前 benchmark-data 版面中被呈現為標準的「模型 + plugin」cell。

2026-08-16 更新:GPT-5.6-Sol 搭配 Vibe-IC v1.10.45

我現在把第三種作者組合也放進流程實測:GPT-5.6-Sol 經由 Codex,搭配 Vibe-IC 外掛 v1.10.45。量測讀數是:VerilogEval-v2 單次 153/156;VerilogEval-Human 單次 153/156,一輪閉環修復後 154/156;以及 RTLLM 單次 48/50,一輪閉環修復後 49/50。

這條界線很重要:新的 GPT 結果是「模型 + plugin」資料點,不是只換模型的 A/B 測試。Claude 參考值有釘住的 plugin 身分;封存的 Kimi run 有 run context,卻沒有不可變的 plugin 版本綁定。因此不能把這些分數相減,就把差異全部歸因於模型。從我親手跑的結果,能誠實說的是一件更窄、但有用的事:GPT/Codex 現在是一條實際可選的路,而且一輪修復在 VerilogEval-Human 與 RTLLM 都各救回一題。這是量測到的修復,不代表那兩個 campaign 已完全收斂。

外掛為何預設 Claude,卻仍保持可換模型

Vibe-IC 是 program-first、AI-backup:由固定寫死的程式扛起主要工作,LLM 只在程式明確跳過(waive)的段落補位。正因為是這種架構,好幾個有能力的 LLM 都能驅動這條流程——它並不被綁死在單一供應商上;Claude、GPT/Codex、GLM、Kimi 都可選。

那為什麼預設還是 Claude?有了這些更新後,我不再把前一輪 Fable 5 的資料點寫成放諸四海皆準的單次排名。我保留 Claude 當預設,是因為它是我親手建立、重複最多次的工作方式:Vibe-IC 幾乎所有日常工作都是 Opus 4.8 做出來的;在我的使用裡,Claude 從 RTL、文字、教學影片到 User Guide 引導都更穩定,token 體感也比我使用 Kimi 時更省。現在的 benchmark 記錄支持的是好幾種可行的「模型 + 外掛版本」組合,不是一個放諸四海皆準的冠軍:Kimi 有它歸檔的閉環結果,GPT/Codex 現在也有 v1.10.45 橫跨三個 benchmark 的記錄。預設是一個作業偏好,不是模型至尊的宣告——使用者今天就能選 GPT/Codex 或 Kimi,而我日後也能不改架構就更換預設。

關於 Kimi 的兩個公道區分

把比較寫成一篇「攻擊文」很容易,而我無意如此。兩個區分,我當成原則來講,而不是對我看不到的東西下判決。

「宣布」不等於「開源」。Kimi 宣布了成果,但據我所知並未把背後的流程開源。這對一家公司來說是很正常的位置;我只是點出,一則宣布和一份可重現的成品,是不同的東西。

「一次到底的展示」不等於「產品級的流程」。任何單次、end-to-end 的展示——不管做得多精緻——都和一條可重現、有 benchmark、完全開放的流程是不同的物件,而後者正是 Vibe-IC 想成為的樣子。我講的是這個一般性的區分,並不是在替 Kimi 那個我沒看過的具體成果打分數。它們只是用不同的尺在量,而我寧可講得精確,也不想輕蔑帶過。

談一下資本市場的反應

這則新聞牽動了一些股價。把它讀成「EDA 工具受傷了」,未免太快:sign-off 終究是在那些工具裡完成的,而把設計的門檻降低,往往會讓需要簽核的晶片變多、而不是變少——EDA 和一條 AI 驅動的流程可以共榮,而不是互相抵銷。

而且真正受影響的,也許主要並不是 EDA 廠商。更尖銳的問題,是一條 end-to-end、AI 驅動的流程會對 IC 設計業本身帶來什麼——特別是那些原本正準備要投入 ASIC 的公司。是更好還是更壞?那是市場自己去解讀的事,不是我——我只回報我看到的,並刻意不去預測它會走向哪裡。

說清楚:這篇不是在反商用 EDA

有一件事我絕不希望這篇文章被誤讀。商用 EDA——Cadence、Synopsys——仍然是黃金標準,句號;Vibe-IC 存在的目的是與它共存,不是打敗它,我也不把一次股價的震盪解讀成對這些工具的判決。這個論點更深入的版本,我寫在開放與商用共存那篇裡。這篇談的很窄,就是 LLM——我真的跑過的「模型 + 外掛版本」組合,當下在這條流程裡表現如何——對 EDA 工具本身沒有下任何結論。

一封公開邀請——給每一個模型

而這件事從來就不只關於 Kimi。這個生態歡迎每一個 LLM——GPT/Codex、GLM、Kimi,還有那些還沒發表的。這份歡迎是具體的:如果任何人日後的成果願意引用、或直接接上 Vibe-IC 的外掛與這套 forked EDA 工具,門是開的,毫無保留。而如果某個模型做出來的東西,比我目前公佈的還要更超前,那是好事,不是威脅——這是互相砥礪,不是零和。我真正在意的,是這個 end-to-end 的想法——一套完整的設計文件直接變成矽晶片、中間沒有任何交接——能夠在真正的產業裡落實,真正改變晶片被設計出來的方式。在這件事上,大家做的是同一道開放的題。

誠實地作結

所以這些是實測筆記,不是定論——一個專案、一雙手、幾週的快照。模型會往前走;等它走了,誠實的作法就是跟著走、並在這裡說出來。我寧可下一季修訂這篇,也不願今天把它講過頭。而如果我把證據讀錯了,請告訴我——一個開放的 bench,就是為此而存在。

而這個系列,收在下一篇、也是最後一篇——我想退一步,聊聊這一切最終指向的那個世界:一套完整的設計文件直達 silicon、中間不再需要人為交接,以及,如果你願意,我們怎麼一起把它做出來。


延伸閱讀:RTL 作者能力比較背後的數字在驗證頁(Evaluation);至於為什麼「開放」與「商用」是夥伴而非對手,請看開放與商用共存。