實測筆記:哪個 LLM 更適合驅動這條流程 — 以及 Vibe-IC 為何預設 Claude

我把自己真的拿來驅動 IC 設計流程的兩個模型——Kimi 與 Claude——放在一起比較,並盡量平實地說明:Vibe-IC 外掛目前為什麼預設 Claude,卻仍然保持可換模型。這只是一個當下的快照;模型每個月都在變,我也可能看錯。(這是一篇獨立的實測筆記。)

讓我停下來查證的那則新聞

今天有一則被大量轉傳的報導,說 Kimi K3「在 48 小時內完成了一顆晶片設計」。差不多同一時間,Cadence 與 Synopsys 股價一度下跌約 9%——那是市場的一種反應,不是對這些工具下的量測判決。我先講清楚:那個「48 小時」的說法我沒有查證,也不替它背書。我也把話說白:早在今天這則宣布之前,我自己就一直在打造一條 AI-native、end-to-end 的 IC 設計流程,所以這則新聞並不是我的起跑槍——它只是把一個我本來就在意的問題推上了聚光燈,而這是好事。今天一條 AI 驅動的流程,究竟能把一顆晶片推到多遠?對於一個安靜耕耘這個題目好幾個月的領域來說,它被推到陽光下,是值得歡迎的。

我的誠實立場:我真的在用 Kimi

我不想站在場邊評論,所以先把牌掀開:大約三個禮拜前——遠早於這一切 IC 設計的新聞——我就已經把 Kimi 納為第二個 LLM 來源,訂了 Kimi Code,把真實的工作丟進去跑,不是玩具題目。所以這篇不是對今天那條標題的反應,而是我這一路上本來就得到的觀察;今天的宣布,只是讓我把它寫下來的契機。

有一個但書我只講一次、而且是認真的:這只是一個人、一個專案、幾週的經驗——是一個快照,不是定論,下一季再比一次讀起來可能就不一樣。另外有兩件事我先釘住、免得含糊。Kimi 這邊:我親手用的是 Kimi Code,下面那個 benchmark 數字比的是 Kimi K3。Claude 這邊:幾乎所有日常的工作——寫 code、跑流程——我都是用 Opus 4.8 完成的,Fable 5 我只在跑 benchmark 才動用。所以下面談日常使用時,「Claude」指的是 Opus 4.8;引用 benchmark 時,指的是 Fable 5。

我在日常使用中觀察到的

有兩件事特別明顯。

Token 經濟性。我沒有做受控的 token 量測,所以請把這當成親身經驗、而非一個數字:在相近的任務上,Kimi 把我的額度燒得明顯比 Claude 快。

產出品質,RTL、文字、影片都是。最具體的例子就是這個部落格本身:第一版——在 Kimi 上起草的大約 15 篇——沒有過我的標準,於是我請 Claude 重寫,就成了你現在看到的這系列。這不是「Kimi 不會寫」,而是在我的題材、我的標準下,Claude 跨過了一道 Kimi 沒跨過的門檻——在真正的 RTL 工作上也是一樣。影片也是。我自己做的那些教學影片、還有 User Guide 這類引導影片,就穩定度而言 Claude 明顯穩得多;我用 Kimi 試過幾次,最後都還是改回 Claude 來做。

要拿出比我個人手感更客觀的依據,就看 Vibe-IC 的 驗證頁(Evaluation)——獨立的盲測,每一題都由該 benchmark 官方上游的 testbench 評分,並可在 vibeic-bench repo 中重現。那裡的讀數和我親手感受到的一致:在 VerilogEval-v2 上,我為 RTL 作者跑的那個 Claude 模型 Fable 5 拿到 98.08%(153/156),Kimi K3 為 94.23%(147/156)——單次跑分、領先約四分。兩者在組合邏輯與單暫存器題目上接近平手;差距是在困難的多狀態 FSM 深度上被拉開的,那正是「作者模型」必須挑大樑的地方。這個分解比標題數字更重要,也是下一段的樞紐。

但這裡要補一個對 Kimi 公道的更新,而且它推翻了我原本的結論。上面那組數字是單次跑分(pass@1)——一次作答、不給重試。我後來照 Vibe-IC 實際運作的方式重跑了一次:程式先行、失敗的地方閉環修回來,全程仍是盲測。結果 Kimi K3 在 VerilogEval-v2 拿到 154/156 = 98.72%,而且每一次修復都只靠讀題推理,沒有查任何外部資料。

要講清楚的是,這和 Claude 那個 153/156 不能直接對打——一個是單次、一個是多輪;要公平比,得給 Claude 同樣的輪數再跑一次,而我還沒跑。所以正確的讀法不是「Kimi 贏了」,而是:在這條流程上,Kimi K3 能到達的高度至少不輸 Claude。我原本寫的那句「我能量測到的最強 RTL 作者是 Fable 5」,就目前的證據已經撐不住了。那幾分的差距是「第一次就答對」的差距,不是「做不做得到」的差距。

這次重跑的計分產物已歸檔在 benchmark-data/evaluation/verilogeval_v2/run_kimi_k3_multiround_20260720/,和站上其他數字一樣可以自己查。

外掛為何預設 Claude,卻仍保持可換模型

Vibe-IC 是 program-first、AI-backup:由固定寫死的程式扛起主要工作,LLM 只在程式明確跳過(waive)的段落補位。正因為是這種架構,好幾個有能力的 LLM 都能驅動這條流程——它並不被綁死在單一供應商上;Claude、GLM、Kimi 都可選。

那為什麼預設還是 Claude?有了上面那個更新之後,理由變窄了,也更誠實:不是因為 Kimi 做不到,而是第一次就答對的機率,加上我親身感受到的 token 消耗。一次到位意味著更少的閉環輪數、更少的等待、更少的花費——在一條要跑幾十個步驟的流程裡,這個差別會被放大。我能量測到單次最強的 RTL 作者是 Fable 5;而真正把 Vibe-IC 幾乎所有日常工作做出來的,是 Opus 4.8。但「預設」就只是預設:天花板既然相同,換成 Kimi 一樣做得完——這也正是這個架構從一開始就保持可換模型的原因。一旦有另一個模型在這條軸線上量測得更強,我不必重寫架構就能換掉預設。

關於 Kimi 的兩個公道區分

把比較寫成一篇「攻擊文」很容易,而我無意如此。兩個區分,我當成原則來講,而不是對我看不到的東西下判決。

「宣布」不等於「開源」。Kimi 宣布了成果,但據我所知並未把背後的流程開源。這對一家公司來說是很正常的位置;我只是點出,一則宣布和一份可重現的成品,是不同的東西。

「一次到底的展示」不等於「產品級的流程」。任何單次、end-to-end 的展示——不管做得多精緻——都和一條可重現、有 benchmark、完全開放的流程是不同的物件,而後者正是 Vibe-IC 想成為的樣子。我講的是這個一般性的區分,並不是在替 Kimi 那個我沒看過的具體成果打分數。它們只是用不同的尺在量,而我寧可講得精確,也不想輕蔑帶過。

談一下資本市場的反應

這則新聞牽動了一些股價。把它讀成「EDA 工具受傷了」,未免太快:sign-off 終究是在那些工具裡完成的,而把設計的門檻降低,往往會讓需要簽核的晶片變多、而不是變少——EDA 和一條 AI 驅動的流程可以共榮,而不是互相抵銷。

而且真正受影響的,也許主要並不是 EDA 廠商。更尖銳的問題,是一條 end-to-end、AI 驅動的流程會對 IC 設計業本身帶來什麼——特別是那些原本正準備要投入 ASIC 的公司。是更好還是更壞?那是市場自己去解讀的事,不是我——我只回報我看到的,並刻意不去預測它會走向哪裡。

說清楚:這篇不是在反商用 EDA

有一件事我絕不希望這篇文章被誤讀。商用 EDA——Cadence、Synopsys——仍然是黃金標準,句號;Vibe-IC 存在的目的是與它共存,不是打敗它,我也不把一次股價的震盪解讀成對這些工具的判決。這個論點更深入的版本,我寫在開放與商用共存那篇裡。這篇談的很窄,就是 LLM——當下哪個模型最能驅動這條流程——對 EDA 工具本身沒有下任何結論。

一封公開邀請——給每一個模型

而這件事從來就不只關於 Kimi。這個生態歡迎每一個 LLM——GLM、Kimi、還有那些還沒發表的。這份歡迎是具體的:如果任何人日後的成果——包含 Kimi——願意引用、或直接接上 Vibe-IC 的外掛與這套 forked EDA 工具,門是開的,毫無保留。而如果某個模型做出來的東西,比我目前公佈的還要更超前,那是好事,不是威脅——這是互相砥礪,不是零和。我真正在意的,是這個 end-to-end 的想法——一套完整的設計文件直接變成矽晶片、中間沒有任何交接——能夠在真正的產業裡落實,真正改變晶片被設計出來的方式。在這件事上,大家做的是同一道開放的題。

誠實地作結

所以這些是實測筆記,不是定論——一個專案、一雙手、幾週的快照。模型會往前走;等它走了,誠實的作法就是跟著走、並在這裡說出來。我寧可下一季修訂這篇,也不願今天把它講過頭。而如果我把證據讀錯了,請告訴我——一個開放的 bench,就是為此而存在。

而這個系列,收在下一篇、也是最後一篇——我想退一步,聊聊這一切最終指向的那個世界:一套完整的設計文件直達 silicon、中間不再需要人為交接,以及,如果你願意,我們怎麼一起把它做出來。


延伸閱讀:RTL 作者能力比較背後的數字在驗證頁(Evaluation);至於為什麼「開放」與「商用」是夥伴而非對手,請看開放與商用共存