回到全部筆記
AI · 觀點X / @SKatalystAI · 2026.09.07整理:Sidney收錄 2026.09.08更新 2026.09.09

Agent 除了修對錯誤,也要保留原本正確的程式

測 AI 寫程式,應同時問「該改的改對了嗎」與「不該改的有沒有被動到」。

來源重點

作者以同一個起始版本、提示與時間上限,比較 Fable 5.1 與 Astra 修理一個混亂專案。題目包含九個預植錯誤與一項刻意保持正確的行為;依作者公布的結果,兩者即使建置與測試都通過,修復完整度與保留正確行為的表現仍不同。

整理判斷

這個測法比修改檔案數或新增測試數更有用,因為它把克制也列為正確性的一部分;結果仍只是作者的一次實驗,不能推成所有專案的模型排名。

可以如何判斷

先列出已知故障、正確輸出與必須保留的相容行為。各模型使用同一版本、相同預算,驗收時另外檢查不應改動的案例。

需要留意

未取得完整實驗環境並重跑;作者預告的交叉審查不是本篇已完成的結果。

延伸想法 · 尚待驗證

建立專案自己的 Agent 小考,每次換模型或調整規則都重跑。

需要的條件
可重設的測試專案、隱藏驗收答案、至少一個不能修改的正確案例。
怎麼驗證
選三個歷史 bug 與兩個正常功能,各跑一次;記錄修對率、誤改率、人工修復時間與整次成本,而不是只數程式碼行數。
原始來源X / @SKatalystAI
前往原始內容
來源與閱讀紀錄 · 2026.09.09

已讀 X 完整主文與可見留言;保留同題測試與勿破壞正確邏輯的概念,未複製作者完整測試敘事、表格或圖像。本次只核對可取得的文字及所述畫面,未取得全部留言、未完整觀看影片或實際操作工具。補充來源的查閱日期與範圍另列,舊日期不代表本次重讀。

@SKatalystAI 原始貼文 · 2026.09.08
已讀主文與當時可見留言;來源日期依瀏覽器顯示,未取得全部留言。