AI 一天能產出近十億行程式,但它解決的是「能不能跑」,不是「對不對、該不該這樣寫」。當生成趨近免費、驗證卻還卡在人類判斷的速度上,測試的瓶頸已經從「寫程式」移到「驗證程式」。團隊嘴上問的是「怎麼測 AI 寫的程式」,心裡真正怕的是「我來不及讀完所有程式時,怎麼還能負責地說它可以上線」。
這場分享我會拆解幾個在 AI 開發現場最常見的誤解,全程用可查證的研究數據加以佐證說明(METR 隨機對照試驗、DORA 2026、Sonar 2026),並穿插測試業界大佬的觀點。
大綱:
一、AI 對軟體測試所帶來的影響
二、迷思群一・綠燈幻覺——覆蓋率、綠燈、AI 寫的測試,為什麼都騙得了你
三、迷思群二・感知與現實的落差——你以為的快、你以為的好、你以為的把關,數據都不同意
四、迷思群三・人與規格反而更重要——oracle problem、模型越強缺口越大、AI 審 AI 的盲點
五、核心矛盾:很多團隊「要的是驗證,做的卻是把檢查自動化」,還誤以為兩者相等
聽眾收穫:
(1) 綠燈不等於對:測試通過只證明程式符合你寫的斷言,不證明那些斷言抓對了重點。
(2) 體感會騙人:你以為 AI 讓團隊更快了,但量測(METR)顯示資深開發者其實慢了 19%,連自己都沒察覺。
(3) 人和規格在 AI 時代更重要:AI 能產出程式卻定義不了「什麼叫對」,那個判斷只能由人和規格提供,反而比過去更稀缺。

目前在 Odd-e 擔任 Technical Coach,幫助企業導入敏捷、改善流程和提供培訓,台灣 Agile Tour Taipei 的組織者之一,也是國內最大敏捷社群的創始人, 致力於推廣敏捷技術。
擅長敏捷開發流程、敏捷測試、軟體測試、設計衝刺 (Design Sprint) 和 DevOps 轉型。
Agile Summit、DevOpsDays Taipei 的主辦人,譯有 Scrum and XP from the Trenches 繁中版。著有: “多團隊高效協作密技:大規模敏捷開發方法 Large Scale Scrum 簡單學”, "軟體測試修練指南:我獨自升級的實戰心法" 和 "範例驅動的需求澄清術:如何用精準範例指揮 GenAI 建構高品質軟體"