![]() |
新產品同時驗證與客戶互動及在系統中執行操作的 AI 智能體,直接從程式碼產生測試情境,根據實際證據評核每項操作,並將所有未能驗證的部分量化為「驗證缺口」
三藩市及印度諾伊達2026年8月19日 /美通社/ — 全球首個 Agentic AI 原生品質工程平台 TestMu AI(前稱 LambdaTest)今日宣佈推出 Agent Assurance,旨在回答所有準備將 AI 智能體上線的工程團隊都要面對的一個問題:這個智能體是否已達到安全上線的要求?Agent Assurance 以單一產品涵蓋兩類智能體:對話式智能體類別可評估透過聊天、語音、電話、視像及圖像與人互動的智能體;全新的自主智能體類別則驗證在系統中執行操作的智能體:包括調用工具、寫入檔案、呼叫 API 及建立 pull request。
目前,大多數團隊在測試自主智能體時,只會參考智能體對自身行動的描述:文字記錄,或評審器根據其最終訊息給出的評分。Agent Assurance 則評核智能體實際造成的結果。只要連接至程式碼庫,Agent Assurance 便會分析智能體的功能,產生一套端到端智能體測試套件,涵蓋功能測試、非功能檢查及對抗性情境。系統會實際調用智能體,並根據觀察所得的證據評核每項準則。相關證據包括:磁碟上實際被修改的檔案、所產生的成果檔案,以及按照智能體自行聲明的可用工具範圍核實的工具調用記錄。
除了「通過」和「不通過」外,Agent Assurance 還會作出第三種判定——無法驗證。這類結果不會計入通過率,而會另行量化為:驗證缺口。報告中的每項結果均建基於實際觀察所得的證據。由於驗證缺口反映智能體對自身行動的記錄完整程度,團隊可透過提高智能體的可觀察性,逐步收窄該缺口。
「工程團隊目前正於風險最高的環節累積驗證債務。智能體對自身行為的描述,是判斷其實際行為時最薄弱的證據——因為在所有相關方之中,它本身最有可能作出錯誤陳述。」TestMu AI 集團工程高級副總裁 Vipul Verma 表示。「這個領域的每項工具都會報告通過率。Agent Assurance 不但報告通過率,亦會顯示自身盲點有多大。唯有同時交代盲點,團隊才能信賴這個數字,並據此決定是否推進發佈。」
藉助 Agent Assurance,團隊可以:
- 毋須編寫測試即可進行測試——測試套件直接從程式碼庫衍生,實現智能體自動化測試。團隊只需提供調用智能體的方法,無論是指令、HTTP 端點、MCP 伺服器,還是建基於 n8n 等平台的工作流程。
- 預設涵蓋各類對抗性風險——系統會將提示詞注入、工具誤用及指令覆寫情境納入核心測試類別,而非視為附加功能。
- 透過 CI 把關發佈——在每條 CI 流程中持續測試智能體,由每次提交程式碼時的智能體冒煙測試,到發佈前的完整測試;可在無介面模式執行的指令及退出碼,能夠區分「智能體執行錯誤」與「測試框架未能進行測試」。
- 可靠追蹤變更——智能體回歸測試會比較每次運行的差異,分辨新出現的失敗、新近修復及不穩定結果,因為不穩定問題與回歸問題需要截然不同的處理方式。
對話式智能體類別亦正擴展至軟件與人互動的最新介面:出現在鏡頭前的智能體。透過平台全新的 Video Agent Testing(Link)功能,一名擁有逼真面容及聲音的模擬真人會加入視像智能體的即時會話,與其進行自然對話,並按照團隊自訂的成功準則評核智能體。每項判定均可追溯至錄影中支持該判定的確切時刻。任何無法從錄影中核實的項目,均會被明確判定為未達標。對這個以錄影作為證據的類別而言,這是一項嚴格標準:凡評估者未能觀察到的表現,視像智能體一律不獲計分。
對話式智能體類別現已於 TestMu AI 平台正式推出。自主智能體類別現以搶先體驗形式開放,並可透過終端機以 rook 運行。模型會在 TestMu AI 控制器中執行,因此本機毋須配置供應商的 API 金鑰。如欲開始使用,請瀏覽 Link。
TestMu AI 簡介
TestMu AI 是全球首個 Agentic AI 原生品質工程平台,旨在以智能技術為核心,協助機構實現測試自動化並擴展測試規模。TestMu AI 結合自主運作能力,並與現代開發工作流程無縫整合,協助團隊在 AI 優先的世界中,更快交付更可靠、更安全的軟件。
如欲了解更多資訊,請瀏覽 TestMu AI
