這款「AI 測謊儀」能即時偵測大型語言模型(LLM)的錯誤,準確度高達 98.5%,且速度比人工研究快 135 倍。
LOS ALTOS, CA, 2026年8月5日 - (亞太商訊) - 隨著生成式人工智慧的規模擴大,研究證實大型語言模型(LLM)持續出現「幻覺」、捏造來源,並自信地犯下錯誤。這為部署人工智慧進行自主自動化、研究、內容創作及決策的企業帶來前所未有的風險。
為解決此問題,TrustScale 今日宣布推出名為 Argus 的 AI 保證平台(目前正在申請專利)。有別於「AI 檢查 AI」的做法,Argus 運用實證資料與確定性驗證來審查 AI 生成的內容,在 AI 的錯誤被發布、分享或被依賴之前,便會標記缺乏依據的論點,並提出基於證據的修正建議。
研究顯示,AI 幻覺發生率因任務而異,且隨複雜度增加而上升。即使是前沿模型對簡單查詢的回應,幻覺發生率平均也可達 20%;而針對特定產業的 AI 查詢回應,幻覺發生率甚至高達 88%(史丹佛大學 RegLab)。這些幻覺每年為企業造成近 700 億美元的損失。Argus 賦能使用者以比人工研究快達 135 倍的速度驗證 AI 生成的陳述,藉此減少幻覺現象,並將 AI 輸出準確度提升高達 98.5%。
「AI 產業花了數年時間讓 AI 變得更聰明,但如今更亟待解決的課題是打造值得信賴的 AI,」TrustScale 執行長 Lawrence Snapp 表示。「AI 設計上本就是基於機率的,但企業必須承擔 AI 錯誤所帶來的成本與風險。Argus 透過在用戶依據生成式 AI 輸出採取行動前,提供獨立證據,從而緩解此問題。」
醫療、法律和學術界是高風險產業的典型例子,在這些領域中,AI 使用者往往在渾然不覺的情況下暴露於 AI 幻覺的風險之中。更令人擔憂的是,Anthropic 的研究顯示,91.3% 的 AI 使用者並未核實事實與主張,這造就了「沉默的失敗」可能直接對人類造成傷害的環境。Argus 透過即時偵測幻覺、疊加色彩編碼的 TrustScore 標記,並提供確定性證據來支持或反駁 AI 的主張,從而防止意外後果發生。接著,它透過內嵌式建議賦能使用者,讓使用者能一鍵修正 AI 的錯誤。
憑藉超過 20 年的 AI 數據經驗,Argus 建基於 TrustScale Engine——這項專有平台能為 AI 保障建立持續的信任控制平面,協助使用者在不中斷工作流程的情況下做出明智決策。
「人工智慧開發商聲稱其產品對使用者更安全、具備自主治理能力或能追求真相。但談到人工智慧時,相互矛盾的證據、多元的觀點、細膩的措辭以及獨立的驗證至關重要,」Global Data Innovation 執行長多米尼克·謝爾頓·萊比錫(Dominique Shelton Leipzig)表示。「TrustScale 的 Argus 是首個即時、持續的驗證平台,它透過提供證據賦能人類,並實現值得信賴的人工智慧。人工智慧的利害關係太過重大,絕不能讓少數大型模型來主宰你的真相。」
TrustScale 的 Argus 現已推出 12 種語言版本,企業用戶可直接使用;個人用戶則可透過 TrustArgus.ai 取得研究預覽版,或透過 Chrome 擴充功能在任何地方使用。企業解決方案可安裝於私有及公有資料環境中,並與任何 AI 模型並行運作,包括 ChatGPT、Claude、Gemini、Copilot 及 Grok。請至 www.TrustScale.ai 申請產品示範。
關於 TrustScale
TrustScale 是一家專注於 AI 訓練、評估與保證的公司,致力協助組織以更高的信心與掌控力來建構、塑造及運用人工智慧。憑藉超過 20 年涵蓋 200 多種語言的 AI 數據經驗,TrustScale 開發出獨立的確定性技術,用以偵測 AI 錯誤、依據實證資料評估主張,並確保人在重大決策中始終處於核心地位。其 Argus 平台可在公共與私有資料環境中,提供即時幻覺偵測、TrustScore 評分,以及基於實證的修正建議。更多資訊請造訪 TrustScale.ai。
媒體聯絡人:
Songue PR(代表 TrustScale)
[email protected]
消息來源:TrustScaleCopyright 2026 ACN Newswire. All rights reserved.
