在年末消費旺季來臨之際,許多人嘗試利用大型語言模型(LLM)輔助尋找商品與比價,但最新的實測結果顯示人工智慧暫時無法勝任全自動購物。研究團隊針對市場主流的 AI 搜尋與對話工具進行廣泛測試,發現這些系統在提供價格、規格和最新型號時,仍頻繁出現不準確與前後矛盾的情況。
測試揭露事實衝突:價格誤差顯著
研究團隊選定筆記型電腦、智慧型電視、掃地機器人等消費性商品,設計了 220 個購物諮詢問題,並分別在免費與付費版本的人工智慧工具進行多次測試,總共獲得近 8,800 份回覆。結果顯示,高達 86% 的問題在不同次回答中出現了可被驗證的事實衝突,包括產品規格不一致、誤認發表年份,甚至是價格標示錯誤。
尤其在要求 AI 進行兩款產品比較時,衝突發生的機率達到 75%。雖然整體有 85% 的價格資訊符合真實市場標價,但只要出現價格錯誤,其價差中位數高達 300 美元(約新台幣 9,600 元)。這意味著若使用者全盤信任 AI 提供的金額資訊,可能會大幅低估或高估購買預算。
各家 AI 模型表現差異:付費版普遍較準確
不同模型在購物情境下的準確度表現有顯著差距。測試顯示,部分模型在重複回答同一個問題時,甚至會出現自我矛盾的情況。在可能導致重大購物決策失誤的高額錯誤比例上,付費版本普遍比免費版本穩定:
- Gemini:錯誤率相對較高,免費版有 29% 的題目出現前後矛盾,付費與免費版的高額錯誤率均超過五成。
- Claude:付費版表現有明顯提升,高額錯誤率從免費版的 44% 降至 21%。
- ChatGPT 與 Perplexity:付費版本的錯誤率相對較低,其中 Perplexity 付費版的高額錯誤率約為 14%,ChatGPT 付費版則為 17%。
專家建議,目前使用者不應將付款資訊授權給人工智慧代理程式(AI Agent)直接執行交易,而應將其視為前期搜尋的參考工具,購買前務必親自前往賣家官網核實最終價格與規格。
這代表什麼
這項測試結果對電子商務產業與一般消費者傳達了明確訊號:現階段的「AI 購物助理」仍處於輔助角色,無法實現端到端的無人化代購。
對於台灣的中小企業與電商業者而言,這意味著短期內不必擔心 AI 代理程式完全壟斷消費者的導購入口。同時,業者在建置企業內部的商品知識庫或 AI 客服時,必須特別注意結構化資料(Structured Data)的完整度與更新即時性,以減少外部 LLM 爬取產品資訊時產生「幻覺」的機會。對於一般使用者來說,AI 確實能縮短摸索商品類別的時間,但在涉及實際消費決策時,人工核實仍是不可省略的防線。
背景補充
大型語言模型(LLM)擅長處理自然語言理解與文字生成,但在處理即時且精確的動態資料(如電商平台的促銷價格、庫存狀況)時,天生面臨極大挑戰。由於 LLM 主要依賴訓練資料與檢索增強生成(RAG)技術,若電商網站的資料未定期更新,或是網頁結構複雜,AI 就容易擷取到過期的歷史價格或將不同型號的規格混淆,產生看似合理卻完全錯誤的「幻覺」回答。
隨著國際科技巨頭紛紛推動能替使用者執行複雜任務的 AI 代理程式,資料準確度已成為決定生成式 AI 能否跨入真實商業應用場景的核心關鍵。
常見問題
AI 目前可以完全幫我進行網路購物與下單嗎?
目前還不行。研究顯示 AI 購物工具常出現價格標錯與規格混淆的問題,建議僅將其作為前期搜尋與激發靈感的工具,最後下單前仍需人工至官網確認。
為什麼不同 AI 模型給出的商品價格會有價差?
因為大型語言模型在抓取網路即時資料時,可能讀取到過期的促銷資訊或不同規格的售價,進而產生資訊混淆與幻覺現象。
免費版與付費版的 AI 購物助理表現有何差異?
測試顯示付費版本(如 Perplexity 或 ChatGPT 付費版)的資料準確率顯著高於免費版本,發生高額價格錯誤的機率大幅降低。