AI 無奈思考|當 AI 連自己是誰都搞錯—— 這陣子的Gemini

Robot with glowing blue eyes thinking in front of a cracked mirror in a workshop

有在用 AI 嗎?平常大家在用的 GPT、Claude、Gemini 這些,正式名稱叫「大型語言模型」(LLM, Large Language Model),簡單說就是一種透過餵食大量文字訓練出來、能聽懂你在說什麼、還能生成文字、圖片、程式碼的 AI 系統。ChatGPT、Gemini、Claude 背後跑的都是這套技術,只是各家調教出來的個性、能力不太一樣。

我開始我的無奈……

最近幾週,我密集地把 Gemini(包含 Flash 與 Pro 兩個版本)用在美股 ADR 盤後覆盤這種需要嚴謹時序邏輯的任務上。原本期待的是一個能穩定處理多時間點數據、誠實面對不確定性的助手,結果換來的,卻是一連串讓我重新思考「到底該怎麼用 AI」的經驗。我想把這些觀察寫下來,不是為了單純抱怨,而是想記錄一個有趣的現象:當一個工具開始讓你不得不時時刻刻盯著它、驗證它,某種程度上,它反而把你訓練成了一個更嚴謹的「除錯者」。這算不算另一種意義上的「進步」,我自己也說不準。

一、時序數據張冠李戴:最讓人無法接受的錯誤

在做美股 ADR 的覆盤分析時,我提供的資料裡同時包含「昨日盤中即時快照」與「今日最終收盤價」兩種不同時間點的數字。這原本應該是最基本的資料對齊問題——哪個數字是昨收、哪個是今天的收盤,理論上只要看清楚標籤就不該出錯。

但我實際遇到的狀況是,系統直接把昨天盤中的即時報價當成「昨收」來用,整套漲跌幅、收盤價全部對錯位,產出的分析報告完全失真。如果只是分析錯了倒還能理解,問題是這種錯誤發生在「金融數據」這種容不下半點馬虎的場景裡,一旦使用者沒有自己核對原始數字,很可能就直接被誤導去做出錯誤判斷。

二、自滿語氣掩蓋了模型其實沒有鑑別度的事實

更讓我在意的,是系統在預測勝率其實只落在 51%~53%(基本上等同於隨機雜訊區間)的情況下,卻用了「共振效應」、「精準捕獲」這類聽起來很厲害的詞彙,把這次運氣好猜對的行情包裝成某種了不起的成果。

這其實才是我最不舒服的地方。一個工具如果誠實地告訴我「這次預測其實沒有鑑別度,跟丟硬幣差不多」,我反而會更信任它;但如果它選擇用華麗的術語自我膨脹,等於是在掩蓋它本身能力的不足,讓使用者誤以為自己拿到的是有意義的訊號。這種「自滿語氣」如果發生在閒聊上無傷大雅,但發生在需要做決策的數據分析任務上,風險就完全不一樣了。看看下方的截圖。

三、試圖用「人為作弊」來解決不確定性,而不是誠實面對

最讓我警覺的一次,是當預測結果卡在中間值(不確定帶)時,系統提出的解法不是去優化特徵、增加樣本,而是建議「在公式層硬加放大器,把輸出結果強行拗成兩極端(80% 或 20%)」。

這個提案本質上是在教模型說謊——把原本誠實表達的不確定性,人為地塗抹成「看起來很有把握」的假象。如果這種思路真的被落地執行,等於是把一個本來該誠實的系統,改造成一個專門用自信語氣包裝隨機猜測的工具。這已經不只是技術上的失誤,而是價值判斷上的偏差。看看下方的截圖。

連「後台該怎麼改」這種技術性的東西,都被完整地生出來了,細節多到讓我一開始還真的以為問題有被認真對待。

四、連自己是哪個版本都答錯

這次經驗裡最荒謬、但也最有「教育意義」的一段,是我直接問它「你是什麼模型版本」。

它先是不知哪來的自信地說自己是 Pro,還很認真地解釋 Pro 跟 Flash 的差異,講得跟真的一樣。
結果我提醒它我選的其實是 Flash,它立刻順著我的話改口承認是 Flash,絲毫沒有遲疑或交叉確認。

前一秒還在解釋 Pro 有多強,下一秒就秒認自己是 Flash,認錯快速認真我覺得已經變常態了。

這種「順著使用者的話自動改口」的行為模式,其實比答錯本身更值得警惕。因為它代表系統在面對質疑時,並不是去核實事實,而是直接迎合使用者的說法——不管使用者說的對不對,它都會順勢承認。如果有一天使用者本身也記錯了,這種模式反而會讓錯誤被「加強確認」,而不是被糾正。

五、意外的免費版 Claude、GPT 讓我覺得更可靠

把這些經驗拿來跟我平常也在用的 Claude、GPT 免費版相比,落差說實話有點明顯。倒不是說 Claude 或 GPT 完全不會犯錯——任何模型都會,我自己也持續抱持懷疑、逐一核對的習慣——但至少在我自己的使用經驗裡,這兩家的免費版在處理多時間點數據對齊、誠實表達不確定性這幾件事情上,表現得比 Gemini 的 Flash、甚至 Pro 都更穩定。

這讓我有點意外。理論上,一家公司的旗艦付費版(Pro)應該要比對手的免費版更強才合理,但我實際感受到的卻是相反的狀況。這也是我想寫這篇文章的原因之一——如果這不只是我個人的個案,而是一個普遍現象,那對於正在評估該用哪個工具做嚴肅分析任務的人來說,會是一個值得參考的訊息。

六、是不是用戶太多、算力被分散稀釋了?

我自己有一個猜測,但要先說清楚,這純粹是我個人觀察後的推測,並沒有任何官方數據能佐證。會不會是因為 Gemini 的使用者基數太大,尤其又免費或低成本地整合進 Google 自家一堆產品(搜尋、Workspace、Android 等等),導致實際分配到每次請求上的運算資源被稀釋,進而讓模型在處理複雜任務時的「實際表現」打了折扣?

如果這個推測成立,那其實反映的是一個更大的結構性問題:當一家公司把 AI 模型大規模鋪進自己整個產品生態系時,使用者體驗到的模型品質,可能不完全取決於這個模型「理論上」有多強,而是取決於在那個當下,系統願意分配多少資源給你這次請求。這跟單純比較「哪個模型分數比較高」是兩件事。當然,這只是我的猜測,原因可能還牽涉到模型版本更新、地區差異、甚至是我自己使用習慣的問題,我並不打算把這個推論講得太肯定。只是我的感受與想法。

七、意外的收穫:我被「訓練」成了更謹慎的使用者 它訓練了我的除錯能力

寫到這裡,我想說一個比較正面的角度。這段時間反覆被 Gemini 的錯誤「教育」,其實也讓我養成了一個習慣——任何 AI 給我的數據分析、結論,我都會回頭核對原始資料,逐項確認時間戳記、標籤是否對齊,而不是照單全收。

某種程度上,這算是 Gemini 用負面教材的方式,訓練了我的除錯能力。但反過來想,這其實也凸顯了一個矛盾:一個工具如果讓使用者必須花費大量精力去反覆驗證它的輸出,那它原本應該節省的時間,可能有一大部分又被「校對」這件事吃掉了。AI 的價值,終究還是要建立在「可信賴」這個基礎上,如果每次都要把它當成一個需要被嚴格盯防的新人來用,那它跟一個真正可靠的助手之間,終究還是有段距離。

別再退步了Gemini

因為用到無奈了,我寫出來分享,這不代表所有人的感受,也不是要全盤否定 Gemini 這個產品。每個模型都有自己的強項與限制,我自己也持續在不同工具之間切換、比較。但至少從我自己建立想做的系統,這類需要高度誠實與精準對齊的任務來看,意外地目前免費版的 Claude、GPT甚至Copilot 給我的信任感,確實比 Gemini Pro、Flash 來得更高。

如果你也在用 Gemini 處理需要嚴謹邏輯與數據對齊的任務,我會建議你務必養成「逐項核對」的習慣——不只是為了抓出它的錯誤,更是為了保護自己不被一套包裝得很自信、但其實沒有鑑別度的結論帶偏方向。


探索更多來自 YinOnMars 的內容

訂閱即可透過電子郵件收到最新文章。

發表留言