20 天的股票預測實驗,系統像是產出反指標 >..<

Man analyzing AI stock market predictive models and financial charts on computer

When High-Confidence AI Predictions Become Contrarian Signals: A 20-Day Midterm Review of Human-AI Stock Forecasting

這 20 天的股票預測實驗

原本是想看看人機合作做出來的 AI 預測,能不能真的幫助股票決策。
不是為了追求某個漂亮分數,也不是想證明哪個模型最強,而是想把不同 AI、不同訊號、不同判斷方式放在一起,看看最後會不會比單一模型更接近真實市場。

一開始的設計方向是往融合走。技術面用 LightGBM,籌碼面用 XGBoost,事件面與語意判斷則交給 LLM。理論上,這樣的架構應該能互補:技術模型看價格與結構,籌碼模型看資金行為,LLM 看新聞與事件脈絡,最後再把三者融合起來,形成一個比較完整的判斷。

但實際跑了 20 天之後,系統呈現出來的結果,有一點像是反指標。
先說清楚,這不是在說系統不好。比較像是:目前系統還沒有完全收斂,資料量也還不夠,校準方式還在調整,所以暫時看起來有明顯偏差。這是一個中場檢討,不是結案報告。

一開始看起來很樂觀

最開始看到的分數其實很漂亮。融合之後,系統常常給出 85% 到 89% 這種很有信心的看漲結果。
如果只看這些數字,很容易覺得整個系統已經快完成,甚至開始有點像可以直接拿來用的版本。

但市場很快就把這種樂觀打回來。

在 7 月中旬那波明顯轉折裡,尤其是 7/17 這種外資宣洩式殺盤,很多原本看起來高機率看漲的標的,實際表現完全不是這麼回事。模型給出的方向,和真實市場的走勢差得很大。這時候才真正意識到,模型分數高,不等於市場真的會照著走。

這也是這次實驗最重要的提醒:看起來像勝率,不代表它真的就是勝率。

問題不在模型,而在尺度

後來回頭看,最明顯的問題不是模型完全沒用,而是它們輸出的尺度還沒有對齊真實世界。
歷史上真正實戰能打的勝率,大概只有 21% 到 31% 左右,可是系統輸出卻常常被撐到 85% 以上。這種落差不是小誤差,而是整個判斷邏輯出了偏差。

更精準地說,這些模型比較擅長的是「排序」,不是「絕對勝率」。也就是說,它們比較像是在告訴你,哪幾檔相對更值得注意,哪幾檔在當下更強或更弱。
但系統如果把這種排序直接當成「明天真實上漲機率」,那數字就會開始虛胖。

尤其在營收創高、法說會偏樂觀、新聞面很熱的時候,LLM 和籌碼模型很容易一起高估市場情緒。結果面對真正的系統性殺盤,整套系統反而失去反應能力。這不是模型完全錯,而是它學到的東西,還沒有足夠對齊市場真實的風險結構。

所以現在比較像是:模型知道哪裡有相對優勢,但還不太會判斷什麼時候整個市場會翻臉。

反指標感,其實是校準提醒

如果現在看這個系統,確實會有一種反指標感。
但這個反指標感,並不等於系統沒價值。比較像是系統已經暴露出一個很明確的事實:目前的分數太樂觀,尺度需要重新校準。

這其實是好事。因為一個完全看不出偏差的系統,才真的危險。現在至少已經知道,哪裡膨脹了、哪裡失真了、哪個環節需要重新修。

如果後續把預測分數做更好的映射,像是校準信心區間、重新定義多空尺度,或把原本偏高的輸出壓回實際命中率附近,這套系統反而有機會變成更有用的避險與排序工具。
所以現在不是把它當成失敗,而是把它當成一個剛好把問題照出來的中場檢討。

真正救命的是風控,不是預測

這次最有價值的地方,不是模型有多準,而是風控有沒有擋住損失。
在 AI 看錯的時候,真正保護帳戶的,不是更華麗的融合,而是幾條寫死的硬規則。

像是大盤硬斷路器,只要 ADR 或大盤環境破掉,系統就直接覆寫買入建議。又像是買入下限攔截,當實際開盤已經跌破策略認定的安全區間時,系統就不再硬上,而是自動切成「等止跌」。這些規則看起來很笨,甚至有點不浪漫,但在實盤裡非常有用。

因為市場不是比誰最會講故事,而是比誰的防線更難被擊穿。當模型開始失準時,真正能保住資金的,往往不是預測,而是拒絕進場的能力。

這也是這次實驗最重要的收穫之一:AI 可以幫忙判斷,但真正決定能不能活下來的,是風控。

接下來不是加模型,而是修正方式

經過這 20 天之後,最不該做的事情,其實不是繼續加第四個模型。
如果在勝率還沒收斂前,就一直堆更多 AI,只會讓錯誤一路傳導,最後變成架構越來越複雜,但效果沒有真正變好。

現在比較重要的,是做工程上的減法。先把特徵整理得更合理,讓不同股票的價位量級不要干擾模型。再把回填和診斷自動化,讓每次實驗都能留下可追蹤的結果。最後把否決機制和盤前檢查做得更穩,讓系統在極端行情裡不會硬闖。

這些改動看起來不像「模型升級」,但實際上更接近真正能上線的方向。因為交易系統最重要的,不是一次猜對,而是每一次都能少犯一點錯。

這 20 天留下來的東西

如果把這 20 天濃縮成一句話,大概就是:
系統目前確實有反指標感,但這不是失敗,而是校準前的真實樣子。

這套系統不是壞掉了。它只是還在找最適合目前市場的表達方式。資料還不夠完整,融合方式還沒完全收斂,校準也還在調。但正因為這樣,這次實驗才有價值。

因為它讓整件事變得很清楚:AI 預測如果沒有校準,就很容易把信心放大;模型如果沒有風控,就很容易在極端行情裡失守;而真正能長期活下來的,不是最會預測的系統,而是最能持續修正的系統。

這 20 天,看到的是反指標感。
但也正因為看到這件事,才知道下一步該怎麼修。
這不是結束,只是中場檢討。

更多文章

AI 股票預測實驗 #20|AI 多模型融合預測
2026-07-07
AI 股票預測實驗 #19|AI 多模型融合預測
2026-07-07
AI 股票預測實驗 #18|AI 多模型融合預測
2026-07-07
AI 股票預測實驗 #17|AI 多模型融合預測
2026-07-07
AI 股票預測實驗 #11
AI 股票預測實驗 #16|AI 多模型融合預測
2026-07-06
ai-stock-prediction-15-multi-model-fusion
AI 股票預測實驗 #15|AI 多模型融合預測
2026-07-04
AI 股票預測實驗 #14|AI 多模型融合預測
2026-07-08
AI 股票預測實驗 #13|AI 多模型融合預測
2026-07-08

探索更多來自 YinOnMars 的內容

訂閱即可透過電子郵件收到最新文章。