20 天學 AI|Day 1|AI 不只一種…ChatGPT、AI 繪圖和自動化,其實差在哪?

AI 有哪些種類

AI Is Not One Thing: The Difference Between Chatbots, Image Generation, RAG, and Automation

很多人說自己想學 AI,第一件事就是打開 ChatGPT。

問它能不能寫文案、整理會議紀錄、翻譯英文、分析資料,接著看到別人用 AI 畫圖、做影片、做簡報,又開始懷疑:我是不是也該訂閱?是不是少學了什麼?是不是再不跟上就來不及了?

先別急。

現在大家口中的「AI」,其實已經混進很多不同東西。ChatGPT 是 AI、Midjourney 是 AI、把公司 SOP 上傳後讓同事查詢是 AI,自動讀信、整理表單、寄通知也常被叫做 AI。

但它們處理的問題不同,背後需要的技術、資料、成本與風險也不同。

如果一開始沒有分清楚,很容易變成:看見什麼都想學一點,工具帳號開了一堆,最後真正遇到工作問題時,還是不知道該用哪一個。

Day 1 先不教你一長串 Prompt,也不急著比較哪個工具最強。

先把地圖攤開來看。

你以為在學 AI,
可能只是在學怎麼跟 ChatGPT 聊天

ChatGPT 很紅,確實有它的原因。

它能寫、能改、能翻、能整理,也能陪你把一個模糊的想法慢慢說清楚。對多數人來說,第一次感受到 AI 真正進入日常工作,往往就是從這裡開始。

但 ChatGPT 不等於 AI 的全部。

你請 AI 根據產品需求寫一份提案架構,和你請它生成一張產品情境圖,表面上都只是輸入一句話;底下處理的事情卻不一樣。

前者主要在處理文字與語意;後者要處理畫面、構圖、風格、光線、材質,以及物件之間看起來是否合理。

再往後,你希望 AI 能回答「我們公司的保固規範是什麼」,它也不能只靠一般網路知識亂答。它得先在你提供的文件裡找到資料,再根據資料回答。

而當你希望有新表單進來後,自動分類、寫入試算表、通知窗口,這又已經走到流程串接與自動化了。

它們都叫 AI,但不能用同一種期待去看。那AI 有哪些種類….

先看這張 AI 使用地圖

下面這張表不用急著背。它的用途只是幫你先把常見的 AI 應用分開,不要全部都塞進「ChatGPT 很厲害」這一句裡。

你想做的事常見 AI 類型常見例子它主要在處理什麼
問問題、寫文章、摘要、翻譯、整理想法LLM/大型語言模型ChatGPT、Claude、Gemini文字、語意、對話與內容生成
生成圖片、改背景、做視覺草圖圖像生成式 AIMidjourney、DALL·E、Stable Diffusion畫面、風格、構圖與影像內容
看圖片、讀 PDF、聽語音、理解表格多模態 AI支援圖片、語音、文件輸入的 AI 工具文字以外的圖片、聲音與文件資訊
根據公司文件、產品資料回答問題RAG/檢索增強生成內部知識庫、客服問答系統先找指定資料,再依資料回答
自動分類信件、更新表格、寄通知自動化/AI WorkflowZapier、Make、n8n 等流程工具串接不同系統,按條件執行工作

有些產品會把幾種能力包在一起,所以你用起來會覺得「這就是一個 AI」。

例如你可以在同一個聊天視窗裡,請它寫文、看圖片、分析文件,甚至建立一套工作流程。使用介面是一個,但背後通常不是只有一種模型或一種能力。

這也是為什麼,光看工具名稱不夠。先看自己要解決什麼問題,才比較不會花冤枉錢。

ChatGPT、Claude、Gemini:主要是 LLM

ChatGPT、Claude、Gemini 這類工具,核心通常是 LLM(Large Language Model,大型語言模型)。

名字有點長,但你可以先把它想成一個很擅長處理語言的系統。

它可以幫你:

  • 將一封語氣太硬的信改得比較自然
  • 把一小時會議紀錄整理成待辦事項
  • 將英文資料翻成易讀的中文
  • 幫你列出企劃初稿、訪談問題或簡報大綱
  • 將零散筆記重新整理成有邏輯的內容
  • 用不同角度陪你檢查一個想法有沒有漏洞

它很適合處理那些「明明腦中有一些東西,但還沒整理好」的工作。

不過,LLM 有一個很重要的限制:它生成的是看起來合理的文字,不是保證正確的事實。

你問它資料、法規、價格、新聞、產品規格、人物經歷,它可能回答得很流暢,甚至補上看起來很完整的細節。問題是,那些細節不一定真的存在。

所以,LLM 可以幫你整理、起草、推演與找方向;遇到需要精準負責的資訊,仍要回到原始資料確認。

後面 Day 3、Day 4 和 Day 5 會接著談 Prompt、AI 幻覺與查證,因為這些都是使用 LLM 時繞不開的事。

AI 繪圖:它在處理畫面,不是在替你「打字」

學 AI

很多人第一次接觸 AI 繪圖時,會覺得它很像魔法。

輸入「雨天的台北街角,咖啡店落地窗,暖黃燈光,底片感」,幾秒後就出現幾張像模像樣的畫面。你可以拿它做社群配圖、情境示意、提案草圖、靈感板,或先把腦中的畫面具體化。

這一類通常叫做 圖像生成式 AI。

它和 LLM 都可以接收文字指令,但處理重點不同。LLM 的強項是語言脈絡;圖像生成模型在意的是畫面裡有什麼、東西怎麼擺、風格像不像、光線合不合理。

它適合拿來做前期探索,尤其是這幾種情況:

  • 你需要快速找視覺方向
  • 你想替文章或簡報補一張概念圖
  • 你有一個產品、空間或角色的初步想法
  • 你需要大量不同風格的素材草圖
  • 你想先和設計師溝通「我大概想像的是這種感覺」

但它不會因此取代設計判斷。

一張圖看起來很精緻,不代表它能直接拿去做品牌主視覺,更不代表適合商業使用。字體可能亂掉,手部或結構細節可能有問題,畫面中的產品也不一定符合真實規格。若牽涉商標、人物肖像、授權或商用用途,也要回頭確認使用平台的條款與素材來源。

AI 繪圖可以很快地幫你把想像畫出來。要不要採用、怎麼修改、是否符合品牌與現實條件,還是人的工作。

AI 看得懂圖片、聲音和文件嗎?是多模態 AI

現在的 AI 不只會處理文字。

你可以上傳一張照片,問它畫面裡有什麼;丟一份 PDF,請它整理重點;放進報表截圖,問數字可能代表什麼;上傳錄音,請它轉成逐字稿和待辦事項。

這些能力通常會被放在 多模態 AI 這個範圍裡。

「多模態」聽起來很技術,其實就是它不只處理一種資料形式。文字、圖片、語音、影片、表格、掃描文件,都可能成為它理解內容的來源。

這會讓很多原本很麻煩的事變得比較快。

比方說,你不必自己先把一張白板照片逐字打出來;你可以請 AI 先辨識內容,再自己校正。你也可以請它先讀一份長報告,列出應該注意的圖表與段落,減少第一輪閱讀的負擔。

但「能看」不等於「看得完全正確」。

模糊的掃描檔、字很小的表格、複雜的工程圖、醫療影像、財務報表,或有很多上下文的法律文件,都可能讓 AI 誤讀、漏掉細節,甚至根據不完整資訊做出過度自信的結論。

它很適合當第一位整理資料的助手,不適合在高風險情境裡成為最後拍板的人。

RAG:讓 AI 先讀你的資料,再回答你的問題

接下來這個名詞,很多人會在公司導入 AI、建立內部知識庫時遇到:RAG。

RAG 的全名是 Retrieval-Augmented Generation,中文常翻成「檢索增強生成」。名字先不用記,你只要理解它想解決的問題:

希望 AI 回答時,不只靠它原本知道的內容,而是先去找你指定的資料。

假設公司有產品規格、保固政策、內部 SOP、客服紀錄、教育訓練教材。若每次有人問問題,都要人工翻文件,久了很花時間。

RAG 的做法,是先把文件整理進可查找的知識庫。當使用者提問時,系統先找出相關段落,再把這些內容交給 AI 組織成回答。

這和把一份 PDF 丟進聊天視窗請它摘要,差別在哪裡?

一次上傳文件,比較像「請 AI 幫我讀這一份資料」;RAG 則更接近「讓系統能持續在一批資料裡找答案」。

如果資料會更新、使用者很多、內容有權限差異,RAG 才會真正開始變得有意義。

不過它也不是把檔案丟進去就結束。文件過期、內容互相矛盾、權限沒有分好、資料沒有來源標示,AI 一樣可能答錯,甚至讓不該看到的人看到不該看的內容。

所以公司在談「做一個內部 AI」時,最該先問的通常不是模型多強,而是:資料品質如何?誰能看?多久更新?回答能不能回到原始來源?

自動化和 AI Workflow
讓事情往下走,而不只是回答你

最後一個常被混淆的,是自動化。

有人填表單後,把資料自動寫進試算表;訂單進來後,自動通知客服;每週固定時間把數據整理後寄到信箱。這些工作即使沒有 AI,也可以靠規則與流程工具完成。

它的邏輯通常很清楚….
發生 A,就執行 B;符合條件 C,就通知 D。

AI 放進來之後,流程會多一層理解與判斷。

例如客服信件進來後,先由 AI 判斷它是退貨、產品問題還是合作邀約,再交給不同窗口;或是每週自動抓取資料後,先由 AI 寫出摘要,再讓負責人確認是否發送。

這類把 AI 放進流程中的做法,常被稱為 AI Workflow。

它有價值的地方,通常不在於「AI 自己會工作」,而是能減少那些每週都在重複複製、貼上、分類、轉寄、提醒的瑣碎工作。

但流程越長,越需要小心。

如果 AI 分錯類別、摘要看錯數字、把客戶資料送到不該去的地方,問題就不只是回答錯一句話而已。導入自動化前,最好先確認:哪些步驟可以自動做?哪些地方一定要人工確認?出錯後誰負責處理?

真正好用的自動化,通常不是最華麗的那一套,而是剛好替你省掉最容易漏、最重複、最浪費時間的工作。

那我現在到底需要哪一種 AI?

如果你還是不確定,可以先用這張表快速判斷。

你現在遇到的問題可以先看的方向
想整理文字、寫初稿、翻譯、摘要、討論想法LLM
想做社群配圖、提案情境圖、視覺靈感板圖像生成式 AI
想理解照片、PDF、錄音、報表截圖多模態 AI
想讓團隊問公司規範、產品資料或 SOPRAG
想減少重複搬資料、分信、寄通知、更新表格自動化或 AI Workflow

你不需要今天就把全部都學會。

先找到自己最常遇到的一個問題就好。若你每天都在整理文字,先學 LLM;若工作常常需要視覺素材,再研究 AI 繪圖;若團隊真正卡在資料找不到,才去理解 RAG;若大家一直被重複行政流程拖住,才開始看自動化。

工具本身沒有那麼神祕。真正困難的地方,是先看懂問題,再選對工具。

明天,我們會回到大多數人最先碰到的選擇:ChatGPT、Claude、Gemini,到底要不要付費?付費前,又應該先看什麼?

如果你的問題是……先從哪一類開始
我想把一堆文字整理成重點LLM
我需要社群圖片、提案視覺或素材草圖圖像生成式 AI
我想問一份 PDF、照片或報表在說什麼多模態 AI
我想讓團隊查公司規範、產品資料或 SOPRAG
我每週都在重複搬資料、寄信與整理表單自動化/AI Workflow

常見問題

ChatGPT 是 AI 嗎?

是。ChatGPT 是以大型語言模型為核心的生成式 AI 工具,主要擅長文字理解、對話、內容生成、摘要、翻譯與協助整理想法。

AI 繪圖和 ChatGPT 有什麼差別?

ChatGPT 這類工具主要處理語言;AI 繪圖工具主要根據文字或圖片生成、修改視覺內容。兩者都可能使用文字指令,但處理的資料與成果不同。

RAG 是一種 AI 嗎?

RAG 比較像是一種讓 AI 使用外部資料的方法。它會在回答前先從指定文件或知識庫找資料,再將相關內容交給模型生成回答,常用在公司內部知識庫與客服系統。

自動化一定要用 AI 嗎?

不一定。許多自動化流程只要設定條件與規則就能完成。當流程需要讀懂信件內容、分類文字、產出摘要或處理模糊資訊時,才會更適合加入 AI。

更多文章…
20 天學 AI|Day 2| ChatGPT、Claude、Gemini 都要付費嗎?
AI PC,真的只是多一顆 NPU?
AI 真的需要一直連網嗎?
Next PC|怎樣的需要與改變的 PC?一些還在發生中的觀察
下一代 PC 的核心,不再是 GPU,而是 AI 嗎?
跑 Local LLM 先別急著換 CPU… VRAM 才是本地 AI 模型跑不動的主因
從遊戲機到 AI 算力站
產品最大的風險,不是 PM 離職,而是知識沒有留下來…


探索更多來自 YinOnMars 的內容

訂閱即可透過電子郵件收到最新文章。

發表迴響

探索更多來自 YinOnMars 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀