AI Is Not One Thing: The Difference Between Chatbots, Image Generation, RAG, and Automation
內容目錄
很多人說自己想學 AI,第一件事就是打開 ChatGPT。
問它能不能寫文案、整理會議紀錄、翻譯英文、分析資料,接著看到別人用 AI 畫圖、做影片、做簡報,又開始懷疑:我是不是也該訂閱?是不是少學了什麼?是不是再不跟上就來不及了?
先別急。
現在大家口中的「AI」,其實已經混進很多不同東西。ChatGPT 是 AI、Midjourney 是 AI、把公司 SOP 上傳後讓同事查詢是 AI,自動讀信、整理表單、寄通知也常被叫做 AI。
但它們處理的問題不同,背後需要的技術、資料、成本與風險也不同。
如果一開始沒有分清楚,很容易變成:看見什麼都想學一點,工具帳號開了一堆,最後真正遇到工作問題時,還是不知道該用哪一個。
Day 1 先不教你一長串 Prompt,也不急著比較哪個工具最強。
先把地圖攤開來看。
你以為在學 AI,
可能只是在學怎麼跟 ChatGPT 聊天
ChatGPT 很紅,確實有它的原因。
它能寫、能改、能翻、能整理,也能陪你把一個模糊的想法慢慢說清楚。對多數人來說,第一次感受到 AI 真正進入日常工作,往往就是從這裡開始。
但 ChatGPT 不等於 AI 的全部。
你請 AI 根據產品需求寫一份提案架構,和你請它生成一張產品情境圖,表面上都只是輸入一句話;底下處理的事情卻不一樣。
前者主要在處理文字與語意;後者要處理畫面、構圖、風格、光線、材質,以及物件之間看起來是否合理。
再往後,你希望 AI 能回答「我們公司的保固規範是什麼」,它也不能只靠一般網路知識亂答。它得先在你提供的文件裡找到資料,再根據資料回答。
而當你希望有新表單進來後,自動分類、寫入試算表、通知窗口,這又已經走到流程串接與自動化了。
它們都叫 AI,但不能用同一種期待去看。那AI 有哪些種類….
先看這張 AI 使用地圖
下面這張表不用急著背。它的用途只是幫你先把常見的 AI 應用分開,不要全部都塞進「ChatGPT 很厲害」這一句裡。
| 你想做的事 | 常見 AI 類型 | 常見例子 | 它主要在處理什麼 |
|---|---|---|---|
| 問問題、寫文章、摘要、翻譯、整理想法 | LLM/大型語言模型 | ChatGPT、Claude、Gemini | 文字、語意、對話與內容生成 |
| 生成圖片、改背景、做視覺草圖 | 圖像生成式 AI | Midjourney、DALL·E、Stable Diffusion | 畫面、風格、構圖與影像內容 |
| 看圖片、讀 PDF、聽語音、理解表格 | 多模態 AI | 支援圖片、語音、文件輸入的 AI 工具 | 文字以外的圖片、聲音與文件資訊 |
| 根據公司文件、產品資料回答問題 | RAG/檢索增強生成 | 內部知識庫、客服問答系統 | 先找指定資料,再依資料回答 |
| 自動分類信件、更新表格、寄通知 | 自動化/AI Workflow | Zapier、Make、n8n 等流程工具 | 串接不同系統,按條件執行工作 |
有些產品會把幾種能力包在一起,所以你用起來會覺得「這就是一個 AI」。
例如你可以在同一個聊天視窗裡,請它寫文、看圖片、分析文件,甚至建立一套工作流程。使用介面是一個,但背後通常不是只有一種模型或一種能力。
這也是為什麼,光看工具名稱不夠。先看自己要解決什麼問題,才比較不會花冤枉錢。
ChatGPT、Claude、Gemini:主要是 LLM
ChatGPT、Claude、Gemini 這類工具,核心通常是 LLM(Large Language Model,大型語言模型)。
名字有點長,但你可以先把它想成一個很擅長處理語言的系統。
它可以幫你:
- 將一封語氣太硬的信改得比較自然
- 把一小時會議紀錄整理成待辦事項
- 將英文資料翻成易讀的中文
- 幫你列出企劃初稿、訪談問題或簡報大綱
- 將零散筆記重新整理成有邏輯的內容
- 用不同角度陪你檢查一個想法有沒有漏洞
它很適合處理那些「明明腦中有一些東西,但還沒整理好」的工作。
不過,LLM 有一個很重要的限制:它生成的是看起來合理的文字,不是保證正確的事實。
你問它資料、法規、價格、新聞、產品規格、人物經歷,它可能回答得很流暢,甚至補上看起來很完整的細節。問題是,那些細節不一定真的存在。
所以,LLM 可以幫你整理、起草、推演與找方向;遇到需要精準負責的資訊,仍要回到原始資料確認。
後面 Day 3、Day 4 和 Day 5 會接著談 Prompt、AI 幻覺與查證,因為這些都是使用 LLM 時繞不開的事。
AI 繪圖:它在處理畫面,不是在替你「打字」

很多人第一次接觸 AI 繪圖時,會覺得它很像魔法。
輸入「雨天的台北街角,咖啡店落地窗,暖黃燈光,底片感」,幾秒後就出現幾張像模像樣的畫面。你可以拿它做社群配圖、情境示意、提案草圖、靈感板,或先把腦中的畫面具體化。
這一類通常叫做 圖像生成式 AI。
它和 LLM 都可以接收文字指令,但處理重點不同。LLM 的強項是語言脈絡;圖像生成模型在意的是畫面裡有什麼、東西怎麼擺、風格像不像、光線合不合理。
它適合拿來做前期探索,尤其是這幾種情況:
- 你需要快速找視覺方向
- 你想替文章或簡報補一張概念圖
- 你有一個產品、空間或角色的初步想法
- 你需要大量不同風格的素材草圖
- 你想先和設計師溝通「我大概想像的是這種感覺」
但它不會因此取代設計判斷。
一張圖看起來很精緻,不代表它能直接拿去做品牌主視覺,更不代表適合商業使用。字體可能亂掉,手部或結構細節可能有問題,畫面中的產品也不一定符合真實規格。若牽涉商標、人物肖像、授權或商用用途,也要回頭確認使用平台的條款與素材來源。
AI 繪圖可以很快地幫你把想像畫出來。要不要採用、怎麼修改、是否符合品牌與現實條件,還是人的工作。
AI 看得懂圖片、聲音和文件嗎?是多模態 AI
現在的 AI 不只會處理文字。
你可以上傳一張照片,問它畫面裡有什麼;丟一份 PDF,請它整理重點;放進報表截圖,問數字可能代表什麼;上傳錄音,請它轉成逐字稿和待辦事項。
這些能力通常會被放在 多模態 AI 這個範圍裡。
「多模態」聽起來很技術,其實就是它不只處理一種資料形式。文字、圖片、語音、影片、表格、掃描文件,都可能成為它理解內容的來源。
這會讓很多原本很麻煩的事變得比較快。
比方說,你不必自己先把一張白板照片逐字打出來;你可以請 AI 先辨識內容,再自己校正。你也可以請它先讀一份長報告,列出應該注意的圖表與段落,減少第一輪閱讀的負擔。
但「能看」不等於「看得完全正確」。
模糊的掃描檔、字很小的表格、複雜的工程圖、醫療影像、財務報表,或有很多上下文的法律文件,都可能讓 AI 誤讀、漏掉細節,甚至根據不完整資訊做出過度自信的結論。
它很適合當第一位整理資料的助手,不適合在高風險情境裡成為最後拍板的人。
RAG:讓 AI 先讀你的資料,再回答你的問題
接下來這個名詞,很多人會在公司導入 AI、建立內部知識庫時遇到:RAG。
RAG 的全名是 Retrieval-Augmented Generation,中文常翻成「檢索增強生成」。名字先不用記,你只要理解它想解決的問題:
希望 AI 回答時,不只靠它原本知道的內容,而是先去找你指定的資料。
假設公司有產品規格、保固政策、內部 SOP、客服紀錄、教育訓練教材。若每次有人問問題,都要人工翻文件,久了很花時間。
RAG 的做法,是先把文件整理進可查找的知識庫。當使用者提問時,系統先找出相關段落,再把這些內容交給 AI 組織成回答。
這和把一份 PDF 丟進聊天視窗請它摘要,差別在哪裡?
一次上傳文件,比較像「請 AI 幫我讀這一份資料」;RAG 則更接近「讓系統能持續在一批資料裡找答案」。
如果資料會更新、使用者很多、內容有權限差異,RAG 才會真正開始變得有意義。
不過它也不是把檔案丟進去就結束。文件過期、內容互相矛盾、權限沒有分好、資料沒有來源標示,AI 一樣可能答錯,甚至讓不該看到的人看到不該看的內容。
所以公司在談「做一個內部 AI」時,最該先問的通常不是模型多強,而是:資料品質如何?誰能看?多久更新?回答能不能回到原始來源?
自動化和 AI Workflow
讓事情往下走,而不只是回答你
最後一個常被混淆的,是自動化。
有人填表單後,把資料自動寫進試算表;訂單進來後,自動通知客服;每週固定時間把數據整理後寄到信箱。這些工作即使沒有 AI,也可以靠規則與流程工具完成。
它的邏輯通常很清楚….
發生 A,就執行 B;符合條件 C,就通知 D。
AI 放進來之後,流程會多一層理解與判斷。
例如客服信件進來後,先由 AI 判斷它是退貨、產品問題還是合作邀約,再交給不同窗口;或是每週自動抓取資料後,先由 AI 寫出摘要,再讓負責人確認是否發送。
這類把 AI 放進流程中的做法,常被稱為 AI Workflow。
它有價值的地方,通常不在於「AI 自己會工作」,而是能減少那些每週都在重複複製、貼上、分類、轉寄、提醒的瑣碎工作。
但流程越長,越需要小心。
如果 AI 分錯類別、摘要看錯數字、把客戶資料送到不該去的地方,問題就不只是回答錯一句話而已。導入自動化前,最好先確認:哪些步驟可以自動做?哪些地方一定要人工確認?出錯後誰負責處理?
真正好用的自動化,通常不是最華麗的那一套,而是剛好替你省掉最容易漏、最重複、最浪費時間的工作。
那我現在到底需要哪一種 AI?
如果你還是不確定,可以先用這張表快速判斷。
| 你現在遇到的問題 | 可以先看的方向 |
|---|---|
| 想整理文字、寫初稿、翻譯、摘要、討論想法 | LLM |
| 想做社群配圖、提案情境圖、視覺靈感板 | 圖像生成式 AI |
| 想理解照片、PDF、錄音、報表截圖 | 多模態 AI |
| 想讓團隊問公司規範、產品資料或 SOP | RAG |
| 想減少重複搬資料、分信、寄通知、更新表格 | 自動化或 AI Workflow |
你不需要今天就把全部都學會。
先找到自己最常遇到的一個問題就好。若你每天都在整理文字,先學 LLM;若工作常常需要視覺素材,再研究 AI 繪圖;若團隊真正卡在資料找不到,才去理解 RAG;若大家一直被重複行政流程拖住,才開始看自動化。
工具本身沒有那麼神祕。真正困難的地方,是先看懂問題,再選對工具。
明天,我們會回到大多數人最先碰到的選擇:ChatGPT、Claude、Gemini,到底要不要付費?付費前,又應該先看什麼?
| 如果你的問題是…… | 先從哪一類開始 |
|---|---|
| 我想把一堆文字整理成重點 | LLM |
| 我需要社群圖片、提案視覺或素材草圖 | 圖像生成式 AI |
| 我想問一份 PDF、照片或報表在說什麼 | 多模態 AI |
| 我想讓團隊查公司規範、產品資料或 SOP | RAG |
| 我每週都在重複搬資料、寄信與整理表單 | 自動化/AI Workflow |
常見問題
ChatGPT 是 AI 嗎?
是。ChatGPT 是以大型語言模型為核心的生成式 AI 工具,主要擅長文字理解、對話、內容生成、摘要、翻譯與協助整理想法。
AI 繪圖和 ChatGPT 有什麼差別?
ChatGPT 這類工具主要處理語言;AI 繪圖工具主要根據文字或圖片生成、修改視覺內容。兩者都可能使用文字指令,但處理的資料與成果不同。
RAG 是一種 AI 嗎?
RAG 比較像是一種讓 AI 使用外部資料的方法。它會在回答前先從指定文件或知識庫找資料,再將相關內容交給模型生成回答,常用在公司內部知識庫與客服系統。
自動化一定要用 AI 嗎?
不一定。許多自動化流程只要設定條件與規則就能完成。當流程需要讀懂信件內容、分類文字、產出摘要或處理模糊資訊時,才會更適合加入 AI。
更多文章…
20 天學 AI|Day 2| ChatGPT、Claude、Gemini 都要付費嗎?
AI PC,真的只是多一顆 NPU?
AI 真的需要一直連網嗎?
Next PC|怎樣的需要與改變的 PC?一些還在發生中的觀察
下一代 PC 的核心,不再是 GPU,而是 AI 嗎?
跑 Local LLM 先別急著換 CPU… VRAM 才是本地 AI 模型跑不動的主因
從遊戲機到 AI 算力站
產品最大的風險,不是 PM 離職,而是知識沒有留下來…

發表迴響