為什麼換更強的大模型,解不了你的問題?LLM 的四個限制與擴增地圖
換更強的 base model 是極少數巨頭的賽道,一般公司施力點在另一條軸:擴增 LLM(augmenting LLM)。這篇拆解大模型的四個工程限制,包括知名的 lost in the middle,並給出 Prompt、RAG、Fine-tuning 三招的擴增地圖。
很多團隊第一次把大型語言模型(large language model,簡稱 LLM,一種讀過海量文字、會預測下一個字的模型)接進產品,遇到答錯時的第一個反應幾乎都一樣:是不是模型不夠強?於是把背後的模型從上一代換到最新一代,等成本帳單漲了一截,再回頭看那幾個原本答錯的問題,發現它們大多還是錯的。
這個現象值得停下來想清楚。模型確實變強了,推理、寫程式、考試分數都往上跳,可是你那幾個問題沒被解決。原因不在新模型不夠聰明,而在你撞到的根本就不是「聰明程度」這條軸。
把 LLM 的能力想成一張二維的圖會清楚很多。橫軸是更強的 base model(基礎模型,也就是訓練好、還沒被你加工過的原廠模型)。這裡要先分清兩件常被混為一談的事:訓練一顆 frontier 等級的 base model,是 OpenAI、Anthropic、Google 這種公司的事,動輒燒掉以億美元計的算力與資本,一般公司不在這條賽道上;至於切換去用一顆更強的 API 模型,誰都做得到,但這只是把同一條橫軸往右挪,挪不到縱軸去。縱軸才是開發者真正能施力的地方:在現有模型之上疊各種工程技術,讓它在你的場景裡更有用,這件事有一個名字,叫做擴增 LLM(augmenting LLM)。
這篇是這個系列的總綱。先把 base model 的四個工程限制講透,讓你看懂為什麼換模型不是萬靈丹,再給你一張擴增地圖,把 Prompt、RAG、Fine-tuning 三招放進正確的位置。系列後續每篇各自深挖一招,這篇先讓你看懂整片地形。
我們在客戶現場,最常被換模型這個念頭擋住
91APP CDMP 團隊每天在零售品牌的真實資料裡跑 AI 應用,從客服問答、會員分群解讀到報表生成,踩過的坑大多無關模型笨不笨,問題出在模型對你的世界一無所知。
客戶常問:你們用的是不是最新最貴的模型?言下之意是只要模型夠強,問題就會消失。我們得花力氣解釋,答錯品牌專屬的活動規則或會員權益,跟模型的智商無關,問題出在它沒讀過這家品牌的那份文件;換顆更貴的腦袋,它依然沒讀過。
我們在乎這題,因為它直接決定一個專案的成敗。看懂限制在哪,才知道錢該花在換模型還是擴增。這篇就把這份判斷力用基礎觀念整理給同樣在現場的你。

大模型的限制可以拆成兩種:能力不足,還是工程錯位
先做一個重要的切分。模型答不好,原因落在兩個不同的桶子裡。
- 能力不足:題目需要的推理、邏輯、語言理解,模型真的做不到。這種情況換更強的 base model 確實有用。
- 工程錯位:模型有能力,但你沒把它需要的東西交到它手上,或對它的輸出有它天生給不了的要求。這種情況換模型多半沒用,因為你撞的是這類模型的結構性限制,不是某一顆模型的個體差異。
我們在企業落地中常見的「換了新模型還是錯」,多數落在第二桶。下面四個限制都屬於第二桶,是 base model 這類模型大致共有的工程限制,不是某一家廠商沒做好。更強的模型確實可能把幻覺率、長文取用、指令遵循做得更好,但它無法憑空生出你的私有資料,也無法替你做掉檢索與驗證。
| 限制 | 一句話本質 |
|---|---|
| 缺領域知識 | 它沒讀過你公司的內部文件 |
| 資訊落後 | 它的知識停在某個過去的時間點 |
| 輸出機率性 | 同一個問題問兩次,答案可能不一樣 |
| 迷失在中間 | 細節埋在長文中段時,它可能找不到 |
接下來把這四個限制各自從基礎觀念講清楚,包含為什麼會這樣,以及它對你的業務代表什麼風險。

同一份退貨政策,模型只讀過別人的版本
先用一個情境把前兩個限制放在一起看,它們常被混為一談,其實是兩件事。
情境是這樣:你做一個客服機器人,回答「這件商品七天內可以退嗎?」。你換了市面上最強的模型,它回答得頭頭是道,引用一堆消費者保護的通則,聽起來很專業,但對你這家品牌完全錯誤,因為你們的政策是十四天、特定品類不退。這裡同時踩到兩個限制。
第一個是缺領域知識。base model 的知識來自訓練時餵進去的語料:公開網頁、書籍、論壇,加上授權與人工整理的資料,但它從沒看過你公司內部那份退貨政策文件,只能用讀過的「別人家版本」來回答。模型再強,也變不出它沒讀過的事實。這是知識廣度的問題:你的私有世界不在它的訓練資料裡。
這也是為什麼許多 AI 行銷專案明明用了頂級模型卻產出錯誤結果,源頭往往在缺乏可被模型取用的私有資料(AI 行銷為什麼失敗:數據品質與 CDMP 整合)。
第二個是資訊落後。base model 通常有一個知識截止時間(knowledge cutoff),也就是訓練資料大致收集到哪一段時間就停了;模型不是即時連網的資料庫,重新訓練成本高、頻率低,所以即使是公開資訊,只要發生在截止時間之後,它也不一定知道(Wikipedia, Knowledge cutoff, 2025)。值得補一句:學界研究發現「實際生效的截止時間」常和官方宣稱的不一致,且因主題而異,因為訓練語料裡混雜了不同時期、重複去重不乾淨的資料(Cheng et al., Dated Data: Tracing Knowledge Cutoffs in Large Language Models, arXiv 2403.12958, 2024)。一個常見的例子是政治職位:選舉換了人,模型卻可能很有把握地告訴你舊的那位還在任,因為在它的世界裡時間就停在那裡。
把這兩個限制疊起來看:那個退貨問題答錯,跟模型聰不聰明無關。它缺的是「你家政策」這份私有且即時的資料,而換更強的 base model,換來的還是一顆沒讀過你家政策、知識停在過去某一段時間的腦袋。
這也是為什麼後面會講到的檢索增強技術(RAG),做的事情是在回答的當下,把正確的那份文件放到模型眼前,讓它根據這份證據作答,而不是靠它記得。
表象是答非所問,機制是它在丟一顆加權的骰子
第三個限制最反直覺,也最容易在嚴謹場景出事:輸出是機率性的。同一個 prompt(你給模型的提示或指令)問兩次,可能得到兩個不一樣的答案。很多人第一次遇到會以為是 bug,其實這是 LLM 運作方式的核心。要看懂它,得先看懂模型到底在做什麼。
LLM 是一台「預測下一個字」的機器。你給它一段文字,它估算「下一個字最可能是什麼」,估出來的是整個字彙表上的一組機率分佈,並非直接給一個標準答案。比方說接在「天空是」後面,「藍色」機率很高,「綠色」機率很低,但不是零。
關鍵的下一步叫採樣(sampling)。模型不一定每次都挑機率最高的字,而是按機率分佈去抽。控制這個抽法多隨機的旋鈕叫溫度(temperature):溫度低,模型傾向每次都挑最可能的字,輸出穩定保守;溫度高,模型更願意抽機率沒那麼高的字,更有創意,也更容易偏離事實。在 OpenAI 的 Chat Completions API 裡,這個參數的範圍是 0 到 2,預設值是 1(部分新一代推理模型只支援預設值,不開放調整)(OpenAI, API Reference: create chat completion, 2025)。一個直覺比喻:溫度就是決定要讓骰子多「聽話」,越高越放飛。
所以「同一問題答案不一樣」,機制上就是每次重新丟一顆加權的骰子。這在寫行銷文案、發想點子時是優點,給你多樣性;但在客服退費、金額計算、合規回覆這種要求每次都一致、都正確的場景就是災難,你沒辦法跟客戶解釋為什麼同一問題系統昨天說可退、今天說不可退。
這裡要補一個常被誤會的觀念:把溫度調到最低、讓輸出穩定,並不代表讓它變正確。模型可以很有把握地、穩定地給你一個錯誤答案,因為錯誤的根源可能在它的訓練資料本來就不含正確資訊(也就是前面講的知識截止)。溫度只控制隨機性,不控制真假(Coursera, What Is OpenAI Temperature, 2025)。
更深一層,OpenAI 自己的研究把「為什麼模型會一本正經地胡說」追溯到兩個環節:在預訓練階段,這種生成錯誤跟一般監督式學習裡的分類錯誤同源,統計上會自然產生;在後續的評測與後訓練階段,若用二元的對錯獎勵,等於鼓勵模型在不確定時也去「猜一個」,而不是承認不知道,因為猜對有分、承認不知道沒分(OpenAI, Why Language Models Hallucinate, 2025)。這就是業界說的幻覺(hallucination,模型自信地產生看似合理卻不正確的內容)的來源之一。
換更強的 base model 能改善幻覺嗎?某種程度可以,但機率性是這類模型的結構特性,換顆腦袋不會讓它消失。要在嚴謹場景把輸出控制住,靠的是工程:把溫度壓低、用 RAG 把事實證據釘進去、加上輸出格式約束與驗證,而非寄望下一代模型自動變乖。
上下文視窗很大,不代表中間那段讀得進去
第四個限制有一個很傳神的名字,叫做迷失在中間(lost in the middle)。要懂它,得先懂一個基礎名詞:上下文視窗(context window)。

上下文視窗指模型生成回答時,一次能參考的所有文字總量,包含你給的提示、貼進去的資料、對話歷史,以及它正在生成的回答本身。Anthropic 官方文件把它形容成模型的「工作記憶」,它跟模型訓練時讀過的龐大語料是兩回事:訓練語料可以理解成長期記憶,上下文視窗則是這一次對話能攤在桌上的東西(Anthropic, Context windows, 2025)。容量單位是 token(權杖,模型處理文字的最小單位,大致是一個詞或詞的一部分)。
這幾年上下文視窗膨脹得很快,從早期幾千 token 一路到二十萬、甚至一百萬 token,等於可一次塞進好幾百頁文件。直覺上你會以為視窗夠大、把整本手冊貼進去,模型就能精準引用任何一段。實務上沒這麼順利。
2023 年史丹佛等機構的一篇論文做了一個很乾淨的實驗:把同一個關鍵答案放在一長串文件的不同位置,看模型找不找得到。結果是一條 U 形曲線:答案放在開頭或結尾時表現最好,一旦埋進中段就明顯掉下來,連號稱支援長上下文的模型也出現同樣趨勢。這篇論文叫 Lost in the Middle,後來發表在 TACL 期刊(Liu et al., Lost in the Middle: How Language Models Use Long Contexts, arXiv 2307.03172, 2023 / TACL 2024)。
業界還有個更白話的測試法叫大海撈針(needle in a haystack):在一大段不相干的文字裡藏一句特定的話,再問模型那句話的內容,檢驗它在超長上下文裡能不能撈到正確的針。lost in the middle 講的就是這根針一旦落在中段,常常撈不起來。
為什麼會這樣?學界目前認為跟幾個因素有關,例如位置編碼、訓練資料的分佈、任務形式,以及注意力在長序列上被稀釋,並非單一原因就能解釋。可以確定的是,模型讀長文時並非均勻地對每個字投注注意力,開頭與結尾通常比較吃得到。Anthropic 在談上下文工程時也直接點出,隨著塞進去的 token 變多,準確度與召回會下降,他們稱為脈絡腐化(context rot),所以該被在乎的不只是視窗有多大,更是你把什麼東西放進去、放在哪個位置(Anthropic, Effective context engineering for AI agents, 2025)。
這對業務的意思很實際:把整本五百頁的操作手冊一次倒給模型,期待它精準回答第兩百八十頁某個角落的細節,是不可靠的做法。比較可靠的是先用檢索把最相關的那幾段撈出來,只放進上下文,讓針一直待在開頭或結尾。這又指回 RAG,它不只補知識,也在替模型整理桌面。
表象到底層:釐清知識、控制與取用三層限制
把四個限制收攏一下,它們其實在問你三個不同層次的問題。
- 知識層:缺領域知識、資訊落後。模型不知道你的私有事實,也不知道截止時間之後的事。問的是「它手上有沒有正確資料」。
- 控制層:輸出機率性。模型給得出答案,但你控制不了它每次都一致、都正確。問的是「它的輸出收不收得住」。
- 取用層:迷失在中間。資料就在上下文裡,但模型不一定撈得到對的那段。問的是「就算資料在桌上,它讀不讀得到」。
換更強的 base model 主要改善的是「聰明程度」,也就是推理與語言能力,對這三層的幫助有上限,因為這三層的本質是工程問題,不是智商問題。模型再聰明,也無法憑空取得它沒有的私有與即時資料,也無法替你做掉檢索、驗證與系統設計。看懂這個分層,你才知道下一筆預算該往哪放。
擴增地圖:Prompt 穩控輸出、RAG 補足知識、微調定型行為
回到一開始那張二維圖。橫軸換 base model 不是你的賽道,縱軸擴增 LLM 才是。工具箱裡主要有三招,分別對應上面的不同層。

- 提示詞工程(prompt engineering)。透過設計給模型的指令、範例、輸出格式要求來引導它的行為。成本最低、最快能動手,主攻控制層:用清楚的指令與格式約束讓輸出更穩、更可預測。天花板也明確,提示詞給不了模型它本來就沒有的私有知識。
- 檢索增強生成(RAG,retrieval-augmented generation)。在模型回答之前,先從你的資料庫或文件庫裡,把跟這個問題最相關的內容檢索出來,連同問題一起餵給模型,讓它根據這份即時撈出的證據作答。RAG 主攻知識層與取用層:補上私有與最新資訊,又因為只把最相關的片段放進上下文,順手緩解了迷失在中間。要注意這個緩解有前提,檢索品質、片段切分、排序都要做對,否則把錯片段或太多片段塞回上下文,反而幫倒忙。這個詞與架構出自 2020 年 Lewis 等人的論文,核心是把模型的參數記憶跟一個可隨時更新的外部知識庫結合,產出更具體、更有事實依據的回答(Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv 2005.11401, 2020 / NeurIPS 2020)。在私有知識與即時資料為主的企業場景,RAG 通常是性價比最高的一招,尤其在零售這種商品、活動、會員狀態天天變動的領域,模型必須在回答當下看到最新那份資料才有用(Agentic Commerce 資料困局:CDP 升級成 CDMP)。
- 微調(fine-tuning)。拿一顆預訓練好的模型,用你整理的範例資料再訓練一輪,把特定任務的風格、術語、行為固化進模型參數裡。一個常被引用的比喻:RAG 像開書考,臨場翻書找答案;fine-tuning 像把書唸進腦袋,閉卷憑記憶作答(DeepLearning.AI Community, RAG vs Fine-Tuning, 2024)。微調能改變語氣與專長,適合相對穩定的領域語言、分類邊界與輸出風格;但成本高、需要標註資料,且學進去的是訓練當下的靜態快照,資料一變又得重訓,所以它不適合用來灌高頻變動的「最新事實」。
這三招對應的不只是前面那三層問題,微調補的「行為層」(語氣、術語、任務專長)是另外加的一個維度,知識、控制、取用三層談的是模型有沒有料、收不收得住、撈不撈得到,行為層談的是模型講話的方式像不像你要的樣子。把三招放回地圖:
| 擴增招式 | 主要補哪一層 |
|---|---|
| 提示詞工程 | 控制層:讓輸出更穩、更可預測 |
| RAG | 知識層+取用層:補私有與即時資料、撈對片段 |
| 微調 | 行為層:固化風格、術語與任務專長 |
這三招不是互斥的選擇題,成熟的系統常常三招並用:用 RAG 把對的事實放進來,用提示詞把輸出收住,必要時再用微調把語氣與專長定型。系列接下來會一招一招深挖,這篇先讓你拿到地圖。
動手前先問自己的判斷清單
在掏錢換模型或開工擴增之前,這幾個問題能幫你少走冤枉路。
- 先分桶:這個答錯是能力不足還是工程錯位?是後者就先別碰換模型。
- 問知識在不在:答錯的那個事實是你的私有資料或截止時間之後的新資訊嗎?是的話,方向是 RAG。
- 問穩不穩:同一問題多問幾次答案會飄嗎?會的話,先壓低溫度、加上格式約束與驗證,這是提示詞工程的活。
- 問撈不撈得到:你是不是把一大份文件整包倒給模型?是的話先做檢索,只放最相關片段,把關鍵資訊留在開頭或結尾。
- 最後才問智商:上面四關都過了還是錯,這時才輪到考慮換更強的 base model,因為這才真是推理能力的問題。
- 別把微調當補知識的捷徑:灌新事實用 RAG,定風格與專長才用微調,別拿錯工具。
舉個落地的例子。91APP CDMP 團隊替零售品牌做客服與會員問答時,幾乎不會把賭注押在「換更強的模型」上,而是先把退貨政策、活動規則、會員權益這些私有文件用 RAG 接進來,讓模型回答的當下就看著正確的那份文件;再用提示詞把輸出格式與語氣收住,把溫度壓到適合嚴謹場景的範圍。同一筆預算花在擴增,比花在升級模型,命中率高得多。判斷邏輯很樸素:先認清限制落在哪一層,再把錢放對地方(延伸可參考 AI agent 的數據底座)。
換模型解的是聰明,擴增解的是有用
回到最開頭那個場景。換更強的 base model 之後,那幾個問題還是錯,現在你知道原因了:你撞到的不是聰明這條軸,問題出在知識、控制、取用這三層工程限制,它們落在 base model 升級的能力範圍之外。
base model 負責讓模型更聰明,這是少數巨頭的賽道;擴增 LLM 負責讓模型在你的場景裡真的有用,這才是企業能施力、也該施力的地方。Prompt、RAG、Fine-tuning 就是這條軸上的三把工具,分別補在控制、知識取用、行為這三個位置。
下一次再想「是不是該換個更強的模型」,先把判斷清單跑一遍。多數時候你會發現,該升級的是你接模型的方式,模型本身往往不是瓶頸。
常見問題 FAQ
問:擴增 LLM(augmenting LLM)到底是什麼意思? 答:指的是不換底層模型,而在現有 base model 之上疊工程技術,讓它在你的場景裡更有用,主要手段有提示詞工程、RAG、微調三招。對一般公司來說這是真正能施力的地方,因為訓練更強的 base model 需要極大資本,是少數巨頭的賽道。
問:為什麼換更強的大模型,常常解不了原本的問題? 答:因為多數問題撞到的並非模型的聰明程度,而是知識、控制、取用這三層工程限制。模型沒讀過你的私有文件、知識停在過去某段時間、輸出帶有隨機性、長文中段的細節撈不到,這些都不是換顆更強的腦袋能完全解決的,要靠擴增工程處理。
問:LLM 的四個主要限制是什麼? 答:1. 缺領域知識,沒讀過你公司內部文件;2. 資訊落後,知識停在訓練截止時間;3. 輸出機率性,同一問題兩次結果可能不同;4. 迷失在中間(lost in the middle),細節埋在長文中段時可能找不到。前兩個是知識問題,第三個是控制問題,第四個是取用問題。
問:lost in the middle 是什麼?上下文視窗很大不就沒事了嗎? 答:lost in the middle 指的是當關鍵資訊埋在一長段文字的中段時,模型常常找不到它,表現呈 U 形曲線,開頭與結尾最好、中段最差。上下文視窗就算大到一百萬 token,這個問題仍可能發生,實際表現要靠測試確認。這個現象出自 2023 年的 Lost in the Middle 論文。實務解法是先檢索出最相關的片段,把關鍵資訊放在開頭或結尾,而不是整包文件倒進去。
問:context window(上下文視窗)和模型的訓練資料有什麼不同? 答:上下文視窗是模型這一次對話能參考的所有文字總量,包含你的提示、貼進去的資料、對話歷史與正在生成的回答,可以理解成工作記憶。訓練資料則是模型當初讀過、固化在參數裡的龐大語料,可以理解成長期記憶。你能在當下塞東西進上下文視窗,但改不了訓練資料;要注意參數不是資料庫,模型不一定能可靠回憶訓練資料裡的任意細節。
問:為什麼同一個問題問兩次,模型的答案會不一樣? 答:因為 LLM 的輸出是機率性的。模型預測的是下一個字的機率分佈,再透過採樣去抽,控制隨機程度的旋鈕叫溫度(temperature)。溫度高,答案更多樣也更容易偏離;溫度低,答案更穩定。要注意溫度低只代表穩定,不代表正確,事實對錯由模型手上有沒有正確資料決定。
問:補充私有知識,該用 RAG 還是微調(fine-tuning)? 答:要補事實、特別是會變動或最新的資訊,用 RAG,因為它在回答當下即時撈外部資料,更新只要改資料庫。微調是把風格、術語、行為固化進模型參數,適合定調語氣與專長,但學的是靜態快照,不適合灌最新事實,成本也較高。一句比喻:RAG 是開書考,微調是把書背進腦袋閉卷考。
這篇是系列的起點。想深入三條擴增路線,可以接著看 該微調,還是該做 RAG 拆解知識與行為的抉擇、提示詞工程不是寫咒語 談最便宜的第一步,以及 用經理人思維設計 AI 工作流 看這些元件怎麼組成系統。
延伸閱讀
- 當每個品牌都用得到 AI,差距在哪:當 base model 變成人人可取得的水電,真正拉開差距的就是擴增工程與你手上的私有資料。
- 用 RAG x LLM 強化客戶成功服務:把本文講的 RAG 觀念放進真實客服與客戶成功場景的落地版本。
- 破解 AI 神話:MCP 報表到 RAG 的陷阱、人機協作:擴增不是萬靈丹,這篇談 RAG 與自動化常見的陷阱,以及人該守在哪一段。