提示詞工程不是寫咒語:鋸齒邊界、人機協作與 Prompt Chaining
提示詞工程(prompt engineering)不是寫咒語,也不是專屬職業,而是工程師的基本功。本文從 BCG 與哈佛的鋸齒邊界研究談起,拆解半人馬與生化人兩種人機協作模式、提示詞黃金三要素,再深入 Prompt Chaining 提示詞串聯與 Chain-of-Thought 的底層差異,講清楚為什麼把任務拆開能換來可觀察性與可獨立 debug。
有一個現象,看過 BCG 那份研究的人都會記得:同樣一群頂尖顧問,同樣一個 AI 工具,在某一類任務上品質評分提高四成以上、速度快了約四分之一,在另一類任務上卻被 AI 拖累,最後做得比完全不用 AI 還差。差別不在工具強不強,而在任務落在哪一邊。
更弔詭的是,當事人往往不知道自己正落在壞的那一邊。研究者用近似「在方向盤前打瞌睡」的比喻,形容人類過度信任 AI 而放棄檢查:AI 給出一個看起來很合理、語氣很篤定的答案,人就放鬆了,直接採用,連檢查都省了。問題是這個答案剛好是 AI 不擅長領域裡編出來的,似是而非。等於閉著眼睛踩油門。
當 AI 在能力邊界外瞎掰時,單靠修改指令的語氣或句型是救不回來的。這就是為什麼把提示詞工程(prompt engineering,簡單說就是「怎麼把指令寫好讓 AI 做對事」)當成寫咒語,是個危險的比喻。很多人以為背幾個神奇句型就能召喚出好結果,這篇文章想處理的,就是這個落差為什麼會發生,以及一個工程師可以怎麼系統性地避開它。把咒語的隱喻換掉,才是起點。
這題對每天跟 LLM 共事的團隊都成立
91APP 團隊每天都在跟這條邊界打交道。日常工作裡有大量任務正在交給 LLM(大型語言模型,能讀懂自然語言並生成文字的 AI):寫客服回信、整理顧客分群邏輯、把訂單資料摘要成可讀的報告、生成行銷文案的初稿。這些任務有的 AI 做得漂亮,有的一碰就出錯,所以我們在乎的是一件很具體的事:怎麼判斷一個任務該不該交給 AI、交了之後怎麼接手。提示詞工程在我們看來是每個要跟 AI 共事的人都該會的基本功,像工程師的九九乘法表,而不是某個職位的專利。
邊界、分工、結構是三個遞進的問題
要把這題講透,得先把它拆開。整篇文章在回答三個遞進的問題,後面每一段對應其中一層。
- 邊界問題:AI 在哪些任務強、哪些任務弱,這條邊界長什麼樣,為什麼人會誤判。
- 分工問題:認清邊界之後,人跟 AI 該怎麼分工,是把活全丟出去,還是高頻來回協作。
- 結構問題:當一個任務複雜到單一指令處理不了,要怎麼把它拆成可控、可測、可除錯的結構。
這三層分別是認知、模式、工程。多數人停在認知層,聽過「AI 有強有弱」就以為懂了,但真正能用起來的價值在工程層。如果你關心這套思路在資料層面的延伸,我們另外寫過 Agentic Commerce 資料困局:CDP 升級成 CDMP,談的是邊界判斷之外,資料底座如何決定 AI 能不能用。
協作位置決定品質,用一封客訴信對照三種介入程度
用一個我們很熟的情境來對照:處理一封顧客抱怨信,目標是產出一封得體的回信。同一封信,可以有三種不同的介入程度。
- 一句話整包丟出去。指令是「這是顧客抱怨信,幫我寫一封回信。」AI 會給你一封回信,通常通順,但你很難說它好不好,因為它把「讀懂抱怨、判斷該怎麼回、寫成文字」三件事在一個黑箱裡一次做完。哪一步出錯,你看不出來。
- 強項區但不盲信,每一步都在場。這封信落在 AI 的強項區,你先讓 AI 抽出顧客真正在不滿什麼,自己看過確認沒抽錯,再讓它擬回信大綱,你調整方向,最後才讓它寫成完整回信。
- 弱項區,規則判斷收回人手。這封信牽涉退款金額與政策判斷,AI 對你們的退款規則一知半解,讓它寫初稿等於請它在不熟的路上開快車。正確做法是規則判斷由人來,AI 只負責把人定好的結論潤成得體的文字。
同一個任務,三種做法的差別不在 prompt 寫得漂不漂亮,在於你有沒有先判斷它落在邊界哪一側,以及你選擇站在哪個位置接手。這就帶出接下來要深挖的兩件事:邊界本身,跟協作的位置。
鋸齒邊界:為什麼 AI 的能力不是一條平滑的線

直覺上,我們會以為 AI 的能力像一道牆:牆內的任務它都會,牆外的都不會,難度越高越靠牆外。如果真是這樣,事情好辦,照難度排序就能判斷。
實際不是。BCG 與哈佛商學院等機構在 2023 年找了 758 位 BCG 顧問做的實驗發現,AI 的能力邊界是鋸齒狀的(jagged frontier,字面意思就是「參差不齊的邊界」)。看起來難度相近的兩個任務,一個落在邊界內 AI 大幅加分,另一個落在邊界外 AI 反而幫倒忙,而且你光看任務表面分不出來哪個在哪邊。研究數據顯示,落在邊界內的任務,顧問用 GPT-4 後完成量增加約一成、速度快了約四分之一、品質評分高了四成以上;但落在邊界外、包含隱藏限制或模型容易誤判關鍵條件的商業判斷題,AI 經常產出聽起來可信卻是錯的內容(Dell'Acqua 等人,《Navigating the Jagged Technological Frontier》,哈佛商學院工作論文 24-013,2023;完整 PDF 由 MIT Sloan 釋出)。
為什麼會鋸齒?一個可能的原因在 LLM 的學習方式。它主要從海量語料裡學到統計與語義模式,也就是「什麼字後面最可能接什麼字」這類規律。一個任務如果在訓練資料裡有大量相似範例,模式就紮實,AI 表現好;如果任務需要的是即時、私有、罕見或高度結構化的資訊,模式就稀薄,AI 只能用流暢但不可靠的方式補齊,湊出來的東西語氣一樣篤定,內容卻站不住腳。這就是所謂的幻覺(hallucination,指 AI 自信地產出錯誤資訊)。鋸齒邊界本身是實驗觀察到的結果,任務形式、評分標準、可用工具都會一起影響它的形狀,不是單一原因能說盡。
關鍵在於:AI 的篤定程度跟它的正確程度是脫鉤的。它在弱項區的語氣,跟在強項區的語氣一模一樣。這正是「在方向盤前打瞌睡」的成因。人類習慣用對方的自信來推測對方的把握,但這個習慣對 AI 完全失效。研究者特別點出,那些最盲目信任 AI 的人,在邊界外任務的表現掉得最慘,因為他們把 AI 的流暢誤當成可靠。
所以提示詞工程的第一課,不是學句型,是學會問一個問題:這個任務,落在邊界的哪一邊?這個判斷沒有公式,只能靠對自己領域的理解,加上對 AI 過往表現的觀察。這也是為什麼我們說它是基本功而非職業,因為判斷邊界的能力說到底就是你對自己工作的理解,無法外包。
半人馬與生化人,依任務屬性選擇委派或高頻協作

認清邊界是參差的,下一個問題就是怎麼跟 AI 分工。研究者借用了兩個形象的詞,這裡把研究中的行為模式轉譯成日常可操作的兩種介入方式。
- 半人馬(Centaur),上半身是人下半身是馬,人馬之間有一條清楚的界線。對應的協作模式是委派:把一整段邊界內、流程清楚、會重複的任務,寫一個夠完整的長 prompt 整包丟給 AI,人只在開頭給指令、結尾收成果。適合那種你已經很確定 AI 做得來、而且要做很多次的活,例如把固定格式的訂單資料批次轉成摘要。
- 生化人(Cyborg),人和機器交織在一起,沒有清楚界線。對應的是高頻來回協作:你丟一句、AI 回一句、你根據它的回應再調整下一句,像在跟人對話一樣密集互動。適合需要判斷、需要創意、答案不只一個的活,例如想行銷活動的切角、釐清一個模糊的分析方向。
這兩種模式沒有高下,選錯才有代價。把該高頻協作的創意任務用委派模式整包丟出去,你會得到一個平庸的黑箱結果;把該委派的重複任務用生化人模式一句句陪著做,你會累死自己且毫無效率。判斷依據還是回到邊界:任務越落在 AI 強項、流程越固定、重複次數越多,越往半人馬靠;任務越需要人的判斷、越一次性、越要創意,越往生化人靠。
Anthropic 在它的官方指南裡有個比喻很貼切:把對 AI 下指令想成在指導一個絕頂聰明、但對你的專案毫無背景知識的新人,你講得越清楚,他表現越好(Anthropic,《Be clear, direct, and detailed》,Claude 官方文件)。半人馬模式就是把交辦事項一次寫到位的新人指派單,生化人模式則是手把手帶著新人邊做邊修。
對象、格式、重點,一個能用的 prompt 不讓 AI 平均用力

不管哪種模式,一個 prompt 要能用,有三個東西不能少。這不是什麼祕訣,是把「指導新人」這件事翻成具體欄位。
- 對象:這段內容要給誰看。給工程師看跟給門市店長看,用詞、深度、舉例完全不同。不講對象,AI 只能猜一個最大公約數,結果誰都不貼。
- 產出格式:你要的是一段話、一張表、三個選項、還是一封信。格式講清楚,AI 才不會給你一坨需要二次加工的東西。
- 重點:這次最在意什麼。是要簡潔、要說服力、要避開某些字眼,還是要某個結論先講。不給重點,AI 會平均用力,等於沒重點。
OpenAI 的官方指南把同一件事講成「寫清楚的指令」,並強調比起列一堆「不要做什麼」,直接講「要做什麼」效果更好,因為模型對正向、具體的指示反應更好(OpenAI,《Prompt engineering》,OpenAI Platform 文件)。三要素的價值在於它把「寫清楚」這個抽象要求,變成一個你每次都能照著檢查的清單。寫完一個 prompt,回頭問自己對象、格式、重點齊了沒,缺哪個補哪個,比背任何句型都管用。三要素是入門框架;當 prompt 進入自動化或高風險流程,還要補上資料來源、限制條件與驗收標準,這些欄位的精神跟三要素一致,都是把模糊的期待變成明確的指示。
Prompt Chaining:把一個大任務拆成一條鏈

三要素能讓單一指令變清楚,但有些任務不是把指令寫清楚就能解決的,它本身就太複雜,塞進一個 prompt 會讓 AI 顧此失彼。這時要動用的,是提示詞工程裡比較進階的一招:Prompt Chaining,提示詞串聯。
它的做法很單純:把一個複雜任務拆成幾個獨立的小 prompt,前一個的輸出,當成後一個的輸入,像接力一樣一棒交一棒。
回到那封客訴信。不串聯的做法是丟一句指令把整封信寫完。串聯的做法是拆成三棒接力:
- 抽重點:只做一件事,從顧客的信裡抽出他真正在抱怨的重點。
- 擬大綱:拿上一棒抽出的重點當輸入,寫出一封回信的大綱。
- 展開成文:拿上一棒的大綱當輸入,展開成完整的回信。
每一棒的 prompt 都只負責一件清楚的事,AI 在每一棒都能全神貫注,不會像在單一巨型 prompt 裡那樣中途漏掉步驟。Anthropic 的官方文件直接點出這個好處:當一個 prompt 要處理所有事情,模型容易漏掉其中的步驟;把任務拆成聚焦的子任務串成一條鏈,每一環都能拿到模型的全部注意力(Anthropic,《Chain complex prompts for stronger performance》,Claude 官方文件)。
Prompt Chaining 不是 Chain-of-Thought:一個常被搞混的差別
這裡要停下來釐清一個很多人混淆的點,因為兩個詞長得像,意思卻不同。
Chain-of-Thought(思維鏈,常縮寫 CoT)是 Wei 等人在 2022 年提出的技巧,做法是在一個 prompt 裡引導模型把推理過程一步步寫出來,而不是直接跳到答案。例如解一道數學題,叫它先寫「先算這個、再算那個、所以答案是」,而不是只給最後的數字。論文證明,光是讓模型把中間步驟攤開來寫,在算術、常識、符號推理這幾類任務上的正確率就大幅提升(Wei 等人,《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,arXiv:2201.11903,2022)。
兩者的根本差別在這裡。Chain-of-Thought 是在單次生成裡要求模型輸出中間推理步驟,這些步驟有助於引導出更好的答案,但它們是輸出的一部分,不應視為模型內部推理的完整紀錄。也因為這些步驟通常包在同一次生成裡,缺少系統化的外部斷點,你很難在中途停下、單獨改掉某一步、再接著跑。它是一條連在一起的思路。
Prompt Chaining 是多次呼叫,每一步是一個獨立的 prompt、一次獨立的生成,斷點被設計成流程本身。前一步的輸出會以文字形式落地,你可以把它存下來、檢查、甚至手動改掉,再餵給下一步。它是好幾條分開的指令被你串起來。
用一句話分辨:思維鏈是讓 AI 在一口氣裡把思路講出來,提示詞串聯是讓你在每一步之間插得進手。前者改善的是單次回答的推理品質,後者改善的是整個複雜流程的可控程度。兩者可以併用,在串聯的某一棒裡,那一棒的 prompt 內部也可以要求思維鏈。
為什麼拆開反而更可靠:可觀察性與可獨立 debug
到這裡可能會有個疑問:把一個任務拆成三棒,呼叫三次,不是更麻煩、更慢嗎?為什麼值得?
值得的理由是兩個工程上的詞:可觀察性(observability,指你能看見系統內部每一步發生了什麼)與可獨立除錯(debug)。
先講可觀察性。在單一巨型 prompt 的做法裡,輸入進去、回信出來,中間發生什麼通常是個黑箱。如果回信寫歪了,你不容易判斷是 AI 沒讀懂抱怨、還是大綱抓錯方向、還是文字本身的問題,往往只能整個重寫 prompt 碰運氣。在串聯的做法裡,每一棒的輸出都攤在你面前:抽重點那棒對不對、擬大綱那棒合不合理、展開成文那棒到不到位,一眼就能定位問題出在第幾棒。系統從黑箱變成透明管線。
再講可獨立 debug。因為每一棒是獨立的 prompt,你可以單獨拿一棒出來測試和修改,不動其他兩棒。發現抽重點那棒老是抓錯,你就只調那一棒的 prompt,反覆測到它穩定為止,其餘兩棒原封不動。這跟寫程式時把一大段函式拆成幾個小函式、每個小函式可以單獨寫單元測試,是完全一樣的工程直覺。Anthropic 的文件也把這點列為串聯的核心好處:拆開後每個中間輸出都能被驗證和除錯,整條流程的可控性與可靠性都提高(Anthropic,《Chain complex prompts for stronger performance》,Claude 官方文件)。OpenAI 的六大策略裡,「把複雜任務拆成簡單子任務」同樣獨立成一條,理由一致(OpenAI,《Prompt engineering》,OpenAI Platform 文件)。
換個角度看,可觀察性與可獨立 debug 是同一件事的一體兩面:因為你看得見每一步(可觀察),所以你才修得動每一步(可 debug)。單一巨型 prompt 也可以靠 structured output、步驟欄位、檢查清單把可觀察性拉高一些,但它的中間輸出沒有外顯成可單獨修改的節點,錯誤定位成本通常高得多。串聯把中間輸出外顯化,於是更容易驗證、回放與單點修正,這就是它在複雜任務上更可靠的來源。
把任務交給 AI 前,先過這六道自問
把前面的原理收斂成可執行的判斷。下次要把一個任務交給 AI,依序問自己這六題:
- 這個任務落在鋸齒邊界的哪一側?如果不確定 AI 在這類任務上的過往表現,低風險任務先用小樣本測試,高風險任務則預設由人主導、AI 輔助。
- 有沒有在方向盤前打瞌睡?AI 給的答案越篤定,越要警覺,篤定不等於正確,尤其在你自己不熟的領域。
- 這該用半人馬還是生化人?流程清楚、會重複、AI 強項,用委派的長 prompt;需要判斷與創意,用高頻來回。
- prompt 的三要素齊了沒?對象、產出格式、重點,缺一個補一個;進入高風險流程再補資料來源與驗收標準。
- 這個任務需要串聯嗎?如果它包含好幾個明顯不同的子步驟,拆成獨立的 prompt 接力,別塞進一個巨型指令。
- 拆開後能不能單獨測每一棒?如果某一棒老出錯,定位到它、只改它、測到穩,不動其他棒。
我們在 91APP CDMP 的客戶成功服務上,就用了這個思路的縮影。當客服要從一份很長的顧客互動紀錄裡找出可回應的重點再生成回覆,我們不會用一句指令硬幹,而是先讓系統抽出相關段落、再據此生成回應,這正是把任務串聯起來、讓每一步可被檢查的做法(延伸可參考我們寫過的用 RAG x LLM 強化客戶成功服務)。重點不在用了什麼花俏技巧,而在每一步都看得見、改得動。
提示詞工程的真相
回到開頭那個落差。同樣的工具,有人用了績效暴漲,有人用了反而更糟,差別從來不在誰背的咒語比較靈,而在誰看得清邊界、選對協作位置、把複雜任務拆成看得見每一步的結構。
提示詞工程不是寫咒語,咒語的隱喻假設有一串神奇字串能讓 AI 變強,這個假設本身就把人放在被動等待的位置。真正的提示詞工程把人放在主動位置:你判斷任務、你選擇分工、你設計流程、你檢查每一步。它更像工程,少像魔法。當每個團隊都用得到同一批 AI 模型,差距不會出現在誰拿到更好的模型,而出現在誰更會把任務拆對、接對、查得到錯(這個主題我們在當每個品牌都用得到 AI,差距在哪裡談得更完整)。這件事學得會,但學的是判斷與結構,不是句型。
常見問題 FAQ
Q1:提示詞工程會是一個專門的職業嗎? 短期內特定產業仍可能有 prompt engineer、AI workflow designer 這類角色,但它未必會長期以單一職稱存在,更可能沉入各種專業裡,變成 AI 協作與領域判斷的一部分。把它當技能練,會比當職位求更實在。
Q2:什麼是鋸齒邊界(jagged frontier)? 指 AI 能力的強弱分界呈參差不齊的形狀,而非一條由難到易的平滑線。看起來難度相近的兩個任務,AI 可能一個做得很好、另一個做得很糟,且光看表面分不出來。BCG 與哈佛 2023 年的研究用這個詞描述這個現象。
Q3:半人馬(Centaur)和生化人(Cyborg)協作哪個比較好? 沒有絕對好壞,看任務。流程清楚、會重複、AI 擅長的任務,適合半人馬式的委派,寫好長 prompt 整包交給 AI。需要判斷、創意、來回打磨的任務,適合生化人式的高頻協作。選錯模式才是真正的代價。
Q4:一個基本的 prompt 至少該包含什麼? 三個要素:對象(給誰看)、產出格式(要什麼形式)、重點(這次最在意什麼)。寫完回頭檢查這三項齊不齊,比記任何句型都實用。
Q5:Prompt Chaining 和 Chain-of-Thought 有什麼不同? Chain-of-Thought 是在一次呼叫裡讓模型把推理步驟攤開寫,改善單次回答的推理品質。Prompt Chaining 是把任務拆成多個獨立 prompt 多次呼叫,前一個輸出當後一個輸入,改善整個複雜流程的可控程度。前者一口氣,後者有斷點,可以併用。
Q6:為什麼把任務拆開反而更可靠? 因為拆開後每一步的輸出都看得見(可觀察性),出錯時能定位到是哪一步,而且每一步是獨立的 prompt,可以單獨測試和修改不影響其他步驟(可獨立 debug)。單一巨型 prompt 是黑箱,這兩件事都做不到。
Q7:要怎麼判斷一個任務該不該交給 AI? 先判斷它落在鋸齒邊界哪一側。如果不確定,先當它在邊界外,由人主導、AI 輔助。同時警惕:AI 答得越篤定,越不代表它越正確,尤其在你自己不熟的領域。
提示詞是最便宜的第一步,但不是全部。當問題是模型不知道你的資料,往 該微調,還是該做 RAG 走;當你要把提示詞、工具與記憶組成會做事的系統,就進到 用經理人思維設計 AI 工作流。整個取捨的全貌見 LLM 的四個限制與擴增地圖。
延伸閱讀
- 破解 AI 神話:MCP 報表到 RAG 的陷阱、人機協作,把本文的人機協作觀念延伸到實際導入時最常踩的陷阱。
- AI agent 的數據底座,談再好的提示詞也救不了壞的資料,AI 應用的地基在哪。
- AI 行銷為什麼失敗:數據品質與 CDMP 整合,從 Gartner 預測看數據品質如何決定 AI 落地成敗。