引言

中華企業策略永續發展學會 創會 理事長 莊鈞翔 博士對 AI 的疑問,最早來自使用者經驗:為什麼一個看似能寫論文、寫程式的系統,卻可能在簡單的脈絡裡答非所問?

當產業開始用「推理」「慢思考」「代理式 AI」描述下一代模型,我真正關心的不是這些名稱是否足夠炫目,而是背後的商業條件發生了什麼變化?如果模型要花更多步驟處理問題,就意味著更多運算時間、更多晶片資源、更高能耗與更高服務成本;對科技公司而言,這可能是能力升級,對一般企業而言,卻是一個採購與治理問題:每一個任務真的都值得使用最高階推理嗎?如果不是,企業如何分流?

我不想用「AI 撞牆」或「AGI 即將實現」這種難以驗證的口號作結論,真正有用的分析,應該把模型能力拆成任務:數學、程式、規劃、法律閱讀、客服、摘要、資料抽取,各自需要不同的推理深度;企業若把所有工作都送到最昂貴的模型,只因為「越強越好」,最後很可能得到技術上過度配置、財務上缺乏紀律的結果。

「慢思考」不是人類思考的複製,而是一種增加推理計算的工程方法;產業常用「快思考/慢思考」類比人類認知,方便大眾理解模型差異;但企業決策不能把比喻當成技術事實。

推理型模型的核心,是在回答期間投入更多計算、搜尋、驗證或內部中間步驟,以提高複雜問題的表現;它不因此變成人,也不能因此推定具有意識、價值判斷或常識;這個界線很重要;模型在數學或程式任務上進步,不代表它自動理解企業文化、員工情緒、客戶承諾與法律責任;很多日常商務問題不是缺少計算,而是缺少正確情境、即時資料與責任判斷;因此企業應先問:我們的問題到底需要更多推理,還是需要更好的資料?如果客服答錯產品規格,可能應先改善 RAG;如果法務模型引用過期法規,問題可能在來源;如果模型需要比較多份契約並找出衝突,才可能需要更強推理。

模型愈強,不代表總成本愈低;AI 採購常以「每百萬 token 價格」比較,但真正成本還包括等待時間、重試、上下文長度、工具調用、資料檢索、人工複核與錯誤代價;推理模型如果一個問題要執行更長時間,即使單價下降,總資源仍可能上升;企業應建立自己的成本單位;例如客服可看每一成功解決案件成本;法務可看每一份完成審閱並由人確認的文件成本;程式開發可看每一個通過測試的功能成本;不要只比較模型標價,而要比較「完成一件真正業務工作的成本」;這也能避免技術部門陷入規格崇拜;最強模型若需要大量人工檢查,未必比中型模型配合好資料更划算。

企業應建立 AI 任務分級,而不是模型崇拜,我認為 AI 使用至少可以依風險與複雜度分層:

低風險、可快速驗證的工作,例如格式整理、摘要、語言轉換,可以使用成本較低的模型。

需要跨文件推理、程式除錯或複雜規劃,可以採高階模型。

涉及法律權利、財務承諾、人事、醫療或安全等高風險事項時,企業應依適用規範、決策可逆性與風險程度設置相稱的人工覆核、核准或接管節點,不能只因模型能力提升,就把責任節點一併省略。

分級的價值在於把「是否使用 AI」變成企業決策,而不是員工自行選最貴工具;企業也可以依工作量設定預算、日誌與權限;算力成本最後會變成治理問題;當企業大量使用推理型模型,AI 成本會像雲端成本一樣逐步變成營運支出;如果部門沒有預算責任,使用量可能快速成長;企業應建立 FinOps 類似的 AI 成本治理:哪個部門使用多少、哪些任務最昂貴、哪些可以快取、哪些可以用小模型或規則替代。

這不是要限制員工,而是確保昂貴推理被用在真正有價值的地方;當模型價格、供應商或能源成本改變時,企業也能快速調整;推理模型仍然需要外部事實,不能把「會推理」誤認為「知道最新資料」;模型可以更擅長推導,卻不代表它自動擁有最新法律、財報或企業資料。

對需要即時性的任務,RAG、工具調用、資料庫與外部查證仍然重要;推理能力與知識來源是兩條不同軸線;企業若忽略這點,可能出現一個更危險的錯誤:因為模型說理更完整,就更相信它引用的事實;語言越有邏輯,錯誤反而越難被察覺;不要把「思維鏈」當成唯一可稽核證據;很多人以為只要看模型的中間推理,就能知道答案是否可靠;企業治理不應過度依賴這種想法;真正可稽核的應是輸入資料、工具調用、引用來源、模型版本、最終輸出與人工審核紀錄。

即使模型能提供解釋,也要以外部可驗證證據為主;這尤其適用法律與財務場景;企業需要的是可追溯決策,不是被模型的長篇推理說服;從採購角度看,企業必須保留模型替換能力;推理模型更新非常快;今天最佳的供應商未必明年仍然最合適;如果企業把流程、提示模板、資料格式全部鎖死在單一平台,就可能失去議價與切換能力;因此應把資料與工作流程盡量保持供應商中立,模型層可以替換;這與多雲策略類似,不一定要同時使用很多家,但至少不能讓離開變得不可能。

AI 能耗與永續承諾之間需要真實成本計算

推理型 AI 的資源消耗提高,也會讓企業 ESG 與碳管理面臨新問題;企業若大量使用雲端 AI,未必容易直接看到能源足跡,但仍應把數位服務的環境成本納入採購思考,尤其當公司對外承諾減碳時;這不代表每一次 AI 提問都要計算碳排,而是大型部署需要理解基礎設施影響,不要把數位服務誤認為「沒有物理成本」;真正的風險不是 AI 太聰明,而是企業在沒有治理下把更多決策交出去;推理能力提升會讓模型更像專家,這正是企業更容易過度信賴的時候。

如果一個模型能寫出完整的法律分析、投資建議或策略報告,管理者可能忘記它仍需要正確資料與人類責任。

莊鈞翔 博士認為,所以模型愈強,治理反而不能變少;高風險決策應設人工門檻、來源要求、異常回報與後續審查;企業不應用「AI 使用率」作為創新政績;如果管理層要求每個部門都必須使用 AI,員工會為了達標把簡單工作複雜化。

真正好的 KPI 應是時間縮短、錯誤減少、知識可追溯、客戶體驗或成本改善;科技不是目的;企業若把導入率當成果,很容易重演過去數位轉型中「系統上線但流程沒有改善」的問題;AI 變強之後,人類更應學會算帳;從快思考到慢思考,我真正看到的不是機器變成人,而是 AI 能力開始用更多物理資源換取更高表現;這是一種工程進步,也是一個企業成本與責任問題。

我希望企業最後學會的,不是追逐最新模型,而是建立自己的任務分級、成本計算、資料來源與人工責任;當這些都清楚,模型升級會成為可利用的工具;如果這些不清楚,越強的模型只會讓企業更快放大自己的管理盲點;企業需要建立「模型路由」,讓高成本推理只在真正必要時出現;如果每個請求都直接送到最強模型,企業成本很快失控。

更成熟的架構是先判斷任務難度:簡單摘要交給小模型,文件查詢先走 RAG,複雜分析才交給推理模型;這種模型路由不是工程炫技,而是成本治理;同一個問題也可以先用低成本模型處理,只有低信心或重大風險案件才升級;企業因此能把昂貴算力配置到真正需要的位置。

模型評估不能只看公開 benchmark;模型在數學競賽、程式題或標準測試上表現好,不代表在企業自己的任務上同樣可靠;企業應建立自己的評估集,包含真實文件、例外情況、模糊指令與歷史錯誤;真正的採購比較應問:這個模型對我們的工作準不準、成本多少、錯了能否被發現;公開排行榜只能是參考;推理型 AI 也可能出現「更完整地答錯」;長篇推理很容易帶來可信感;模型若一開始使用錯誤事實,後面可能把錯誤推演得非常完整;因此,高階模型仍需要資料來源驗證,不能用推理長度替代事實正確性;對法律與財務工作尤其如此:先確認法規版本、數字與文件,再讓模型分析。

企業應記錄重大 AI 決策的模型版本

模型供應商會更新系統,同一問題不同月份可能得到不同答案;若 AI 參與重大報告或決策,應記錄模型、日期、主要來源與人工審核,這讓企業日後能重建當時判斷,而不是面對「現在模型已經不會這樣回答」的困境;AI Agent 把「回答」變成「行動」後,權限治理更重要;當模型能自動寄信、下單、修改資料、呼叫系統,錯誤成本會從文字變成實際行為;企業應採最小權限、金額上限、雙重確認、敏感操作人工核准與完整日誌;不能因為模型會推理,就讓它取得比員工更大的系統權限;速度與品質應依情境設計,而不是追求單一體驗;客服可能需要秒級回覆,法務研究則可以等待更長時間換取更完整檢查;企業若要求所有 AI 都又快又深,只會增加成本。

推理預算也應有「停止線」;某些模型可以不斷投入更多計算,但邊際效益會下降;企業可以設定最大時間、最大成本、最大工具調用次數,超過就轉人工;這是避免無底洞式運算的重要治理;企業真正要買的不是「智商」,而是可控的任務能力;模型廣告常以聰明程度競爭,但企業需要的是穩定完成特定任務;當公司能把任務、成本、資料與責任都量化,模型再強也只是一個可替換元件。

這種視角能讓企業從 AI 崇拜走向 AI 管理,也讓「慢思考」回到它真正的位置:一種值得用在對的問題上的昂貴能力;模型能力升級後,企業更需要「錯誤預算」概念;任何 AI 系統都可能出錯;與其追求不切實際的零錯誤,企業應定義每種任務可以容忍多少錯誤、錯誤造成的最大損失以及發現錯誤的控制點,低風險摘要可以容許較高誤差,高風險法律或財務任務則需要更嚴格驗證。

這裡所稱的「錯誤預算」是風險管理上的工作概念,不是法律術語;它讓企業把可容忍誤差、可能損失與人工檢查點放在同一個決策裡,也能幫助公司判斷哪些流程值得自動化;推理模型的「自我檢查」不能取代獨立驗證;模型可以被要求反思、重算或交叉檢查,但仍然是同一套系統在評估自己的答案。

企業若面對重大結果,應使用外部資料、規則引擎、不同模型或人工專家做真正獨立驗證;企業若使用多模型,應避免責任被切碎;一個工作流可能先由模型 A 分類,再由模型 B 分析,最後由模型 C 寫報告;若結果錯誤,不能只看到最後輸出;企業應記錄各層輸入與輸出,並知道誰負責整體流程。

Agentic AI 會讓權限設計從「資料存取」走向「行動授權」

當 AI 可以開工單、調用 ERP、寄信、建立採購單甚至執行交易,企業應像設計員工職權一樣設計代理權限;哪些操作可以自動完成、哪些需要第二人核准、哪些在既定風險政策下不得由模型直接執行,都應事先定義;企業內部需要一個可以停止 AI 的人;當系統失常時,如果沒有明確 owner,大家可能互相等待。

重大 AI 流程應指定能暫停服務、切換人工、封鎖模型或撤回權限的人;這是最基本的 operational governance;模型採購也應要求透明度最低標準;企業未必能取得模型所有技術細節,但至少應知道資料處理、保留、服務區域、重大限制、支援與事件通知;供應商如果對這些基本問題無法回答,企業就應重新評估是否適合高風險用途。

推理型模型對法律專業的價值,不在於取代律師;它可以幫助比較條文、整理爭點、檢查論證,但法律效果仍依賴正確法源與事實;真正提高品質的方法,是讓 AI 協助擴大檢查範圍,再由專業人員確認,而不是把最後判斷交給模型;企業應建立「模型退役」程序;舊模型可能停止支援,資料處理條款也可能改變;當模型退役,企業要知道哪些流程依賴它、如何遷移、歷史紀錄如何保存;這和舊軟體退役一樣,是長期治理的一部分;AI 越會推理,企業越不能停止思考;技術進步最大的誘惑,就是讓人覺得自己可以少做判斷;其實相反。

當模型可以處理更複雜任務,企業更需要清楚界定它能做什麼、不能做什麼、成本多少、錯了怎麼辦。

從公司治理的角度來看,我希望這篇最終留下的不是對算力的焦慮,而是一種紀律:把最昂貴、最強的工具用在真正需要的位置,並永遠保留可驗證、可停止、可替換的人類治理;用一個法律研究情境看「慢思考」真正的價值與限制;假設企業法務要分析一份跨國供應合約;普通模型可以快速摘要,但若問題是「解除條款、不可抗力、保密義務與準據法是否互相衝突」,較強推理模型可能更適合。

然而,模型若拿不到完整合約附件、沒有最新法規或誤解某個定義條款,再多推理也只是建立在錯誤前提上;這個例子提醒企業,推理能力必須和資料完整性一起設計;高階模型最適合解決「已掌握正確材料後的複雜推導」,而不是替代資料蒐集與法律確認。

模型評估應包含「拒答品質」;企業不只要測模型會不會回答,也要測它何時知道自己不該回答;高風險系統如果對缺資料的問題仍強行給結論,就算平均正確率很高,仍然危險;因此評估可以加入不完整資料、互相矛盾文件與超出權限的問題,看模型是否能指出限制、要求補件或轉人工。成熟的 AI 不只是答對,更是知道何時停。

答案愈長,不代表愈容易確認

更強模型往往輸出更長、更完整的分析;對使用者而言,這可能提高理解,也可能增加審查時間;企業應設計固定輸出格式,例如結論、依據、假設、風險、待確認事項,避免模型用大量文字掩蓋真正關鍵;企業可以建立「推理深度政策」;不是所有人都需要自行選擇 thinking effort;系統可以依任務風險自動設定:一般行政低、跨文件分析中、重大法律或工程判斷高。

這能降低成本,也避免員工為求安心一律選最昂貴模式;供應商若以「更聰明」作為漲價理由,企業應要求可量化改善;模型升級應用自己的任務測試;若新版本在關鍵場景沒有顯著提升,就不一定值得增加成本;採購決策應有 A/B 測試,而不是跟著發布會節奏。

算力稀缺時,企業需要業務優先順序;若高階模型服務受限、價格上升或 API 降速,公司應知道哪些流程優先。

關鍵法務、工程與客戶服務可能高於一般文案;這種優先級應事前定義,而不是發生中斷才爭資源;模型能力提升可能改變內部職務分工;某些初步分析、資料整理會自動化,但最終判斷、跨部門協調與例外處理的重要性上升;企業不應只計算「可以少幾個人」,而要重新設計工作內容與培訓;AI 成本中心應與實際商業價值連結;如果某部門使用大量推理模型,但沒有對應收入、效率或風險下降,管理層應檢查;AI 不應因為是新技術就免於一般投資回報紀律。

真正的 AI 成熟,不是永遠選最強,而是知道何時選夠用;企業若能讓大量日常工作由較小模型完成,把高階推理留給真正複雜、風險較高或需要跨文件推導的任務,通常比全面升級更有治理彈性,這不是保守,而是資源配置;我希望這篇把「模型進步」從科技新聞轉成企業治理:能力、成本、風險與責任同時被看見,才算真正導入。

先弄清楚任務,再決定要用什麼模型

例如客服摘要使用小模型,契約差異分析使用推理模型,涉及正式法律意見或個案權利判斷時,仍應由具資格的法律專業人員依完整事實與法源審閱;每一列同時寫明資料來源、最大成本與最終責任人。

這張矩陣可以讓 AI 使用變得透明,也方便財務與稽核追蹤;模型供應商的 SLA 應包含不只是 uptime;企業還可以關注重大模型變更通知、資料保留、資安事件、支援時效與停用安排;當 AI 進入核心流程,單純「服務可用率」已不足以描述風險;AI 推理品質也需要 human QA sampling;不必人工檢查每一筆,但可以定期抽樣高風險輸出,找出常見失敗模式,再調整 prompt、資料或模型;這種品質循環比一次驗收更重要。

企業應允許部門證明「不用最強模型也能完成」,這能避免技術升級成為單向成本;只要較便宜模型在實際任務達標,就應允許使用,採購制度應獎勵成本效益,而不是單純追求規格;AI 的真正進步,應該讓企業更自由,而不是更依賴;如果每次模型升級都迫使企業追加硬體、提高訂閱、改寫流程,企業其實失去主導權;最好的架構應讓新模型可被替換,能力提升可以被吸收,舊流程仍有備援。

這才是「慢思考」時代真正值得企業追求的成熟度,企業導入推理模型前,可以先做一個「三層決策試驗」:

第一層,用現有人工流程取得基準。

第二層,用一般模型或 RAG 測試能否達標。

第三層,只有在前兩層不足時才加入高階推理。

這種逐層升級能看出真正的邊際價值,也能避免一開始就把所有問題歸因於「模型不夠強」。

從 GRC 的角度來看,推理型 AI 的治理也要考慮供應商集中與區域可用性;某些高階模型可能只在特定雲端或地區提供,政策或服務異常時可能無法使用,企業對核心流程應保留替代模型與人工降級方案,並定期測試切換;真正的高階 AI,不是讓企業少思考,而是讓企業把最難的思考留給最值得的問題;如果公司能把重複工作交給便宜工具,把複雜問題交給高階模型,再把價值判斷留給人,這才是資源配置;AI 的成熟,不在於每個地方都最強,而在於每個地方都恰到好處。

模型越強,企業越要保留不用它的能力

真正的議價與治理,都建立在替代方案存在。