極點宏觀|Financial Cloud Cloud · AWS Re:cap
AWS Re:cap 03: 大模型能力評測與 AI 專案落地方法論
大模型落地的真正起點:先定義可接受錯誤
決策前提
政府專案不能從模型名稱開始,而要先寫清楚服務對象、公共問題、錯誤後果與人工替代。政策問答答錯條文、材料審查漏掉敏感內容、內部摘要遺失限制條件,三者後果完全不同,因此不能共用一個抽象的準確率門檻。
三個邊界
先界定可答範圍、必須拒答範圍及必須人工覆核範圍。每類錯誤標記影響、可逆性、發現時間和補救成本,再決定模型、資料與流程需要達到的控制強度。
現場做法
要求業務、法務、資料、安全及前線人員共同評審十個最可能出錯的案例。若團隊無法對錯誤後果形成共識,先不要採購模型。成功定義應落到辦理時間、一次辦結率、錯誤率、基層負擔及民眾滿意度。
能力評測先於品牌選擇
品牌不能代替證據
開放權重、託管 API、專有雲與本地模型各有優勢,但排行榜、參數量或市場聲量都不能直接證明適合政務。模型要在本地語料、真實文件、權限規則及可接受延遲下比較,品牌只是一項供應風險資訊。
評分卡七面
按任務品質、中文能力、工具使用、安全、延遲吞吐、部署效率及授權供應鏈建立加權評分卡。每一分都要有測試樣本、重複次數和失敗證據,避免以主觀試用打分。
選型紀律
至少保留一個替代方案,並記錄選擇理由、放棄條件和重新評測觸發點。若模型升級、價格改變、授權更新或資料駐留要求改變,原結論自動失效,必須重新跑基線。
把模型能力拆成可驗證任務
不要測聊天印象
『會推理』『支援多模態』『能用工具』都不是可驗收描述。應拆成政策時效判斷、條文衝突辨識、表格欄位抽取、圖片文字核對、函式參數生成、引用定位及越權拒絕等原子任務。
任務契約
每個任務寫明輸入格式、允許資料、期望輸出、容許錯誤、延遲上限、成本上限及人工接管點。複合流程要分段量測,否則最終答案錯誤時無法判斷是檢索、模型、工具還是業務規則造成。
可重用成果
原子任務可形成跨供應商共同測試集,支援採購驗收、版本回歸及灰度發布。成熟團隊保留失敗樣本,而不是只保留平均分,因為罕見但高後果的錯誤最值得持續監測。
六階段落地法:從問題到營運
階段一至二
先完成問題定義與資料準備,確認公共價值、角色、資料合法性、品質、權限與保存期。若沒有可靠資料來源或人工流程,模型能力再強也不能形成可持續服務。
階段三至四
建立人工可接受基線,再做離線評測。先以搜尋、規則或現有流程作比較,之後才導入模型。評測同時涵蓋任務成功、引用、拒答、敏感資料、延遲、吞吐及成本。
階段五至六
通過灰度發布再進入營運,設定自動停止、回滾、版本追蹤、漂移監測、事故處理及定期重評。每階段有批准人、必要證據和退出條件,PoC 不得因展示成功而跳過治理閘門。
黃金資料集:政府必須擁有自己的考卷
樣本來源
資料集應來自已公開、已授權、匿名化或合成的真實工作情境,包含常見、困難、邊界、過期、衝突、敏感及惡意案例。只收集標準答案會高估系統能力。
標註治理
每個樣本保存題目、依據、期望行為、可接受變體、拒答要求、風險等級及覆核者。政策變更時要更新答案並保留歷史版本,避免用今天的規則錯判昨天的系統。
資產主權
測試集、提示資產、知識庫和稽核資料應由機構掌握,不鎖在單一供應商平台。供應商可協助建設,但不得以專有格式阻礙匯出。黃金資料集是長期採購議價和模型切換的核心資產。
推理能力:測過程約束,不迷信思考文字
測試重點
政務推理要驗證規則適用、例外條件、證據完整和結論一致,而不是要求模型輸出冗長思考。可要求結構化依據、引用段落、適用日期與未決事項,讓審核者快速核查。
高風險樣本
加入條文互相衝突、附件缺失、政策已失效、地方規則不同及問題前提錯誤等情境。優秀系統應指出缺口、要求補充或拒絕下結論,而不是流暢地填補未知。
工程經驗
將複雜問題拆成檢索、規則判斷、計算與文字生成,能降低不可解釋錯誤。需要精確計算時調用受控工具,不讓語言模型心算;需要政策結論時強制引用有效來源。
多模態評測:文件不是一張圖片
政務文件難點
掃描件、騎縫章、表格、手寫批註、頁眉頁腳、浮水印和多欄排版會破壞閱讀順序。多模態能力要分別測 OCR、版面理解、跨頁關聯、印章位置及圖文一致性。
分段管線
先做文件品質檢測、頁面分類、文字與座標抽取,再由模型理解語義。原始影像、OCR 文字、版面區塊和最終結論要保持關聯,讓人工可回到原頁核實。
驗收方式
不能只問是否讀出內容,要測欄位完整率、表格關係、頁碼引用、低品質拒答和敏感內容遮罩。若模型對模糊印章過度自信,系統應要求重新掃描或人工確認。
工具使用:模型只能提出調用,系統負責授權
權限分離
模型生成函式名稱與參數不等於有權執行。真正的授權由身份、角色、資料範圍、交易限額和審批流程決定,模型輸出必須經白名單與政策引擎驗證。
安全護欄
對查詢、寫入、刪除、付款、通知等工具設定不同風險級別。高風險操作採預覽、二次確認、雙人覆核或只生成草稿;工具返回也要防止提示注入和敏感資料回流。
稽核證據
保存模型版本、提示版本、工具、參數摘要、授權結果、執行回覆、人工確認和最終狀態。事故調查必須能回答誰授權、模型建議什麼、系統執行什麼,以及資料是否被改動。
長上下文:能放進去不代表能找得到
常見誤區
宣稱支援很長上下文,只表示接受大量 Token,不保證模型在中間位置找到關鍵條文、正確處理多版本文件或維持一致引用。上下文愈長,成本、延遲和干擾也可能愈高。
壓力測試
把關鍵證據放在開頭、中間與結尾,混入近似條款、舊版本與無關附件,測試召回、引用和拒答。再比較直接塞全文、分層摘要及檢索增強三種策略。
實務原則
以文件結構、權限和任務切分上下文,只提供必要段落,保留來源指標。長上下文適合跨段整合,不應取代資料治理、版本控制和可靠檢索。
中文政務能力:不是翻譯分數
語言層次
評測應涵蓋簡體與繁體、公文固定表述、法規用語、縮略語、地方名稱、粵語書面表達、數字日期、量詞及中英文混排。一般中文流暢不等於能準確處理政府材料。
情境難點
同一詞在不同部門可能有不同定義,政策名稱可能存在俗稱,表格欄位也常省略主語。模型要結合術語庫、部門資料和文件版本,不能自行猜測。
改善方法
先建立術語、實體和格式規則,再用檢索補充本地知識;只有穩定而大量的重複錯誤才考慮微調。對方言輸入保留原文、標準化結果及人工修正,防止語意在轉換中丟失。
RAG 優先:先讓答案有根據
何時使用
政策問答、制度查詢、材料審查和內部知識支援通常先採檢索增強,因為知識會更新、需要引用又涉及權限。把所有知識微調進模型,更新慢且難追溯。
核心組件
完整 RAG 包含資料清理、切分、權限標記、關鍵字與向量混合檢索、重排序、上下文組裝、引用及無答案處理。任何一環錯誤都可能形成有來源外觀的錯誤答案。
實戰順序
先用人工可接受的關鍵字搜尋作基線,再增混合檢索和重排序;每次只改一個變量。若答案錯,先檢查證據是否找到,再檢查模型是否正確使用證據。
混合檢索:關鍵字與向量各守一關
關鍵字優勢
法規編號、機構名稱、專有詞、精確日期和固定短語適合關鍵字檢索,能提供穩定、可解釋的命中。只用向量可能把語意相近但效力不同的文件混在一起。
向量優勢
使用者常用口語描述問題,未必知道正式政策名稱。向量檢索可找出語意相近內容,補足同義詞、問法差異和跨語言表達。
融合做法
兩路召回後按權限、有效期、文件級別與相關性重排序,必要時保留多個衝突來源交給後續規則判斷。評測要分開計算召回失敗與重排序失敗,避免只看最終答案。
切分與索引:文件結構決定檢索品質
切分原則
不要只按固定字數切分。應保留章、節、條、款、表格和附件關係,將標題、發布機構、有效日期、地區、密級及權限作為元資料。
跨段處理
條文常引用前述定義或附件,單段命中可能缺少必要上下文。可建立父子區塊、鄰接段落和引用關係,召回精確段落後補充最小必要背景。
品質檢查
抽樣檢查斷句、表格拆解、頁碼、字符編碼和重複內容。索引更新採版本化與原子切換,避免服務同時讀到新舊政策。
重排序與引用:最後一公里的可信度
重排序目的
初次召回追求不漏,重排序負責把真正可用、有效且權限允許的證據放在前面。排序特徵不只語意相似,也包括效力、日期、地區、文件類型及問題意圖。
引用標準
答案至少提供文件名稱、有效版本、條款位置和可核對片段。引用必須真的支持結論,不能只是在同一主題下看似相關。
失敗處理
若來源衝突、沒有有效文件或只有低權限內容,系統應說明缺口並轉人工。引用命中率和引用支持率要分開量測,前者找到來源,後者判斷來源是否足以支持答案。
提示工程:把業務規則寫成可測資產
結構設計
系統提示應包含角色、任務、允許資料、禁止事項、輸出格式、拒答條件和人工轉介。專案提示與通用品牌語氣分離,避免修改風格時意外改變安全行為。
版本治理
提示視為程式碼,納入版本庫、審查、測試、發布和回滾。每次改動記錄原因、影響任務、評測結果和批准人,不能直接在生產介面臨時修改。
避免過度提示
過長提示會增加成本並與知識內容互相干擾。穩定的權限、計算和政策判斷應由程式與規則引擎執行,提示只負責模型需要理解的行為約束。
規則、檢索、微調與代理的選擇順序
先用確定性
固定計算、格式校驗、權限、效期和硬性政策先用程式或規則。知識頻繁更新且需要引用時用檢索。這兩步往往已能解決大部分政務需求。
何時微調
當模型在穩定任務上反覆出現風格、結構或特定分類錯誤,且有足夠高品質標註資料時,才評估微調。微調不能修復錯誤知識來源或混亂流程。
何時代理
任務需要多步計畫和工具協作時才使用代理,並限制步數、工具、預算和可寫操作。代理增加自主性,也增加不可預測和稽核難度,不應作為第一個架構選項。
微調決策:以穩定錯誤換取可控改善
資料門檻
微調資料要代表真實輸入、正確標註、覆蓋邊界並有使用權。把歷史人工答案直接拿來訓練,可能把過期政策、個人偏好和隱私資料一併固化。
對照實驗
保留未參與訓練的測試集,比較基礎模型、提示、RAG 與微調版本。除了目標任務改善,也檢查通用能力退化、安全繞過、中文格式和拒答行為。
營運責任
微調後的權重、基座版本、資料版本和參數必須登錄。基座升級不能假設舊適配方法仍有效,要重新訓練或完整回歸;安全修補和容量責任也轉移到使用方。
代理系統:把自主性關進可觀察流程
流程建模
先將任務畫成狀態、工具、決策點、停止條件和人工節點。模型可在限定範圍內選擇下一步,但不能自行擴大目標、增加資料來源或繞過審批。
預算與停止
設定最大步數、Token、時間、外部調用和重試上限。遇到權限不足、證據衝突、工具失敗或成本超標時立即停止,返回已完成步驟和待人工事項。
可觀測性
追蹤每一步輸入摘要、模型決策、工具結果、狀態變化與費用。只記錄最終答案無法分析代理為何繞路、重複調用或產生錯誤操作。
政策問答與材料審查助手:綜合實戰
第一步基線
先建立人工可接受的搜尋基線,使用公開或已授權政策,定義有效期、部門、地區和權限。選取真實問題,檢查人工找到答案所需時間和常見漏項。
第二步增強
加入混合檢索、重排序、段落引用和結構化輸出,測試過期政策、規定衝突、敏感事項、表格附件及無答案。模型不得用常識填補缺少文件。
第三步紅隊
使用提示注入、越權查詢、資料外洩、偽造來源和惡意附件測試。每次輸入、輸出、模型、提示、來源、工具、人工覆核、例外與成本都形成證據鏈。
開放權重不等於零風險
得到的自主性
開放權重可支援本地部署、深度評測、客製化和替換推理框架,降低部分 API 鎖定,也有利於敏感資料留在受控環境。
接手的責任
使用方同時承擔授權解讀、漏洞修補、模型來源驗證、容量規劃、推理安全、內容治理、版本相容和停服處理。沒有成熟營運團隊時,自建可能比託管服務風險更高。
供應鏈核查
保存來源、雜湊、授權版本、依賴清單和建置流程;掃描容器與套件,限制模型下載渠道。任何新權重上線前都跑完整評測,不能因同系列名稱相近而視為等價。
授權與法律條款:技術評分卡的硬門檻
核查事項
確認商業使用、衍生模型、再分發、用途限制、品牌要求、資料使用及終止條款。模型、資料集、程式庫和服務 API 的授權要分開檢查。
變更管理
授權條款可能隨版本變化,採購和架構決策要固定所用版本並建立定期覆核。若條款影響政府用途或資料權利,必須有遷移方案。
實務交付
建立可讀的授權清單和風險分類,由法務、採購和技術共同簽署。不要把『開源』『可下載』或『免費試用』當成可合法長期營運的證明。
部署模式比較:自建、API、專有雲與混合
自建適合
資料高度敏感、負載穩定、需要深度控制且具備 GPU、平台、安全及模型營運團隊時,自建有價值。但前期投資、閒置容量、修補和人才成本不可忽略。
託管適合
需求變動快、先驗證價值或需要快速取得強模型能力時,託管 API 可降低起步成本。必須核查資料使用、區域、日誌、服務等級、價格變動與退出。
混合設計
敏感預處理、身份和規則留在專網或本地,通用推理按需使用多個雲端;高峰與災備可採替代路徑。混合不是堆疊平台,而是按責任邊界分配工作。
模型閘道:多品牌能力的統一控制面
統一介面
閘道封裝不同供應商的請求、認證、限流、重試、路由、內容安全和日誌,應用不直接綁定特定 SDK。模型差異透過能力描述和適配器管理。
策略路由
按資料分類、任務、成本、延遲、可用性和地區選擇模型。高敏感內容只能走受控部署,低風險摘要可用成本較低方案;故障時路由到經評測的替代模型。
防止最低公分母
統一不代表抹平特色。保留供應商特有能力的受控擴展,同時確保核心流程可替換。路由策略、提示和評測資料由機構掌握。
GPU 與推理容量:從峰值倒推架構
負載剖面
先量測請求長度、輸出長度、併發、時段、任務優先級和延遲目標。平均流量無法代表辦證高峰、突發事件或批量材料審查。
效率手段
使用動態批次、KV 快取、量化、模型並行、請求排隊和小模型分流。對簡單分類不必使用最大模型,對長文任務限制輸入並採分段處理。
容量治理
設定容量上限、排隊時限、降級模型、批處理窗口和優先級。定期做壓力與故障測試,將 GPU 利用率、每件成功任務成本和超時率一起評估。
企業級資料平台:知識要有目錄、血緣與品質
資料產品化
政策、指南、案例、表格和常見問題都要有擁有者、來源、有效期、權限、品質規則和更新承諾。Lakehouse 或其他平台只是承載,治理責任不能交給儲存技術。
血緣追蹤
能從答案回到索引區塊、清洗結果、原始文件與發布來源,也能在原文件撤回時找出受影響索引和答案。這是更正、稽核和影響分析的基礎。
資料品質
監測缺欄、重複、失效、編碼、解析失敗和權限錯配。品質異常可阻止索引發布,不能等模型回答錯誤後才發現。
LLMOps:模型升級就是生產變更
登錄要求
記錄模型來源、版本、量化、推理框架、提示、工具、知識快照、評測和部署環境。只寫一個市場名稱不足以重現行為。
發布流程
離線回歸通過後進影子流量、內部灰度、小比例使用者,再逐步擴大。每階段設定錯誤自信、拒答、延遲、成本和安全停止條件。
回滾能力
保留上一穩定版本的模型、提示、索引和規則,並測試一鍵或可控回滾。資料結構變更要向後相容,否則模型回滾也無法恢復服務。
可觀測性:從 Token 到任務成功
四層訊號
基礎設施看 GPU、CPU、記憶體和網路;服務看延遲、錯誤和可用性;模型看引用、拒答和安全;業務看任務完成、人工接管和公共成果。
分散式追蹤
用一致追蹤識別碼串連入口、檢索、重排序、模型、工具和人工流程。日誌採摘要與去識別化,避免為可觀測性複製敏感資料。
行動門檻
每個指標要連到告警、擁有者和處置手冊。儀表板本身不創造可靠性;若沒有停止發布、擴容、切換或人工介入規則,數據只會被觀看。
安全基線:身份、密鑰、網路、DLP 與紅隊
最小權限
使用工作負載身份而非長期密鑰,模型服務、資料、向量索引和工具分開授權。KMS 管理密鑰,私有網路限制流向,管理操作採加強認證。
資料防護
DLP 在輸入、日誌與輸出檢測個人及敏感資訊;必要資料先遮罩或替換。內容安全要區分非法、敏感、越權和不適當建議,不用單一黑名單處理所有風險。
持續紅隊
測試提示注入、資料外洩、工具濫用、越權檢索、模型供應鏈和拒絕服務。修復後將案例加入回歸集,確保下次升級不再出現。
證據鏈與可審計 AI
需要記錄
輸入摘要、身份與權限、模型和提示版本、檢索來源、工具調用、規則命中、人工覆核、最終輸出、例外、延遲及成本構成完整事件。
最小化保存
不是所有原文都要長期保留。按資料分類保存雜湊、來源指標、結構化決策和必要片段,原始敏感內容採較短期限或不落盤。
稽核用途
證據鏈支援投訴、版本比較、供應商驗收、成本核對、安全威脅和政策更正。若無法重建當時系統行為,就不能把模型用於高責任流程。
成功案例:香港數位政府共用底座
規模化成果
香港完成全政府電子服務審視,並在二〇二五年底前推進一百多項數位政府與智慧城市措施,運用大數據、人工智能、區塊鏈及地理空間分析改善服務。
平台化方法
下一代政府雲、大數據分析平台、數碼身份、共享區塊鏈、聊天機器人服務和統一入口,讓部門重用身份、安全、數據和運營能力,而不是每個專案重建。
方法論啟示
大模型落地也應先建立模型閘道、資料治理、評測、日誌和工具授權等共用能力,再容納 Google、AWS、騰訊雲、字節跳動及其他技術生態。成功來自標準化治理,而非單一品牌包辦。
成功案例:數碼身份與企業身份
市民服務入口
一站式數碼身份平台已有超過四百萬登記使用者,支援超過一千三百項服務和電子表格,並取得資訊安全與私隱資訊管理相關國際標準認證。
代理時代要求
AI 助手代表個人或企業辦事時,必須知道代理人、被代理主體、授權範圍、有效期和簽署責任。模型不能從對話自行推斷授權。
企業服務延伸
企業數碼身份平台預計於二〇二六年底推出,核心包括企業驗證、數碼簽署、預填和文件錢包。這為政府對企業及企業對企業的受控 AI 代理建立可信身份底座。
成功案例:同意數據交換與一次辦事
已驗證規模
同意數據交換閘道讓部門或獲授權機構在市民同意下交換已核實資料,每月約處理二百萬次交換,降低市民重複提交。
對 AI 的價值
模型只取得完成任務所需欄位,不要求使用者上傳整份證明。已核實資料仍要標示來源與時間,模型不能把一次同意延伸到訓練或其他用途。
工程落點
把同意、目的、欄位、時限、撤回和接收方寫入資料契約與 API 控制。這個成功案例證明,資料共享要由制度、身份、接口和稽核共同實現。
成功案例:開放數據形成創新生態
使用增長
公開數據下載量由二〇一九年約五十億次增至二〇二五年十二月超過八百億次,並提供五千七百多個數據集、約一百一十個 API 和二千五百多個資料提供者。
大模型準備度
高使用量不代表天然適合 AI。每個數據產品仍需資料字典、授權、更新頻率、血緣、品質、變更通知及歷史版本,才能安全進入檢索和工具流程。
生態策略
以穩定 API 和開放格式讓不同雲端、研究機構、初創及大型企業重用。政府掌握標準與服務成果,市場在共同規則下提供多品牌創新。
成功案例:AI+ 公務服務工具目錄
七類切入
工具目錄覆蓋數碼人客服、會議摘要、文件處理、寫作內容、流程自動化、創意推廣及數據分析預測,並透過論壇、研討與技術配對協助部門採用。
目錄要素
除功能和價格外,應標示部署模式、資料流、模型來源、日誌、支援、可攜、禁用場景和退出方式。同類用途用共同測試集比較,防止採購只看展示。
風險次序
先在低風險內部草稿、摘要和分類使用,要求人工確認後外發;累積評測與營運證據後,再進入跨部門和市民服務。
北部都會區與河套:大模型的真實測試場
產業空間
北部都會區聚焦創科、專上教育、健康與醫療創新,並以大學城、產業園、科研和社區形成完整環境;河套一區兩園推動深港研發與成果轉化。
可驗證場景
可在受控範圍測試科研知識助手、臨床試驗材料整理、園區服務、跨境專業資訊及人才培訓,同時評估身份、資料流、弱網和多語需求。
治理前置
living lab 必須有居民與使用者溝通、資料最小化、退出、獨立評估和開放接口。跨境專案先處理規則、標準和責任,再連接資料與模型。
跨境資料流:合同要求要落到 API
制度進展
大灣區個人資訊跨境流動標準合同於二〇二三年開始先行,並自二〇二四年十一月起擴展至大灣區各行業,為區域協作提供制度工具。
技術翻譯
工程要把目的、資料類別、接收方、保存、再轉移、安全措施和事件處理轉成欄位白名單、權限、加密、日誌、刪除和告警。
模型特別風險
需確認跨境資料是否進入提示、快取、日誌、向量索引或訓練。服務商的處理位置和分包商也要透明,不能只檢查主資料庫位置。
多雲與國產化相容:不綁品牌,要綁標準
組合原則
不同技術生態在模型、資料、邊緣、安全、全球區域和本地服務上各有長處。按資料駐留、任務品質、延遲、成本、供應韌性和人才選擇,而不是平均分配。
可攜基線
採標準 API、容器、開放資料格式、基礎設施即程式碼、外部化提示與政策。身份、日誌、評測和知識資產由機構控制。
驗證方式
每年演練代表性服務轉移或替代路由,測量時間、成本、功能差異和資料完整性。沒有演練的多雲通常只是合約層多供應商。
三年 TCO:價格表之外的完整成本
直接成本
包括 Token 或 GPU、儲存、網路、軟件授權、平台與支持。自建還有機房、容量閒置、硬件更新和備件;API 有價格變動、跨區和高峰成本。
隱性成本
資料清理、標註、評測、安全、人工覆核、培訓、客服、稽核、事故、遷移和退出常高於首次原型。應計算每件成功任務,而不是每次調用。
決策比較
同時比較不做、改善既有流程、採購成熟產品、自建和混合方案。對低使用量或需求不穩專案,昂貴自建未必帶來戰略自主;對穩定高敏感負載,長期自建可能合理。
採購驗收:把展示變成可問責能力
規格寫法
描述公共成果、任務、錯誤邊界、資料權利、接口、觀測、服務等級和退出,不把某個品牌或模型名稱寫成唯一答案。
共同考卷
所有方案跑同一黃金資料集、紅隊集、壓力場景和故障演練。正確率、安全、公平、引用、拒答、延遲、成本、可用性和申訴流程設硬門檻。
合約保障
規定模型更新通知、分包商、漏洞修補、資料匯出、刪除證明、移交期和服務終止。低價若伴隨高退出成本,不能視為真正節省。
結語:把模型熱度轉化為長期公共能力
最終判斷
新一代模型可以提升推理、多模態、工具和部署效率,但公共服務成功仍由問題、資料、流程、治理、人才與營運共同決定。榜單只能提供線索,不能代替本地證據。
成功經驗
香港數位政府、數碼身份、同意數據交換、開放數據、AI 工具目錄及智慧城市共用平台的成功案例說明,規模化依靠共同底座、跨部門治理和持續服務。
行動原則
先定義可接受錯誤,建立自己的考卷;先檢索與規則,再微調與代理;每次變更回歸、灰度並可逆回滾;以開放接口、多品牌評測和退出演練維持自主。