极点宏观|Financial Cloud Cloud · AWS Re:cap
AWS Re:cap 03: 大模型能力评测与 AI 项目落地方法论
大模型落地的真正起点:先定义可接受错误
决策前提
政府项目不能从模型名称开始,而要先写清楚服务对象、公共问题、错误后果与人工替代。政策问答答错条文、材料审查漏掉敏感内容、内部摘要遗失限制条件,三者后果完全不同,因此不能共用一个抽象的准确率门槛。
三个边界
先界定可答范围、必须拒答范围及必须人工复核范围。每类错误标记影响、可逆性、发现时间和补救成本,再决定模型、数据与流程需要达到的控制强度。
现场做法
要求业务、法务、数据、安全及前线人员共同评审十个最可能出错的案例。若团队无法对错误后果形成共识,先不要采购模型。成功定义应落到办理时间、一次办结率、错误率、基层负担及民众满意度。
能力评测先于品牌选择
品牌不能代替证据
开放权重、托管 API、专有云与本地模型各有优势,但排行榜、参数量或市场声量都不能直接证明适合政务。模型要在本地语料、真实文件、权限规则及可接受延迟下比较,品牌只是一项供应风险信息。
评分卡七面
按任务质量、中文能力、工具使用、安全、延迟吞吐、部署效率及授权供应链建立加权评分卡。每一分都要有测试样本、重复次数和失败证据,避免以主观试用打分。
选型纪律
至少保留一个替代方案,并记录选择理由、放弃条件和重新评测触发点。若模型升级、价格改变、授权更新或数据驻留要求改变,原结论自动失效,必须重新跑基线。
把模型能力拆成可验证任务
不要测聊天印象
『会推理』『支持多模态』『能用工具』都不是可验收描述。应拆成政策时效判断、条文冲突辨识、表格字段抽取、图片文字核对、函数参数生成、引用定位及越权拒绝等原子任务。
任务契约
每个任务写明输入格式、允许数据、期望输出、容许错误、延迟上限、成本上限及人工接管点。复合流程要分段量测,否则最终答案错误时无法判断是检索、模型、工具还是业务规则造成。
可重用成果
原子任务可形成跨供应商共同测试集,支持采购验收、版本回归及灰度发布。成熟团队保留失败样本,而不是只保留平均分,因为罕见但高后果的错误最值得持续监测。
六阶段落地法:从问题到运营
阶段一至二
先完成问题定义与数据准备,确认公共价值、角色、数据合法性、质量、权限与保存期。若没有可靠数据来源或人工流程,模型能力再强也不能形成可持续服务。
阶段三至四
建立人工可接受基线,再做离线评测。先以搜索、规则或现有流程作比较,之后才导入模型。评测同时涵盖任务成功、引用、拒答、敏感数据、延迟、吞吐及成本。
阶段五至六
通过灰度发布再进入运营,设置自动停止、回滚、版本追踪、漂移监测、事故处理及定期重评。每阶段有批准人、必要证据和退出条件,PoC 不得因展示成功而跳过治理闸门。
黄金数据集:政府必须拥有自己的考卷
样本来源
数据集应来自已公开、已授权、匿名化或合成的真实工作场景,包含常见、困难、边界、过期、冲突、敏感及恶意案例。只收集标准答案会高估系统能力。
标注治理
每个样本保存题目、依据、期望行为、可接受变体、拒答要求、风险等级及复核者。政策变更时要更新答案并保留历史版本,避免用今天的规则错判昨天的系统。
资产主权
测试集、提示资产、知识库和审计数据应由机构掌握,不锁在单一供应商平台。供应商可协助建设,但不得以专有格式阻碍导出。黄金数据集是长期采购议价和模型切换的核心资产。
推理能力:测过程约束,不迷信思考文字
测试重点
政务推理要验证规则适用、例外条件、证据完整和结论一致,而不是要求模型输出冗长思考。可要求结构化依据、引用段落、适用日期与未决事项,让审核者快速核查。
高风险样本
加入条文互相冲突、附件缺失、政策已失效、地方规则不同及问题前提错误等场景。优秀系统应指出缺口、要求补充或拒绝下结论,而不是流畅地填补未知。
工程经验
将复杂问题拆成检索、规则判断、计算与文字生成,能降低不可解释错误。需要精确计算时调用受控工具,不让语言模型心算;需要政策结论时强制引用有效来源。
多模态评测:文件不是一张图片
政务文件难点
扫描件、骑缝章、表格、手写批注、页眉页脚、浮水印和多栏排版会破坏阅读顺序。多模态能力要分别测 OCR、版面理解、跨页关联、印章位置及图文一致性。
分段流水线
先做文件质量检测、页面分类、文字与座标抽取,再由模型理解语义。原始影像、OCR 文字、版面区块和最终结论要保持关联,让人工可回到原页核实。
验收方式
不能只问是否读出内容,要测字段完整率、表格关系、页码引用、低质量拒答和敏感内容遮罩。若模型对模糊印章过度自信,系统应要求重新扫描或人工确认。
工具使用:模型只能提出调用,系统负责授权
权限分离
模型生成函数名称与参数不等于有权执行。真正的授权由身份、角色、数据范围、交易限额和审批流程决定,模型输出必须经白名单与政策引擎验证。
安全护栏
对查询、写入、删除、付款、通知等工具设置不同风险级别。高风险操作采预览、二次确认、双人复核或只生成草稿;工具返回也要防止提示注入和敏感数据回流。
审计证据
保存模型版本、提示版本、工具、参数摘要、授权结果、执行回覆、人工确认和最终状态。事故调查必须能回答谁授权、模型建议什么、系统执行什么,以及数据是否被改动。
长上下文:能放进去不代表能找得到
常见误区
宣称支持很长上下文,只表示接受大量 Token,不保证模型在中间位置找到关键条文、正确处理多版本文件或维持一致引用。上下文愈长,成本、延迟和干扰也可能愈高。
压力测试
把关键证据放在开头、中间与结尾,混入近似条款、旧版本与无关附件,测试召回、引用和拒答。再比较直接塞全文、分层摘要及检索增强三种策略。
实务原则
以文件结构、权限和任务切分上下文,只提供必要段落,保留来源指标。长上下文适合跨段整合,不应取代数据治理、版本控制和可靠检索。
中文政务能力:不是翻译分数
语言层次
评测应涵盖简体与繁体、公文固定表述、法规用语、缩略语、地方名称、粤语书面表达、数字日期、量词及中英文混排。一般中文流畅不等于能准确处理政府材料。
场景难点
同一词在不同部门可能有不同定义,政策名称可能存在俗称,表格字段也常省略主语。模型要结合术语库、部门数据和文件版本,不能自行猜测。
改善方法
先建立术语、实体和格式规则,再用检索补充本地知识;只有稳定而大量的重复错误才考虑微调。对方言输入保留原文、标准化结果及人工修正,防止语义在转换中丢失。
RAG 优先:先让答案有根据
何时使用
政策问答、制度查询、材料审查和内部知识支持通常先采检索增强,因为知识会更新、需要引用又涉及权限。把所有知识微调进模型,更新慢且难追溯。
核心组件
完整 RAG 包含数据清理、切分、权限标记、关键字与向量混合检索、重排序、上下文组装、引用及无答案处理。任何一环错误都可能形成有来源外观的错误答案。
实战顺序
先用人工可接受的关键字搜索作基线,再增混合检索和重排序;每次只改一个变量。若答案错,先检查证据是否找到,再检查模型是否正确使用证据。
混合检索:关键字与向量各守一关
关键字优势
法规编号、机构名称、专有词、精确日期和固定短语适合关键字检索,能提供稳定、可解释的命中。只用向量可能把语义相近但效力不同的文件混在一起。
向量优势
用户常用口语描述问题,未必知道正式政策名称。向量检索可找出语义相近内容,补足同义词、问法差异和跨语言表达。
融合做法
两路召回后按权限、有效期、文件级别与相关性重排序,必要时保留多个冲突来源交给后续规则判断。评测要分开计算召回失败与重排序失败,避免只看最终答案。
切分与索引:文件结构决定检索质量
切分原则
不要只按固定字数切分。应保留章、节、条、款、表格和附件关系,将标题、发布机构、有效日期、地区、密级及权限作为元数据。
跨段处理
条文常引用前述定义或附件,单段命中可能缺少必要上下文。可建立父子区块、邻接段落和引用关系,召回精确段落后补充最小必要背景。
质量检查
抽样检查断句、表格拆解、页码、字符编码和重复内容。索引更新采版本化与原子切换,避免服务同时读到新旧政策。
重排序与引用:最后一公里的可信度
重排序目的
初次召回追求不漏,重排序负责把真正可用、有效且权限允许的证据放在前面。排序特徵不只语义相似,也包括效力、日期、地区、文件类型及问题意图。
引用标准
答案至少提供文件名称、有效版本、条款位置和可核对片段。引用必须真的支持结论,不能只是在同一主题下看似相关。
失败处理
若来源冲突、没有有效文件或只有低权限内容,系统应说明缺口并转人工。引用命中率和引用支持率要分开量测,前者找到来源,后者判断来源是否足以支持答案。
提示工程:把业务规则写成可测资产
结构设计
系统提示应包含角色、任务、允许数据、禁止事项、输出格式、拒答条件和人工转介。项目提示与通用品牌语气分离,避免修改风格时意外改变安全行为。
版本治理
提示视为代码,纳入版本库、审查、测试、发布和回滚。每次改动记录原因、影响任务、评测结果和批准人,不能直接在生产界面临时修改。
避免过度提示
过长提示会增加成本并与知识内容互相干扰。稳定的权限、计算和政策判断应由程序与规则引擎执行,提示只负责模型需要理解的行为约束。
规则、检索、微调与代理的选择顺序
先用确定性
固定计算、格式校验、权限、效期和硬性政策先用程序或规则。知识频繁更新且需要引用时用检索。这两步往往已能解决大部分政务需求。
何时微调
当模型在稳定任务上反覆出现风格、结构或特定分类错误,且有足够高质量标注数据时,才评估微调。微调不能修复错误知识来源或混乱流程。
何时代理
任务需要多步计划和工具协作时才使用代理,并限制步数、工具、预算和可写操作。代理增加自主性,也增加不可预测和审计难度,不应作为第一个架构选项。
微调决策:以稳定错误换取可控改善
数据门槛
微调数据要代表真实输入、正确标注、覆盖边界并有使用权。把历史人工答案直接拿来训练,可能把过期政策、个人偏好和隐私数据一并固化。
对照实验
保留未参与训练的测试集,比较基础模型、提示、RAG 与微调版本。除了目标任务改善,也检查通用能力退化、安全绕过、中文格式和拒答行为。
运营责任
微调后的权重、基座版本、数据版本和参数必须登录。基座升级不能假设旧适配方法仍有效,要重新训练或完整回归;安全修补和容量责任也转移到使用方。
代理系统:把自主性关进可观察流程
流程建模
先将任务画成状态、工具、决策点、停止条件和人工节点。模型可在限定范围内选择下一步,但不能自行扩大目标、增加数据来源或绕过审批。
预算与停止
设置最大步数、Token、时间、外部调用和重试上限。遇到权限不足、证据冲突、工具失败或成本超标时立即停止,返回已完成步骤和待人工事项。
可观测性
追踪每一步输入摘要、模型决策、工具结果、状态变化与费用。只记录最终答案无法分析代理为何绕路、重复调用或产生错误操作。
政策问答与材料审查助手:综合实战
第一步基线
先建立人工可接受的搜索基线,使用公开或已授权政策,定义有效期、部门、地区和权限。选取真实问题,检查人工找到答案所需时间和常见漏项。
第二步增强
加入混合检索、重排序、段落引用和结构化输出,测试过期政策、规定冲突、敏感事项、表格附件及无答案。模型不得用常识填补缺少文件。
第三步红队
使用提示注入、越权查询、数据外泄、伪造来源和恶意附件测试。每次输入、输出、模型、提示、来源、工具、人工复核、例外与成本都形成证据链。
开放权重不等于零风险
得到的自主性
开放权重可支持本地部署、深度评测、定制和替换推理框架,降低部分 API 锁定,也有利于敏感数据留在受控环境。
接手的责任
使用方同时承担授权解读、漏洞修补、模型来源验证、容量规划、推理安全、内容治理、版本兼容和停服处理。没有成熟运营团队时,自建可能比托管服务风险更高。
供应链核查
保存来源、哈希、授权版本、依赖清单和构建流程;扫描容器与软件包,限制模型下载渠道。任何新权重上线前都跑完整评测,不能因同系列名称相近而视为等价。
授权与法律条款:技术评分卡的硬门槛
核查事项
确认商业使用、衍生模型、再分发、用途限制、品牌要求、数据使用及终止条款。模型、数据集、程序库和服务 API 的授权要分开检查。
变更管理
授权条款可能随版本变化,采购和架构决策要固定所用版本并建立定期复核。若条款影响政府用途或数据权利,必须有迁移方案。
实务交付
建立可读的授权清单和风险分类,由法务、采购和技术共同签署。不要把『开源』『可下载』或『免费试用』当成可合法长期运营的证明。
部署模式比较:自建、API、专有云与混合
自建适合
数据高度敏感、负载稳定、需要深度控制且具备 GPU、平台、安全及模型运营团队时,自建有价值。但前期投资、闲置容量、修补和人才成本不可忽略。
托管适合
需求变动快、先验证价值或需要快速取得强模型能力时,托管 API 可降低起步成本。必须核查数据使用、区域、日志、服务等级、价格变动与退出。
混合设计
敏感预处理、身份和规则留在专网或本地,通用推理按需使用多个云;高峰与灾备可采替代路径。混合不是堆叠平台,而是按责任边界分配工作。
模型闸道:多品牌能力的统一控制面
统一界面
闸道封装不同供应商的请求、认证、限流、重试、路由、内容安全和日志,应用不直接绑定特定 SDK。模型差异通过能力描述和适配器管理。
策略路由
按数据分类、任务、成本、延迟、可用性和地区选择模型。高敏感内容只能走受控部署,低风险摘要可用成本较低方案;故障时路由到经评测的替代模型。
防止最低公分母
统一不代表抹平特色。保留供应商特有能力的受控扩展,同时确保核心流程可替换。路由策略、提示和评测数据由机构掌握。
GPU 与推理容量:从峰值倒推架构
负载剖面
先量测请求长度、输出长度、并发、时段、任务优先级和延迟目标。平均流量无法代表办证高峰、突发事件或批量材料审查。
效率手段
使用动态批次、KV 快取、量化、模型并行、请求排队和小模型分流。对简单分类不必使用最大模型,对长文任务限制输入并采分段处理。
容量治理
设置容量上限、排队时限、降级模型、批处理窗口和优先级。定期做压力与故障测试,将 GPU 利用率、每件成功任务成本和超时率一起评估。
企业级数据平台:知识要有目录、血缘与质量
数据产品化
政策、指南、案例、表格和常见问题都要有拥有者、来源、有效期、权限、质量规则和更新承诺。Lakehouse 或其他平台只是承载,治理责任不能交给存储技术。
血缘追踪
能从答案回到索引区块、清洗结果、原始文件与发布来源,也能在原文件撤回时找出受影响索引和答案。这是更正、审计和影响分析的基础。
数据质量
监测缺栏、重复、失效、编码、解析失败和权限错配。质量异常可阻止索引发布,不能等模型回答错误后才发现。
LLMOps:模型升级就是生产变更
登录要求
记录模型来源、版本、量化、推理框架、提示、工具、知识快照、评测和部署环境。只写一个市场名称不足以重现行为。
发布流程
离线回归通过后进影子流量、内部灰度、小比例用户,再逐步扩大。每阶段设置错误自信、拒答、延迟、成本和安全停止条件。
回滚能力
保留上一稳定版本的模型、提示、索引和规则,并测试一键或可控回滚。数据结构变更要向后兼容,否则模型回滚也无法恢复服务。
可观测性:从 Token 到任务成功
四层信号
基础设施看 GPU、CPU、内存和网络;服务看延迟、错误和可用性;模型看引用、拒答和安全;业务看任务完成、人工接管和公共成果。
分散式追踪
用一致追踪标识符串连入口、检索、重排序、模型、工具和人工流程。日志采摘要与去识别化,避免为可观测性复制敏感数据。
行动门槛
每个指标要连到告警、拥有者和处置手册。仪表板本身不创造可靠性;若没有停止发布、扩容、切换或人工介入规则,数据只会被观看。
安全基线:身份、密钥、网络、DLP 与红队
最小权限
使用工作负载身份而非长期密钥,模型服务、数据、向量索引和工具分开授权。KMS 管理密钥,私有网络限制流向,管理操作采加强认证。
数据防护
DLP 在输入、日志与输出检测个人及敏感信息;必要数据先遮罩或替换。内容安全要区分非法、敏感、越权和不适当建议,不用单一黑名单处理所有风险。
持续红队
测试提示注入、数据外泄、工具滥用、越权检索、模型供应链和拒绝服务。修复后将案例加入回归集,确保下次升级不再出现。
证据链与可审计 AI
需要记录
输入摘要、身份与权限、模型和提示版本、检索来源、工具调用、规则命中、人工复核、最终输出、例外、延迟及成本构成完整事件。
最小化保存
不是所有原文都要长期保留。按数据分类保存哈希、来源指标、结构化决策和必要片段,原始敏感内容采较短期限或不落盘。
审计用途
证据链支持投诉、版本比较、供应商验收、成本核对、安全威胁和政策更正。若无法重建当时系统行为,就不能把模型用于高责任流程。
成功案例:香港数位政府共用底座
规模化成果
香港完成全政府电子服务审视,并在二〇二五年底前推进一百多项数位政府与智慧城市措施,运用大数据、人工智能、区块链及地理空间分析改善服务。
平台化方法
下一代政府云、大数据分析平台、数字身份、共享区块链、聊天机器人服务和统一入口,让部门重用身份、安全、数据和运营能力,而不是每个项目重建。
方法论启示
大模型落地也应先建立模型闸道、数据治理、评测、日志和工具授权等共用能力,再容纳 Google、AWS、腾讯云、字节跳动及其他技术生态。成功来自标准化治理,而非单一品牌包办。
成功案例:数字身份与企业身份
市民服务入口
一站式数字身份平台已有超过四百万登记用户,支持超过一千三百项服务和电子表格,并取得信息安全与私隐信息管理相关国际标准认证。
代理时代要求
AI 助手代表个人或企业办事时,必须知道代理人、被代理主体、授权范围、有效期和签署责任。模型不能从对话自行推断授权。
企业服务延伸
企业数字身份平台预计于二〇二六年底推出,核心包括企业验证、数字签署、预填和文件钱包。这为政府对企业及企业对企业的受控 AI 代理建立可信身份底座。
成功案例:同意数据交换与一次办事
已验证规模
同意数据交换闸道让部门或获授权机构在市民同意下交换已核实数据,每月约处理二百万次交换,降低市民重复提交。
对 AI 的价值
模型只取得完成任务所需字段,不要求用户上传整份证明。已核实数据仍要标示来源与时间,模型不能把一次同意延伸到训练或其他用途。
工程落点
把同意、目的、字段、时限、撤回和接收方写入数据契约与 API 控制。这个成功案例证明,数据共享要由制度、身份、接口和审计共同实现。
成功案例:开放数据形成创新生态
使用增长
公开数据下载量由二〇一九年约五十亿次增至二〇二五年十二月超过八百亿次,并提供五千七百多个数据集、约一百一十个 API 和二千五百多个数据提供者。
大模型准备度
高使用量不代表天然适合 AI。每个数据产品仍需数据字典、授权、更新频率、血缘、质量、变更通知及历史版本,才能安全进入检索和工具流程。
生态策略
以稳定 API 和开放格式让不同云、研究机构、初创及大型企业重用。政府掌握标准与服务成果,市场在共同规则下提供多品牌创新。
成功案例:AI+ 公务服务工具目录
七类切入
工具目录覆盖数字人客服、会议摘要、文件处理、写作内容、流程自动化、创意推广及数据分析预测,并通过论坛、研讨与技术配对协助部门采用。
目录要素
除功能和价格外,应标示部署模式、数据流、模型来源、日志、支持、可携、禁用场景和退出方式。同类用途用共同测试集比较,防止采购只看展示。
风险次序
先在低风险内部草稿、摘要和分类使用,要求人工确认后外发;累积评测与运营证据后,再进入跨部门和市民服务。
北部都会区与河套:大模型的真实测试场
产业空间
北部都会区聚焦创科、专上教育、健康与医疗创新,并以大学城、产业园、科研和社区形成完整环境;河套一区两园推动深港研发与成果转化。
可验证场景
可在受控范围测试科研知识助手、临床试验材料整理、园区服务、跨境专业信息及人才培训,同时评估身份、数据流、弱网和多语需求。
治理前置
living lab 必须有居民与用户沟通、数据最小化、退出、独立评估和开放接口。跨境项目先处理规则、标准和责任,再连接数据与模型。
跨境数据流:合同要求要落到 API
制度进展
大湾区个人信息跨境流动标准合同于二〇二三年开始先行,并自二〇二四年十一月起扩展至大湾区各行业,为区域协作提供制度工具。
技术翻译
工程要把目的、数据类别、接收方、保存、再转移、安全措施和事件处理转成字段白名单、权限、加密、日志、删除和告警。
模型特别风险
需确认跨境数据是否进入提示、快取、日志、向量索引或训练。服务商的处理位置和分包商也要透明,不能只检查主数据库位置。
多云与国产化兼容:不绑品牌,要绑标准
组合原则
不同技术生态在模型、数据、边缘、安全、全球区域和本地服务上各有长处。按数据驻留、任务质量、延迟、成本、供应韧性和人才选择,而不是平均分配。
可携基线
采标准 API、容器、开放数据格式、基础设施即代码、外部化提示与政策。身份、日志、评测和知识资产由机构控制。
验证方式
每年演练代表性服务转移或替代路由,测量时间、成本、功能差异和数据完整性。没有演练的多云通常只是合约层多供应商。
三年 TCO:价格表之外的完整成本
直接成本
包括 Token 或 GPU、存储、网络、软件授权、平台与支持。自建还有机房、容量闲置、硬件更新和备件;API 有价格变动、跨区和高峰成本。
隐性成本
数据清理、标注、评测、安全、人工复核、培训、客服、审计、事故、迁移和退出常高于首次原型。应计算每件成功任务,而不是每次调用。
决策比较
同时比较不做、改善既有流程、采购成熟产品、自建和混合方案。对低使用量或需求不稳项目,昂贵自建未必带来战略自主;对稳定高敏感负载,长期自建可能合理。
采购验收:把展示变成可问责能力
规格写法
描述公共成果、任务、错误边界、数据权利、接口、观测、服务等级和退出,不把某个品牌或模型名称写成唯一答案。
共同考卷
所有方案跑同一黄金数据集、红队集、压力场景和故障演练。正确率、安全、公平、引用、拒答、延迟、成本、可用性和申诉流程设硬门槛。
合约保障
规定模型更新通知、分包商、漏洞修补、数据导出、删除证明、移交期和服务终止。低价若伴随高退出成本,不能视为真正节省。
结语:把模型热度转化为长期公共能力
最终判断
新一代模型可以提升推理、多模态、工具和部署效率,但公共服务成功仍由问题、数据、流程、治理、人才与运营共同决定。榜单只能提供线索,不能代替本地证据。
成功经验
香港数位政府、数字身份、同意数据交换、开放数据、AI 工具目录及智慧城市共用平台的成功案例说明,规模化依靠共同底座、跨部门治理和持续服务。
行动原则
先定义可接受错误,建立自己的考卷;先检索与规则,再微调与代理;每次变更回归、灰度并可逆回滚;以开放接口、多品牌评测和退出演练维持自主。