← Financial Cloud Cloud Cloud Club · AWS Re:cap

极点宏观|Financial Cloud Cloud · AWS Re:cap

AWS Re:cap 09: 最大限度提高 AI 推理成本效益:战略性采用 AWS GPU 实例

演讲者: Troy Dai、Rex Law

场次: 09

场次
Summit Dev Lounge2026 Re:cap
01 把架构写成 Steering,引导 AI Agent
Summit Dev Lounge2026 Re:cap
02 Agent Harness 才是真正的工程护城河
Summit Dev Lounge2026 Re:cap
03 用白话询问可观测性数据
Summit Dev Lounge2026 Re:cap
04 以 Bedrock AgentCore 打造 Serverless AR 游戏
Summit Dev Lounge2026 Re:cap
05 AgentCore 上的多 Agent 量化回测
Summit Dev Lounge2026 Re:cap
06 三分钟用 Kiro 把博客变成幻灯片
Summit Dev Lounge2026 Re:cap
AWS Community Day Hong Kong 2025 Re:cap
02 使用 Terraform 实现 AWS 合规
AWS Community Day Hong Kong 2025 Re:cap
03 从初学者到构建者:一段精彩的 AWS 云之旅
AWS Community Day Hong Kong 2025 Re:cap
04 以团队为先:使用 Laravel 与 Bref 开展无服务器工程
AWS Community Day Hong Kong 2025 Re:cap
05 活动开幕式
AWS Community Day Hong Kong 2025 Re:cap
06 智能体到智能体:在 AWS 上构建可互操作的 AI
AWS Community Day Hong Kong 2025 Re:cap
07 利用另一类遥测数据,借助 AI 智能体更快改进
AWS Community Day Hong Kong 2025 Re:cap
08 告别氛围编程:使用 Kiro 进行规格驱动开发
AWS Community Day Hong Kong 2025 Re:cap
09 使用 MCP 与 AI 智能体进行自动化测试
AWS Community Day Hong Kong 2025 Re:cap
10 使用机器学习方法实现电信安全现代化
AWS Community Day Hong Kong 2025 Re:cap
11 重新思考生成式 AI 智能体:RAG 与 MCP
AWS Community Day Hong Kong 2025 Re:cap
12 使用 TAK 和 AWS 开展灾难与应急响应
AWS Community Day Hong Kong 2025 Re:cap
13 从测试视角重新思考无服务器应用程序工作流
AWS Community Day Hong Kong 2025 Re:cap
14 Practical AWS FinOps for Cloud Success
AWS Community Day Hong Kong 2025 Re:cap
15 基于 AWS 的 AI 驱动全球纯 Alpha 宏观交易:重塑风险调整后资产收益
AWS Community Day Hong Kong 2025 Re:cap
FSI Recap
01 现代交易生命周期:从交易到结算
FSI Recap
02 Goldman Sachs:通过 Fast Track 加速应用程序上云 - AWS Re:cap Q1/2023
FSI Recap
03 Zurich Insurance Group:在 AWS 上构建高效的日志管理解决方案
FSI Recap
04 FSI Meetup 2025 年第四季度 - Brex 数据库灾难恢复
FSI Recap
05 FSI Meetup 2025 Q4 - Graviton 迁移成功案例
FSI Recap
06 FSI Meetup 2025 Q4 - Stifel 现代数据平台
FSI Recap
07 FSI Meetup 2025 Q4 - PayPal 金融交易数据对账系统
FSI Recap
08 FSI Meetup 2025 Q4 - 规模化提升韧性
FSI Recap
09 最大限度提高 AI 推理成本效益:战略性采用 AWS GPU 实例
FSI Recap
10 高级智能体 AI 设计模式
FSI Recap
11 在 AWS 上构建全新的现代化应用
FSI Recap
AWS re:Invent 2025
01 Coinbase re:Invent 回顾 (IND3312)
AWS re:Invent 2025
02 利用 AI 和 AWS 构建未来交易平台
AWS re:Invent 2025
03 交易创新:Jefferies 基于 Amazon Bedrock 构建的 AI 助手 (IND3315)
AWS re:Invent 2025
04 FSI 如何通过 Agentic AI (GBL302) 彻底改变 HFT 分析
AWS re:Invent 2025
05 使用 Amazon Time Sync 改进分布式系统(采用 Nasdaq)
AWS re:Invent 2025
06 Amazon Aurora HA 和 DR 全球弹性设计模式 (DAT442)
AWS re:Invent 2025
07 构建智能体式 AI:Amazon Nova Act 与 Strands Agents 实践 (DEV327)
AWS re:Invent 2025
08 深入探讨 Amazon Aurora 及其创新 (DAT441)
AWS re:Invent 2025
09 深入探讨 Amazon S3(STG407)
AWS re:Invent 2025
10 Nasdaq:为全球金融服务构建弹性基础设施 (HMC327)
AWS re:Invent 2025
11 AWS Lambda 新功能 (CNS376)
AWS re:Invent 2025
12 使用 Kiro 进行规范驱动开发 (DEV314)
AWS re:Invent 2025
13 Amazon 的 FinOps:全球电商巨头的云成本管理经验 (AMZ308)
AWS re:Invent 2025
14 AWS 上交易平台的 Tick-to-Trade 延迟
AWS re:Invent 2025
政务数据
01 The AI Era: The Boundary Between Development and Design Is Disappearing
政务数据
02 端侧多模态 AI 与智慧城市实践
政务数据
03 大模型能力评测与 AI 项目落地方法论
政务数据
04 基于云代理的政府开发全链路受控自动化
政务数据
05 从多智能体看 Agent 时代软件新生态
政务数据
06 AI 驱动的宏观量化研究与智慧治理
政务数据
07 公共数据授权运营与智慧政务实践
政务数据
08 数据资产化落地实践:确权合规、工程治理与数字政府案例
政务数据
09 AI技术赋能心理健康公益:可信平台的治理、架构与实践
政务数据
Amarathon 2025 回顾
01 开发者的智能体架构设计路线图
Donnie Prakoso
02 Amazon Bedrock 数据自动化
Hafiz Syed Ashir Hassan
03 AgentCore 上的多智能体
Tan Xin
04 实践中构建智能体式 AI:Nova Act 与 Strands Agents
Haowen Huang
04 使用规格驱动开发,通过 Kiro 加速迁移项目
Sanchit Dilip Jain
06 从「匹配」到「理解」:由 AgentCore Memory 驱动的个性化 AI 搜索实践
Liu Cao
07 从观察到优化:从 LLM 可观测性迈向 AIOps,将实时洞察转化为智慧自动化
Jimmy Soh
08 部署 TEAM 并打造最佳工程团队
Yuji Oshima
09 五年来所谓无服务器数据库带来的五个惨痛教训
Renato Losio
14 如果 AI 替我工作会怎样:Q Developer CLI 与 Kiro 如何改变我的日常工作
Miguel Angel Muñoz
16 兼顾速度与警觉:Amazon Bedrock Agent 开发的安全要点
Brian Tarbox
26 在单张 H100 上运行 OSS LLM:更智能、更便宜、更快速
Adit Modi Adit Modi
28 现代统一元数据架构:打破数据孤岛的新方法
Shaofeng Shi
29 无服务器 MediaOps:使用 Amazon Web Services 上的 AI 自动化视频工作流
Luis Valdivia
30 通过大规模性能测试构建兼具效率与可靠性的架构
Luis Guirigay
31 通过开源连接世界:技术、社区与全球开发者关系的实践历程
Richard Lin
33 构建流式 Iceberg 表以进行实时物流分析
Fahad Shah
34 加速大规模机器人策略训练:基于 Kiro、Trainium 和 EKS 的自动化闭环架构
Junjie Tang
35 通过规格驱动开发,从 Vibe 走向可行方案
Ricardo Sueiras
36 让云成本分析更智能:使用 Strands 和 AgentCore 构建 FinOps 智能体
Xiaofei Li
37 使用 CNCF Kagent、K8sGPT 和 Nova Sonic 转型 K8s 对话式智能体 AIOps
Shaoyi Li

@ AWSome Day Hong Kong 2025

本场活动探讨了如何为 AI 和机器学习工作负载选择 AWS GPU 实例及购买选项。核心观点是:要实现成本效益,需要根据模型、吞吐量、延迟和工作负载的可预测性,选择合适的实例系列和定价模式。


GPU 实例系列

Amazon EC2 G 系列实例:

● 针对图形密集型应用和机器学习推理进行了优化。

● G6 实例使用 NVIDIA L4 GPU。

● G6e 实例使用 NVIDIA L40S GPU。

● 非常适合经济高效的中等吞吐量推理工作负载。

Amazon EC2 P 系列实例:

● 专为高性能机器学习训练和高吞吐量推理而设计。

● P4 实例使用 NVIDIA A100 GPU。

● P5 实例使用 NVIDIA H100 GPU。

● P6 实例使用基于 Blackwell 架构的 NVIDIA B200 GPU。

● 非常适合大规模、延迟敏感型推理和模型训练工作负载。


如何在 G 系列和 P 系列实例之间进行选择

G 系列实例非常适合:

● 成本敏感型工作负载。

● 中小型 AI 模型。

● 参数量少于 300 亿的中小型语言模型。

● 经过蒸馏的大语言模型。

● XGBoost 和随机森林等传统机器学习模型。

● 聊天机器人、个性化引擎、推荐系统和图像识别。

P 系列实例非常适合:

● 参数量超过 300 亿的大语言模型。

● 高吞吐量推理。

● 延迟敏感型应用。

● 视觉语言和多模态 AI 系统。

● 大型 AI 模型训练。


Amazon EC2 购买选项

按需实例:

● 按秒计费,无需长期承诺即可获得计算容量。

● 灵活性最高,但每小时费率也最高。

● 适用于测试、原型设计、新服务上线、突发需求和不可预测的工作负载。

Savings Plans(节省计划):

● 需要承诺一年或三年的使用量。

● 与按需定价相比,成本最多可降低 72%。

● 适用于稳定且可预测的生产推理。

● Compute Savings Plans 可跨实例系列和区域灵活使用。

● EC2 Instance Savings Plans 针对特定实例系列和区域提供更大折扣。

竞价型实例:

● 使用 Amazon EC2 闲置容量,与按需定价相比,折扣最高可达 90%。

● 实例可能在收到两分钟通知后中断。

● 适用于容错、灵活且无状态的工作负载。

● 常见使用场景包括批处理、非关键推理以及非高峰时段的扩展。

EC2 Capacity Blocks for ML:

● 为未来的指定开始日期和时间段预留加速计算容量。

● 最多可提前八周预订。

● 预订时长可为 1 至 182 天。

● 每个容量区块可包含 1 至 64 个实例。

● 采用固定的预付定价。

● 支持 P4d、P5、P5en 和 P6 等实例系列。

● 适用于需要在计划时间内确保获得稀缺容量的 GPU 训练或推理作业。


战略性购买建议

按需实例:

● 开发和实验。

● 新服务上线。

● 需求不可预测或变化幅度很大的工作负载。

Savings Plans:

● 利用率稳定且可预测的生产推理。

● 有使用数据支持承诺的长期运行工作负载。

竞价型实例:

● 非关键推理。

● 批处理作业和非高峰时段处理。

● 具备检查点和重试机制的可中断工作负载。

Capacity Blocks:

● 按计划进行的大规模训练。

● 有明确期限的推理活动。

● 必须在已知时段内确保 GPU 容量的工作负载。


GPU 定价近期变化

● AWS 将 P4、P5 和 P5en 实例的价格降低了约 25% 至 45%。

● 降价适用于按需定价、EC2 Instance Savings Plans 和 Compute Savings Plans。

● P5 和 P5en 现已支持一年期 EC2 Instance Savings Plans。

● 与按需定价相比,这些一年期计划最多可节省 40%。

● 配备 NVIDIA B200 GPU 的 P6 实例已纳入 Savings Plans。

区域可用性:

● AWS 降低了美国以外多个区域中 P5、P5e 和 P5en 实例的 EC2 Capacity Blocks for ML 定价。

● 更一致的区域定价提高了成本的可预测性。

● 标准化定价简化了机器学习工作负载的多区域规划。

● 全球客户可以预留 GPU 容量,受地理位置影响的价格差异也更小。


定价变化带来的影响

降低总体拥有成本:

● 高性能推理和训练变得更加经济实惠。

● AI 实验和部署预算可以支持更多工作负载。

改善全球可用性:

● 扩展的区域可用性有助于实施全球部署战略。

● 更一致的价格简化了全球容量规划。

提高定价灵活性:

● 企业可以组合使用按需实例、Savings Plans、竞价型实例和 Capacity Blocks。

● 与三年期承诺相比,一年期承诺降低了财务风险。


模型和工作负载优化

模型优化:

● 在 G6 或 G6e 上部署较小或经过优化的模型,在保持响应速度的同时降低成本。

● 使用 INT4 或 INT8 量化,使较大的模型能够在较小的 GPU 实例上运行。

● 考虑使用计算需求更低但质量相当的蒸馏模型。

● 在适当情况下应用模型压缩。

批处理:

● 合并多个推理请求,以提高 GPU 利用率。

● 使用动态批处理平衡吞吐量和延迟。

● 使用竞价型实例在非高峰时段运行非紧急处理任务。

实时推理:

● 将 G6 或 G6e 与按需实例或 Savings Plans 结合使用。

● 围绕低延迟服务级别目标进行设计。

● 根据需求自动扩缩。

● 在需要较低网络延迟时采用区域化部署。

批量推理:

● 考虑使用 P5 竞价型实例或 Capacity Blocks。

● 在非高峰时段处理大量数据。

● 使用检查点机制从竞价型实例中断中恢复。

● 构建基于队列的架构。

● 主要针对吞吐量进行优化,而不是请求延迟。


决策框架

1. 评估模型大小和吞吐量要求。

2. 确定工作负载需求是否可预测。

3. 评估延迟敏感度。

4. 明确预算和可靠性限制。

5. 选择合适的实例系列,例如注重成本效益时选择 G 系列,注重性能时选择 P 系列。

6. 选择与工作负载可预测性和中断容忍度相匹配的购买选项。

7. 监控利用率并持续优化。


实施最佳实践

技术优化:

● 实施模型压缩和量化。

● 使用动态批次大小。

● 在工作负载支持的情况下启用 GPU 共享。

● 监控 GPU 利用率,发现闲置或利用不足的容量。

● 优化容器镜像,以减少启动时间和存储开销。

成本优化:

● 定期审查工作负载模式。

● 使用 AWS Cost Explorer 分析支出。

● 配置预算和成本提醒。

● 组合使用不同购买选项,而不是对所有工作负载采用同一种模式。

● 每年重新评估 Savings Plans 和其他承诺。


要点总结

● AWS 近期下调 GPU 价格,为降低推理和训练成本创造了重要机会。

● 经济高效的推理选择 G 系列实例,高性能训练或推理选择 P 系列实例。

● 根据工作负载的稳定性、灵活性和中断容忍度选择购买选项。

● 在迁移到更昂贵的 GPU 实例之前,先优化模型和批处理。

● 混合购买策略可以在成本、性能、容量保障和可靠性之间取得平衡。

● 随着模型要求和需求模式的变化,应持续审查 GPU 基础设施。

后续步骤:

● 审查当前 GPU 利用率和成本。

● 找出可受益于新定价的工作负载。

● 测试量化、蒸馏及其他优化技术。

● 评估区域化部署机会。

● 考虑为即将进行的大型训练或推理作业使用 Capacity Blocks。