← Financial Cloud Cloud Cloud Club · AWS Re:cap

极点宏观|Financial Cloud Cloud · AWS Re:cap

AWS Re:cap 04: FSI Meetup 2025 年第四季度 - Brex 数据库灾难恢复

演讲者: Fabiano Honorato、Michelle Koo、Stephen Brandon

场次: 04

场次
Summit Dev Lounge2026 Re:cap
01 把架构写成 Steering,引导 AI Agent
Summit Dev Lounge2026 Re:cap
02 Agent Harness 才是真正的工程护城河
Summit Dev Lounge2026 Re:cap
03 用白话询问可观测性数据
Summit Dev Lounge2026 Re:cap
04 以 Bedrock AgentCore 打造 Serverless AR 游戏
Summit Dev Lounge2026 Re:cap
05 AgentCore 上的多 Agent 量化回测
Summit Dev Lounge2026 Re:cap
06 三分钟用 Kiro 把博客变成幻灯片
Summit Dev Lounge2026 Re:cap
AWS Community Day Hong Kong 2025 Re:cap
02 使用 Terraform 实现 AWS 合规
AWS Community Day Hong Kong 2025 Re:cap
03 从初学者到构建者:一段精彩的 AWS 云之旅
AWS Community Day Hong Kong 2025 Re:cap
04 以团队为先:使用 Laravel 与 Bref 开展无服务器工程
AWS Community Day Hong Kong 2025 Re:cap
05 活动开幕式
AWS Community Day Hong Kong 2025 Re:cap
06 智能体到智能体:在 AWS 上构建可互操作的 AI
AWS Community Day Hong Kong 2025 Re:cap
07 利用另一类遥测数据,借助 AI 智能体更快改进
AWS Community Day Hong Kong 2025 Re:cap
08 告别氛围编程:使用 Kiro 进行规格驱动开发
AWS Community Day Hong Kong 2025 Re:cap
09 使用 MCP 与 AI 智能体进行自动化测试
AWS Community Day Hong Kong 2025 Re:cap
10 使用机器学习方法实现电信安全现代化
AWS Community Day Hong Kong 2025 Re:cap
11 重新思考生成式 AI 智能体:RAG 与 MCP
AWS Community Day Hong Kong 2025 Re:cap
12 使用 TAK 和 AWS 开展灾难与应急响应
AWS Community Day Hong Kong 2025 Re:cap
13 从测试视角重新思考无服务器应用程序工作流
AWS Community Day Hong Kong 2025 Re:cap
14 Practical AWS FinOps for Cloud Success
AWS Community Day Hong Kong 2025 Re:cap
15 基于 AWS 的 AI 驱动全球纯 Alpha 宏观交易:重塑风险调整后资产收益
AWS Community Day Hong Kong 2025 Re:cap
FSI Recap
01 现代交易生命周期:从交易到结算
FSI Recap
02 Goldman Sachs:通过 Fast Track 加速应用程序上云 - AWS Re:cap Q1/2023
FSI Recap
03 Zurich Insurance Group:在 AWS 上构建高效的日志管理解决方案
FSI Recap
04 FSI Meetup 2025 年第四季度 - Brex 数据库灾难恢复
FSI Recap
05 FSI Meetup 2025 Q4 - Graviton 迁移成功案例
FSI Recap
06 FSI Meetup 2025 Q4 - Stifel 现代数据平台
FSI Recap
07 FSI Meetup 2025 Q4 - PayPal 金融交易数据对账系统
FSI Recap
08 FSI Meetup 2025 Q4 - 规模化提升韧性
FSI Recap
09 最大限度提高 AI 推理成本效益:战略性采用 AWS GPU 实例
FSI Recap
10 高级智能体 AI 设计模式
FSI Recap
11 在 AWS 上构建全新的现代化应用
FSI Recap
AWS re:Invent 2025
01 Coinbase re:Invent 回顾 (IND3312)
AWS re:Invent 2025
02 利用 AI 和 AWS 构建未来交易平台
AWS re:Invent 2025
03 交易创新:Jefferies 基于 Amazon Bedrock 构建的 AI 助手 (IND3315)
AWS re:Invent 2025
04 FSI 如何通过 Agentic AI (GBL302) 彻底改变 HFT 分析
AWS re:Invent 2025
05 使用 Amazon Time Sync 改进分布式系统(采用 Nasdaq)
AWS re:Invent 2025
06 Amazon Aurora HA 和 DR 全球弹性设计模式 (DAT442)
AWS re:Invent 2025
07 构建智能体式 AI:Amazon Nova Act 与 Strands Agents 实践 (DEV327)
AWS re:Invent 2025
08 深入探讨 Amazon Aurora 及其创新 (DAT441)
AWS re:Invent 2025
09 深入探讨 Amazon S3(STG407)
AWS re:Invent 2025
10 Nasdaq:为全球金融服务构建弹性基础设施 (HMC327)
AWS re:Invent 2025
11 AWS Lambda 新功能 (CNS376)
AWS re:Invent 2025
12 使用 Kiro 进行规范驱动开发 (DEV314)
AWS re:Invent 2025
13 Amazon 的 FinOps:全球电商巨头的云成本管理经验 (AMZ308)
AWS re:Invent 2025
14 AWS 上交易平台的 Tick-to-Trade 延迟
AWS re:Invent 2025
政务数据
01 The AI Era: The Boundary Between Development and Design Is Disappearing
政务数据
02 端侧多模态 AI 与智慧城市实践
政务数据
03 大模型能力评测与 AI 项目落地方法论
政务数据
04 基于云代理的政府开发全链路受控自动化
政务数据
05 从多智能体看 Agent 时代软件新生态
政务数据
06 AI 驱动的宏观量化研究与智慧治理
政务数据
07 公共数据授权运营与智慧政务实践
政务数据
08 数据资产化落地实践:确权合规、工程治理与数字政府案例
政务数据
09 AI技术赋能心理健康公益:可信平台的治理、架构与实践
政务数据
Amarathon 2025 回顾
01 开发者的智能体架构设计路线图
Donnie Prakoso
02 Amazon Bedrock 数据自动化
Hafiz Syed Ashir Hassan
03 AgentCore 上的多智能体
Tan Xin
04 实践中构建智能体式 AI:Nova Act 与 Strands Agents
Haowen Huang
04 使用规格驱动开发,通过 Kiro 加速迁移项目
Sanchit Dilip Jain
06 从「匹配」到「理解」:由 AgentCore Memory 驱动的个性化 AI 搜索实践
Liu Cao
07 从观察到优化:从 LLM 可观测性迈向 AIOps,将实时洞察转化为智慧自动化
Jimmy Soh
08 部署 TEAM 并打造最佳工程团队
Yuji Oshima
09 五年来所谓无服务器数据库带来的五个惨痛教训
Renato Losio
14 如果 AI 替我工作会怎样:Q Developer CLI 与 Kiro 如何改变我的日常工作
Miguel Angel Muñoz
16 兼顾速度与警觉:Amazon Bedrock Agent 开发的安全要点
Brian Tarbox
26 在单张 H100 上运行 OSS LLM:更智能、更便宜、更快速
Adit Modi Adit Modi
28 现代统一元数据架构:打破数据孤岛的新方法
Shaofeng Shi
29 无服务器 MediaOps:使用 Amazon Web Services 上的 AI 自动化视频工作流
Luis Valdivia
30 通过大规模性能测试构建兼具效率与可靠性的架构
Luis Guirigay
31 通过开源连接世界:技术、社区与全球开发者关系的实践历程
Richard Lin
33 构建流式 Iceberg 表以进行实时物流分析
Fahad Shah
34 加速大规模机器人策略训练:基于 Kiro、Trainium 和 EKS 的自动化闭环架构
Junjie Tang
35 通过规格驱动开发,从 Vibe 走向可行方案
Ricardo Sueiras
36 让云成本分析更智能:使用 Strands 和 AgentCore 构建 FinOps 智能体
Xiaofei Li
37 使用 CNCF Kagent、K8sGPT 和 Nova Sonic 转型 K8s 对话式智能体 AIOps
Shaoyi Li

Brex 简介

● 用于管理费用、差旅和信贷的财务运营系统平台。

● 工程经理和团队成员探讨如何利用 Amazon Aurora 提高弹性并支持国际扩张

Brex 服务

● 企业卡、费用管理、差旅、账单支付和银行业务

● 旨在帮助客户明智、合理地支出


为灾难场景做好基础设施准备的重要性

● 重点关注数据层,主要使用 PostgreSQL,并通过 PG bouncer 和副本支持应用及分析用途

● 将较小的数据库合并到单个数据库实例中

● 过去的灾难恢复流程依赖人工操作且耗时较长

灾难恢复解决方案的目标

● 采用温备灾难恢复解决方案,以缩短恢复时间目标(RTO)并降低恢复点目标(RPO)

● RTO:灾难发生后恢复正常运营所允许的最长时间

● RPO:可容忍的最大数据丢失量

确定 RPO 和 RTO

● 分析指标、评估当前能力并开展广泛测试

● 了解应用将如何应对额外的延迟和数据丢失

选择 Amazon Aurora Global Database

● 无需大幅更改当前设置即可提供所需功能

● 可在需要时使用辅助区域

当前实施中的注意事项

● 为读取应用创建自定义 DNS 端点,供应用和分析用途共同使用

迁移挑战与方案

● 由于可能导致应用停机,从 PostgreSQL 迁移到 Aurora 存在困难

● 专注于自动化,以尽量减少人工处理

● 构建 Temporal 工作流,用于运行自动化任务、验证迁移步骤并准备环境

● 在自动化流程确认数据库状态无误后,完成向 Aurora Global 的切换

迁移期间的停机管理

● AWS 为迁移提供了一个较短的停机窗口(2–3 分钟)

● 利用此窗口调整端点以及使用该数据库的应用

● 借助短暂的停机时段实现平稳过渡


使用 Temporal 工作流实现自动化

迁移前的当前状态

● 应用连接到 PG bouncer,后者连接到 PostgreSQL 实例和副本实例

迁移流程

● 通过 AWS 创建 Aurora 只读副本,且无需停机

● 工作流提升 Aurora 只读副本,并创建 Aurora 全局集群

● 应用连接到 PG bouncer,后者再使用全局写入器端点连接到 Aurora 全局集群

● 可以再创建一个集群,以构建多区域环境

Flux:

● 通过 git 存储库保持 Kubernetes 集群同步的工具

● 工作流预先生成 Flux git 拉取请求

● 人工验证后,工作流自动合并拉取请求

● 向工作流发送确认信号,使其继续执行停机操作并提升 Aurora 全局集群

使用 AI 自动审查 Flux

● 识别拉取请求中的错误或问题,并提供审查意见

试运行迁移标志

● 可在不触发破坏性操作或停机的情况下测试迁移

● 预先创建 Flux git 拉取请求以供审查,但不合并请求或提升集群


迁移中使用的其他工具和流程

● Terraform:创建用于将数据库作为新全局集群进行管理的模板

● 迁移工作流完成后,为每个数据库添加 Terraform 配置

● 通过 Terraform 管理全局集群中的读取器实例

内部命令行工具:

● 添加命令,使团队能够以自助方式为其 Aurora 全局集群执行切换或故障转移

● 故障转移:用于从非计划中断中恢复;当一个区域停机时,切换到其他区域

● 切换:用于运营维护或计划内操作等受控场景,不会丢失数据


通过迭代提升工作流性能的历程

● 最初的工作流完成端到端自动化大约需要 15 分钟

● 提升 Aurora 全局集群并创建 Flux git 拉取请求时会出现停机

● 流程按顺序执行,未进行并行化

引入并行化后,工作流耗时缩短至 10 分钟

● 更新工作流以并行执行步骤,包括获取凭证和预先创建 Flux 拉取请求

● 引入试运行标志,用于对迁移进行非破坏性测试

最终重构工作流后,执行时间缩短至 3 分钟

● 预先创建 Flux 拉取请求,使工作流可以暂停并等待停机窗口

● 减少 git add 操作以降低成本

● 添加信号命令,以受控方式启动停机

实施过程中获得的经验

● 在正式迁移前进行全面测试和审慎部署至关重要

● 从预发布环境开始,解决问题后再进入生产环境

● 自动化可减少人为错误,并能轻松复制到多个数据库

● 使用试运行选项模拟迁移,以便在不造成停机的情况下测试工作流(试运行或演练是一种软件测试过程,用于确保系统能够正常工作且不会导致严重故障。)

● 每周迁移少量数据库,通过迭代持续改进