← Financial Cloud Cloud クラウドクラブ · Amarathon 2025 振り返り

極点マクロ|Financial Cloud Cloud · AWS Amarathon 2025

極点マクロ|Amarathon 2025 振り返り 28:最新の統合メタデータアーキテクチャ:データサイロを解消する新たなアプローチ

登壇者: Shaofeng Shi

セッション: 28

セッション
Summit Dev Lounge2026 Re:cap
01 アーキテクチャを Steering として記述し、AI Agent を導く
Summit Dev Lounge2026 Re:cap
02 Agent Harness こそ真のエンジニアリングの堀
Summit Dev Lounge2026 Re:cap
03 平易な言葉で可観測性データを尋ねる
Summit Dev Lounge2026 Re:cap
04 Bedrock AgentCore で Serverless AR ゲームを構築する
Summit Dev Lounge2026 Re:cap
05 AgentCore 上のマルチ Agent クオンツ・バックテスト
Summit Dev Lounge2026 Re:cap
06 3 分でブログをスライドにする——Kiro で
Summit Dev Lounge2026 Re:cap
AWS Community Day Hong Kong 2025 Re:cap
02 TerraformによるAWSコンプライアンス
AWS Community Day Hong Kong 2025 Re:cap
03 初心者からビルダーへ――素晴らしいクラウドの旅
AWS Community Day Hong Kong 2025 Re:cap
04 LaravelとBrefによるチームファーストのサーバーレスエンジニアリング
AWS Community Day Hong Kong 2025 Re:cap
05 イベント開会式
AWS Community Day Hong Kong 2025 Re:cap
06 AWS 上で相互運用可能な AI を構築する
AWS Community Day Hong Kong 2025 Re:cap
07 別のテレメトリデータを AI エージェントで活用し、改善を加速する
AWS Community Day Hong Kong 2025 Re:cap
08 Kiro による仕様駆動開発
AWS Community Day Hong Kong 2025 Re:cap
09 MCP と AI エージェントを活用した自動テスト
AWS Community Day Hong Kong 2025 Re:cap
10 機械学習を活用したアプローチ
AWS Community Day Hong Kong 2025 Re:cap
11 RAGとMCP
AWS Community Day Hong Kong 2025 Re:cap
12 TAKとAWSを活用した災害・緊急対応
AWS Community Day Hong Kong 2025 Re:cap
13 テストの観点からサーバーレスアプリケーションのワークフローを再考する
AWS Community Day Hong Kong 2025 Re:cap
14 クラウド成功のための実践的なAWS FinOps
AWS Community Day Hong Kong 2025 Re:cap
15 リスク調整後資産リターンの革新
AWS Community Day Hong Kong 2025 Re:cap
FSI Recap
01 Modern Trade Lifecycle: Trading to Settlement
FSI Recap
02 Goldman Sachs: Fast Track your applications onto Cloud - AWS Re:cap Q1/2023
FSI Recap
03 Zurich Insurance Group: Building an Effective Log Management Solution on AWS
FSI Recap
04 FSI Meetup 2025 Q4 - Brex Database Disaster Recovery
FSI Recap
05 FSI Meetup 2025 Q4 - A Graviton Migration Success Story
FSI Recap
06 FSI Meetup 2025 Q4 - Stifel Modern Data Platform
FSI Recap
07 FSI Meetup 2025 Q4 - Financial Transaction Data Reconciler PayPal
FSI Recap
08 FSI Meetup 2025 Q4 - Scaling Resilience
FSI Recap
09 Maximizing AI Inference Cost Efficiency: Strategic Adoption of AWS GPU Instances
FSI Recap
10 Advanced Agentic AI Design Patterns
FSI Recap
11 Build New Modern Apps on AWS
FSI Recap
AWS re:Invent 2025
01 Coinbase re:Invent の要約 (IND3312)
AWS re:Invent 2025
02 AI と AWS を活用した未来の取引プラットフォームの構築
AWS re:Invent 2025
03 トレーディングイノベーション: Amazon Bedrock (IND3315) の Jefferies AI アシスタント
AWS re:Invent 2025
04 FSI がエージェント型 AI で HFT 分析に革命をもたらした方法 (GBL302)
AWS re:Invent 2025
05 Nasdaq をフィーチャーした Amazon Time Sync による分散システムの改善
AWS re:Invent 2025
06 Amazon Aurora HA および DR グローバル復元力のための設計パターン (DAT442)
AWS re:Invent 2025
07 エージェントの構築 AI: Amazon Nova Act および Strands エージェントの実践 (DEV327)
AWS re:Invent 2025
08 Amazon Aurora とそのイノベーションの詳細 (DAT441)
AWS re:Invent 2025
09 Amazon S3 の詳細解説 (STG407)
AWS re:Invent 2025
10 Nasdaq:グローバル金融サービス向けのレジリエントなインフラストラクチャを構築する (HMC327)
AWS re:Invent 2025
11 AWS Lambda の新機能 (CNS376)
AWS re:Invent 2025
12 Kiro によるスペック駆動開発 (DEV314)
AWS re:Invent 2025
13 Amazon の FinOps: 世界的な E コマース大手から学ぶクラウドコストの教訓 (AMZ308)
AWS re:Invent 2025
14 AWS 上のティック・トゥ・トレード低レイテンシ取引プラットフォーム
AWS re:Invent 2025
Government data
01 The AI Era: The Boundary Between Development and Design Is Disappearing
Government data
02 On-Device Multimodal AI and Smart-City Practice
Government data
03 Large-Model Capability Evaluation and a Method for Landing AI Projects
Government data
04 Controlled End-to-End Automation of Government Development with Cloud Agents
Government data
05 A New Software Ecosystem for the Agent Era, Seen Through Multi-Agent Systems
Government data
06 AI-Driven Macro Quantitative Research and Smart Governance
Government data
07 Authorized Operation of Public Data and Smart-Government Practice
Government data
08 Putting Data Assetization into Practice: Rights, Compliance, Engineering Governance, and Digital-Government Cases
Government data
09 AI for Mental-Health Public Welfare: Governance, Architecture, and Practice of a Trustworthy Platform
Government data
Amarathon 2025 振り返り
01 エージェント向けアーキテクチャ設計への開発者ロードマップ
Donnie Prakoso
02 Amazon Bedrock Data Automation
Hafiz Syed Ashir Hassan
03 AgentCore 上のマルチエージェント
Tan Xin
04 Nova Act と Strands Agents を実践で活用したエージェント型 AI の構築
Haowen Huang
04 仕様駆動開発と Kiro で移行プロジェクトを加速
Sanchit Dilip Jain
06 「マッチング」から「理解」へ: AgentCore Memory が実現するパーソナライズド AI 検索の実践
Liu Cao
07 観測から最適化へ – LLM オブザーバビリティから AIOps へ、リアルタイムの洞察をインテリジェントな自動化に変える
Jimmy Soh
08 TEAM の導入と最高のエンジニアリングチームの構築
Yuji Oshima
09 いわゆるサーバーレスデータベースの5年間から得た5つの厳しい教訓
Renato Losio
14 AI が私の仕事をしたらどうなるか Q Developer CLI と Kiro が私の日常業務をどう変えたか
Miguel Angel Muñoz
16 警戒を保ちながら迅速に:Amazon Bedrock エージェント開発に不可欠なセキュリティ
Brian Tarbox
26 1 台の H100 で OSS LLM をよりスマートに、低コストで、高速に実行
Adit Modi Adit Modi
28 最新の統合メタデータアーキテクチャ:データサイロを解消する新たなアプローチ
Shaofeng Shi
29 サーバーレス MediaOps:Amazon Web Services 上の AI による動画ワークフローの自動化
Luis Valdivia
30 大規模パフォーマンステストによる効率性と信頼性を重視したアーキテクチャ設計
Luis Guirigay
31 オープンソースで世界をつなぐ: テクノロジー、コミュニティ、グローバルな開発者関係をめぐる実践の旅
Richard Lin
33 リアルタイム物流分析のためのストリーミング Iceberg テーブルの構築
Fahad Shah
34 大規模ロボット戦略トレーニングの高速化: Kiro、Trainium、EKS に基づく自動クローズドループアーキテクチャ
Junjie Tang
35 仕様駆動開発で「Vibe」から実用レベルへ
Ricardo Sueiras
36 クラウドコスト分析をよりスマートに: StrandsとAgentCoreによるFinOpsインテリジェントエージェントの構築
Xiaofei Li
37 CNCF Kagent、K8sGPT、Nova Sonicを使用したK8s向け対話型エージェントAIOpsの変革
Shaoyi Li

データのサイロ化解消に向けた略史

● 1980 年代後半:データウェアハウス

● 2011:データレイク

● 2020

レイクハウス 目標

● SSOT(信頼できる唯一の情報源)の実現

● データの完全な管理

● データ漏えいなどのリスクを排除し、データ駆動型ビジネスのコンプライアンスを確保。クラウドと

● リージョンに生じる新たなデータサイロ

ベンダー「ロックイン」を好む人はいません

● データが異なるクラウドベンダーにデプロイされている場合:

● まとめて処理することが困難

● 移動コストが高い

地理的に分散したデータを好む人はいませんが、

● ビジネスの国際化に伴い、データも移動します:

● 規制要件

● 大洋をまたぐ転送のコスト

● 「データアクセス」だけではない

目に見えるデータ

● 技術データとビジネスデータ

● リーガルホールドデータ

見落とされがちなメタデータ

● サードパーティデータ

● PII と PI データ

● 認証情報

● IP

データ データ管理機能

● データ接続:最も重要なデータに接続します。

● データ権利の自動化:データ権利に関するリクエストとレポートをエンドツーエンドで自動化します。

● メタデータのエンリッチメント:技術メタデータにビジネスおよび運用メタデータを付加し、完全な可視性を確保します。

● データ検出:あらゆる場所にあるすべてのデータを自動的に検出、分類、マッピングします。

● データ分類:より多くの場所で、より多くの種類のデータを自動的に分類します。

● データライフサイクル管理:収集から破棄までのデータライフサイクル管理を簡素化し、自動化します。


Gravitino とは

● データ/AI のための次世代統合データカタログ

連携先

● Trino

● Spark

● Flink

● Doris

● ClickHouse

● PyTorch

● TensorFlow

Gravitino を使用したメタデータレイクのコンポーネント

● Hive Metastore

● 組み込みカタログ

● Schema Registry

● ファイルセット管理

● モデルカタログ

データソース

● Hadoop データレイク

● データウェアハウス

● ストリーミング処理

● 非構造化データ

● 機械学習

解決すべき課題

● データ全体の「全体像」を把握する

● データが分散し、さまざまな方法で利用されている状態でも、データの SSOT を実現する

● データガバナンスを一元化し、あらゆる場所のデータを保護・監査する

● 次世代データカタログは、新しいオープンデータアーキテクチャの中核です。


Gravitino アーキテクチャ

機能レイヤー

● 統合処理

● 統合ガバナンス

インターフェイスレイヤー

● Unified REST API

● Iceberg REST

API オブジェクトモデルを備えた中核

● Metalake

● Catalogs

● Schemas

● オブジェクトタイプ:Table, Fileset, Model, Topic

接続レイヤー

● 接続

メタデータストレージ

● サポートされるデータタイプ(最下層):

● 表形式

● ファイル

● モデル

● メッセージキュー


Gravitino による表形式データと非表形式データの処理

表形式データ(コネクター経由)

● エンジン:Spark

● 操作:Create, Load, Alter, Drop

● API:Unified Tabular API

スキーマ(struct)

● name: string

● comment: string

● properties: map<string, string>

Table(struct)

● name: string

● columns: Column[]

● partitioning: Transform[]

● distribution: Distribution

● sortOrder: SortOrder[]

● indexes: Index[]

関連する定義

● Transform, Distribution, SortOrder, Index, Type


非表形式データ

● エンジン:Spark, PyTorch, Ray, TensorFlow

● ファイルシステム:Gravitino Virtual FileSystem, Python FileSystem

● 操作:Create, Load, Alter, Drop

● API:Unified Non-tabular API

スキーマ(struct)

● name: string

● comment: string

● Properties: map<string, string>

Fileset(struct)

● name: string

● storageLocation: string

● type: Type

ストレージロケーション

● S3, HDFS, ADLS, GCS


シナリオ

レイクハウスフェデレーション

● マルチクラウド、マルチエンジン、マルチフォーマット

● レイクハウスフェデレーションのためのオープンソリューション

プラットフォームの機能

● 分析

● 機械学習

● 360° ビュー

● アプリケーション

クエリ/言語ツール

● SQL

● Python

● R

中核機能

● Gravitino Data Connector

● マルチクラウド、マルチフォーマット、マルチエンジンを横断するフェデレーテッドクエリ。


データチームと AI チームのシームレスな連携

役割

● データエンジニア

● データサイエンティスト

● AI エンジニア

利用シナリオ

● データエンジニアとデータサイエンティストまたは AI エンジニアとの効率的な連携

● データサイエンティストは、異種データソースに対する統一されたメタデータ定義を取得

● データエンジニアはメタデータを使用してデータを処理

● 複数の AI フレームワークに対応する統合メタデータ

● 統合セキュリティ制御

中核技術

● Gravitino

外部要因

● テクノロジー

● 通信

● ETL

● モノのインターネット

● 自動化

● ネットワーキング

データとツール

[ 1 ] データ取り込み:

● Spark

● HDFS クライアント

● S3 SDK

[ 2 ] モデル学習:

● Tensorflow

● Pytorch

● Ray

● Gravitino Python ライブラリ

[ 3 ] データタイプ:

● 構造化データ

● 非構造化データ Gravitino

の機能

● Gravitino IO(データの読み取りと書き込み)

● Gravitino ACL(アクセス制御)


Gravitino Next - メタデータ駆動型アクションシステム

● カタログサービス

● API:Unified REST API, Iceberg REST API

● コンポーネント:Catalog, Schema, Table, Fileset, Model, Topic

● 接続

さまざまなデータソース(データベース、ファイル)へのコネクター Gravitino Next

● カタログサービス

● API:Unified REST API, Iceberg REST API

● コンポーネント:Catalog, Schema, Table, Fileset, Model, Topic, Policy

● ジョブシステムの項目:含ま

れるジョブシステム

● ポリシーシステム

● 統計システム

● ジョブシステム

● アクションフレームワーク

アクションフレームワークの項目

● TTL アクション

● コンパクションアクション

● クラスタリングアクション