← Financial Cloud Cloud 云端社群 · Amarathon 2025 回顾

极点宏观|Financial Cloud Cloud · AWS Amarathon 2025

极点宏观|Amarathon 2025 回顾 37:使用 CNCF Kagent、K8sGPT 和 Nova Sonic 转型 K8s 对话式智能体 AIOps

演讲者: Shaoyi Li

场次: 37

场次
Summit Dev Lounge2026 Re:cap
01 把架构写成 Steering,引导 AI Agent
Summit Dev Lounge2026 Re:cap
02 Agent Harness 才是真正的工程护城河
Summit Dev Lounge2026 Re:cap
03 用白话询问可观测性数据
Summit Dev Lounge2026 Re:cap
04 以 Bedrock AgentCore 打造 Serverless AR 游戏
Summit Dev Lounge2026 Re:cap
05 AgentCore 上的多 Agent 量化回测
Summit Dev Lounge2026 Re:cap
06 三分钟用 Kiro 把博客变成幻灯片
Summit Dev Lounge2026 Re:cap
AWS Community Day Hong Kong 2025 Re:cap
02 使用 Terraform 实现 AWS 合规
AWS Community Day Hong Kong 2025 Re:cap
03 从初学者到构建者:一段精彩的 AWS 云之旅
AWS Community Day Hong Kong 2025 Re:cap
04 以团队为先:使用 Laravel 与 Bref 开展无服务器工程
AWS Community Day Hong Kong 2025 Re:cap
05 活动开幕式
AWS Community Day Hong Kong 2025 Re:cap
06 智能体到智能体:在 AWS 上构建可互操作的 AI
AWS Community Day Hong Kong 2025 Re:cap
07 利用另一类遥测数据,借助 AI 智能体更快改进
AWS Community Day Hong Kong 2025 Re:cap
08 告别氛围编程:使用 Kiro 进行规格驱动开发
AWS Community Day Hong Kong 2025 Re:cap
09 使用 MCP 与 AI 智能体进行自动化测试
AWS Community Day Hong Kong 2025 Re:cap
10 使用机器学习方法实现电信安全现代化
AWS Community Day Hong Kong 2025 Re:cap
11 重新思考生成式 AI 智能体:RAG 与 MCP
AWS Community Day Hong Kong 2025 Re:cap
12 使用 TAK 和 AWS 开展灾难与应急响应
AWS Community Day Hong Kong 2025 Re:cap
13 从测试视角重新思考无服务器应用程序工作流
AWS Community Day Hong Kong 2025 Re:cap
14 Practical AWS FinOps for Cloud Success
AWS Community Day Hong Kong 2025 Re:cap
15 基于 AWS 的 AI 驱动全球纯 Alpha 宏观交易:重塑风险调整后资产收益
AWS Community Day Hong Kong 2025 Re:cap
FSI Recap
01 现代交易生命周期:从交易到结算
FSI Recap
02 Goldman Sachs:通过 Fast Track 加速应用程序上云 - AWS Re:cap Q1/2023
FSI Recap
03 Zurich Insurance Group:在 AWS 上构建高效的日志管理解决方案
FSI Recap
04 FSI Meetup 2025 年第四季度 - Brex 数据库灾难恢复
FSI Recap
05 FSI Meetup 2025 Q4 - Graviton 迁移成功案例
FSI Recap
06 FSI Meetup 2025 Q4 - Stifel 现代数据平台
FSI Recap
07 FSI Meetup 2025 Q4 - PayPal 金融交易数据对账系统
FSI Recap
08 FSI Meetup 2025 Q4 - 规模化提升韧性
FSI Recap
09 最大限度提高 AI 推理成本效益:战略性采用 AWS GPU 实例
FSI Recap
10 高级智能体 AI 设计模式
FSI Recap
11 在 AWS 上构建全新的现代化应用
FSI Recap
AWS re:Invent 2025
01 Coinbase re:Invent 回顾 (IND3312)
AWS re:Invent 2025
02 利用 AI 和 AWS 构建未来交易平台
AWS re:Invent 2025
03 交易创新:Jefferies 基于 Amazon Bedrock 构建的 AI 助手 (IND3315)
AWS re:Invent 2025
04 FSI 如何通过 Agentic AI (GBL302) 彻底改变 HFT 分析
AWS re:Invent 2025
05 使用 Amazon Time Sync 改进分布式系统(采用 Nasdaq)
AWS re:Invent 2025
06 Amazon Aurora HA 和 DR 全球弹性设计模式 (DAT442)
AWS re:Invent 2025
07 构建智能体式 AI:Amazon Nova Act 与 Strands Agents 实践 (DEV327)
AWS re:Invent 2025
08 深入探讨 Amazon Aurora 及其创新 (DAT441)
AWS re:Invent 2025
09 深入探讨 Amazon S3(STG407)
AWS re:Invent 2025
10 Nasdaq:为全球金融服务构建弹性基础设施 (HMC327)
AWS re:Invent 2025
11 AWS Lambda 新功能 (CNS376)
AWS re:Invent 2025
12 使用 Kiro 进行规范驱动开发 (DEV314)
AWS re:Invent 2025
13 Amazon 的 FinOps:全球电商巨头的云成本管理经验 (AMZ308)
AWS re:Invent 2025
14 AWS 上交易平台的 Tick-to-Trade 延迟
AWS re:Invent 2025
政务数据
01 The AI Era: The Boundary Between Development and Design Is Disappearing
政务数据
02 端侧多模态 AI 与智慧城市实践
政务数据
03 大模型能力评测与 AI 项目落地方法论
政务数据
04 基于云代理的政府开发全链路受控自动化
政务数据
05 从多智能体看 Agent 时代软件新生态
政务数据
06 AI 驱动的宏观量化研究与智慧治理
政务数据
07 公共数据授权运营与智慧政务实践
政务数据
08 数据资产化落地实践:确权合规、工程治理与数字政府案例
政务数据
09 AI技术赋能心理健康公益:可信平台的治理、架构与实践
政务数据
Amarathon 2025 回顾
01 开发者的智能体架构设计路线图
Donnie Prakoso
02 Amazon Bedrock 数据自动化
Hafiz Syed Ashir Hassan
03 AgentCore 上的多智能体
Tan Xin
04 实践中构建智能体式 AI:Nova Act 与 Strands Agents
Haowen Huang
04 使用规格驱动开发,通过 Kiro 加速迁移项目
Sanchit Dilip Jain
06 从「匹配」到「理解」:由 AgentCore Memory 驱动的个性化 AI 搜索实践
Liu Cao
07 从观察到优化:从 LLM 可观测性迈向 AIOps,将实时洞察转化为智慧自动化
Jimmy Soh
08 部署 TEAM 并打造最佳工程团队
Yuji Oshima
09 五年来所谓无服务器数据库带来的五个惨痛教训
Renato Losio
14 如果 AI 替我工作会怎样:Q Developer CLI 与 Kiro 如何改变我的日常工作
Miguel Angel Muñoz
16 兼顾速度与警觉:Amazon Bedrock Agent 开发的安全要点
Brian Tarbox
26 在单张 H100 上运行 OSS LLM:更智能、更便宜、更快速
Adit Modi Adit Modi
28 现代统一元数据架构:打破数据孤岛的新方法
Shaofeng Shi
29 无服务器 MediaOps:使用 Amazon Web Services 上的 AI 自动化视频工作流
Luis Valdivia
30 通过大规模性能测试构建兼具效率与可靠性的架构
Luis Guirigay
31 通过开源连接世界:技术、社区与全球开发者关系的实践历程
Richard Lin
33 构建流式 Iceberg 表以进行实时物流分析
Fahad Shah
34 加速大规模机器人策略训练:基于 Kiro、Trainium 和 EKS 的自动化闭环架构
Junjie Tang
35 通过规格驱动开发,从 Vibe 走向可行方案
Ricardo Sueiras
36 让云成本分析更智能:使用 Strands 和 AgentCore 构建 FinOps 智能体
Xiaofei Li
37 使用 CNCF Kagent、K8sGPT 和 Nova Sonic 转型 K8s 对话式智能体 AIOps
Shaoyi Li

Kubernetes 运维挑战

运维数据量庞大,故障排查耗时

● 平均 MTTR 超过 4 小时,其中人工分析占 65%

● 分析数据量可达 TB 级

资源类型繁多、关联复杂

● 大量集群对象、事件和日志数据

在多种工具之间切换复杂

● SRE 每天在 8 种以上工具之间切换,上下文切换成本高

针对告警进行故障排查既复杂又耗时

● 自动化能力有限

● 只有 30% 的常见故障可以自动修复,复杂场景仍依赖人工决策

K8s 的学习成本和门槛高

● 运维效率对比

● 采用 AIOps 的企业,其平均故障恢复时间(MTTR)比传统模式缩短 90%,运维成本降低 50%

核心价值

● 1. 故障自愈:通过 AI 预测和自动化脚本,实现部分故障的无人值守修复。

● 2. 智能监控:从海量日志和指标中精准定位问题根本原因,告别大海捞针式搜索。

● 3. 释放人力资源:让 SRE 团队摆脱重复性工作,专注于更有价值的创新任务。


Kagent 驱动的 AIOps 解决方案

Kagent:云原生智能体 AI 框架

● CNCF 2025 开源沙箱项目,是专为 K8s 云原生场景打造的智能体框架。

● 通过集成多个模型平台(Amazon Bedrock、Anthropic、OpenAI 等),构建基于 K8s 的智能体系统。

核心优势

● K8s 云原生:与 K8s 生态系统原生集成,自然融入现有集群

● 丰富的使用场景:适用于任何 AI 智能体使用场景

● 丰富的工具集成:支持自定义 MCP 工具、内置多种 K8s 工具和预配置的智能体

● 可视化界面:UI 界面演进为多智能体工作流编排,更直观、更高效

● 全面的可观测性:内置跟踪、日志记录和监控能力,支持集成常用的可观测性工具

使用场景

● 云原生运维自动化、多集群管理、任何多智能体协作系统、AIOps 实践等。


Amazon Nova Sonic:推动语音对话式 AIOps

● Amazon Nova Sonic 是 Amazon Bedrock 提供的语音对话模型。

● 它统一了传统上相互分离的语音理解和语音生成模型,能够进行贴近现实、类似人类的语音对话,支持多种语言和语调,并具有低延迟和高性能。

使用场景

● AI 智能客服:全天候响应客户咨询

● 企业语音助手:集成知识库、智能体和外部工具,提供定制化服务

● 多语言学习工具:支持多种语言

● 多行业应用:金融科技、医疗健康、智能家居等。

与运维场景结合的核心价值

● 将传统复杂的人工故障排查 + 修复简化为语音对话,最大限度发挥 AIOps 智能运维能力,降低 MTTR


K8sGPT:开源 K8s 故障诊断专家

● CNCF 开源沙箱项目,为 Kubernetes 维护提供 AI 驱动的可观测性和自动化运维

● 支持 CLI 和 Operator 双模式,可进行即时分析和持续监控

● 扫描集群资源、事件、日志和指标,集成 Amazon Bedrock 上的 AI 模型来生成文本洞察和解释,还可以与 Kiro 的 MCP 功能集成,通过自然语言观察和维护集群

● 解决传统运维被动响应的问题,采用主动式 AI 智能运维

● 支持多种自定义分析器和可观测性工具,可与 Prometheus、Alertmanager、Grafana 等集成。


演示集群

● 部署在 Amazon Web Services 上的 EKS 托管集群,集群名称:eks-cluster

● 集群资源概览:该集群通过 ArgoCD 的 application 部署从 GitHub 读取的多项 K8s 资源。包括 2 个 pods、1 个 service 和 1 个 Deployment

● Pod 问题:内存限制设置为 200Mi,但运行的是一个 205Mi 的进程,导致 CrashLoopBackOff

实验性修复场景

● K8sGPT 识别 Pod 问题,并提供解释和修复建议。

● 最后,通过 ArgoCD 调整 application 内 Helm Chart 的内存限制参数,触发 ArgoCD 修改 pod 配置,使 pod 成功启动。


摘要

● 了解如何以 Amazon Bedrock AgentCore 为基础,在 AI 多智能体协作系统的赋能下,从零开始构建 K8s 智能运维解决方案。

● 只需一个简单句子,即可完成从问题识别、诊断到全自动修复的整个过程,大幅简化海量运维数据分析和人工修复操作,降低人为错误风险。

● 与 K8sGPT 原有的有限自动修复能力相比,该解决方案增加了更多基于业务的自动修复功能,使其更加灵活且可扩展。

● 对于自动修复场景,我们引入 HITL(Human-in-the-Loop)流程,以确保自动修复的可靠性和可控性。

● 利用 ArgoCD 的原生能力,所有修复操作均可审计、可回滚,从而降低维护风险。

● 运维工程师可以直接通过语音最大限度发挥 AIOps 智能运维能力,显著降低 MTTI 和 MTTR。

● 未来计划:集成 CloudWatch Anomaly Detection(AD)和 DevOps Guru,根据历史数据分析预测潜在的 K8s 集群故障。