AWS 数据与分析服务
AWS 数据与分析服务
这篇把备考时整理的 AWS 数据相关服务捏到一起,按数据生命周期走一遍:采集进来、做 ETL 和治理、查询出报表,以及跨环境的数据传输迁移。
数据采集与流处理
Amazon Kinesis
实时大数据流处理服务,收集、处理、分析大规模流数据。四个组成部分各管一段:
- Kinesis Data Streams:实时收集和处理数据流(点击流、交易数据、日志等),支持多个消费者应用同时读取同一条流,低延迟。
- Kinesis Data Firehose:把流数据自动加载到 S3、Redshift、Elasticsearch 等存储/分析服务,无需管理基础设施、自动伸缩。它能在落盘前自动把数据转成 Parquet 格式并加密写入 S3,不用自己写代码——考试里"实时处理 + 低运维"经常指向它。
- Kinesis Data Analytics:用 SQL 直接对流数据做过滤、转换、聚合,数据入库前就拿到业务洞察。
- Kinesis Video Streams:采集、处理、存储视频流,面向 IoT 设备和监控摄像头。
适用场景:实时日志/事件处理、监控告警、点击流与用户行为分析、金融交易实时处理、IoT 数据采集、智能视频监控。
ETL 与数据治理
AWS Glue
完全托管、无服务器的数据集成服务,核心是 ETL(提取、转换、加载),用来在不同数据源之间发现、准备、移动和集成数据。
- 数据目录(Data Catalog):中央元数据仓库,自动爬取各种数据源、识别结构和模式。
- ETL 任务:自动生成 ETL 脚本,底层是 Apache Spark 的分布式处理,能处理结构化和半结构化数据,支持复杂转换和清洗。
- 无服务器:不用管基础设施,只写业务逻辑,资源调度交给 Glue。
- 与 S3、Redshift、RDS、Athena、DynamoDB 等深度集成,常用于搭数据湖和数据仓库的管道。
Amazon Lake Formation
托管服务,帮你快速、安全地构建和管理数据湖(集中存放结构化与非结构化海量数据)。主要能力:
- 自动化导入、清洗、编目,把数据库、日志、S3 数据整合进数据湖。
- 细粒度访问控制,跨 S3、Glue、Redshift Spectrum 等服务统一管理权限。
- 自动生成并维护数据目录,支持数据发现、生命周期和版本管理。
- 集成 Athena、Redshift Spectrum、EMR、SageMaker,简化分析与建模。
Lake Formation 和 S3 的关系容易混。S3 是对象存储,只负责"存",没有数据目录、元数据管理或复杂治理;Lake Formation 建在 S3 之上,提供数据集成、安全策略和治理能力。打个比方:S3 是数据湖的水池,Lake Formation 是这池水的管理系统,管水的流向、质量和安全。实际中两者配合使用——S3 存数据,Lake Formation 负责管理和安全。
查询与 BI
Amazon QuickSight
AWS 原生的商业智能(BI)服务,做交互式仪表盘和可视化报表,内置机器学习能自动发现趋势、异常和关键驱动因素,降低对数据科学技能的依赖。能直接和 Athena 集成生成交互式图表。
- 支持 S3、Redshift、RDS、Aurora、Athena 以及各种数据库和第三方数据源。
- 自动弹性扩展,无需管服务器。
- 集成 IAM 做细粒度访问控制。
- 按使用量付费。
AWS AppSync
托管的 GraphQL 服务,用于构建数据驱动的应用,能实时同步数据并支持离线访问。
这里值得记一笔的是管道解析器(Pipeline Resolver):把一个 GraphQL 字段的解析拆成多个有序执行的"函数",每个函数访问和操作数据源,最后组合成一次复杂的数据获取或变更。它的价值在于支持复杂业务逻辑(联动多个数据源、多阶段处理)、分步处理便于调试复用、灵活组合 DynamoDB / Lambda / Elasticsearch 等不同数据源。
数据传输与迁移
迁移类服务考试里经常要做选型,先看一张对照表:
| 服务 | 形态 | 典型场景 | 数据量级 |
|---|---|---|---|
| DataSync | 在线、托管 | 本地↔AWS、AWS 存储间同步迁移 | TB 级,增量同步 |
| Direct Connect | 物理专线 | 持续大流量、低延迟、混合云 | 持续高带宽,建设周期数周到数月 |
| Snowball | 物理设备寄送 | 离线批量迁移,避开网络瓶颈 | 几十 TB 到几 PB |
| Snowmobile | 物理卡车 | 超大规模数据中心离线迁移 | 几十 PB 到 EB |
| Transfer Family | 托管文件传输 | SFTP/FTPS/FTP 收发文件到 S3/EFS | 协议化文件交换 |
| AppFlow | 无服务器集成 | SaaS 应用与 AWS 之间数据流动 | 应用级数据集成 |
AWS DataSync
完全托管的数据传输服务,在本地存储、AWS 服务、不同 AWS 存储之间高速移动数据。用网络优化和并行传输提速;支持 NFS/SMB、S3、EFS、FSx 之间互传;支持增量传输只复制变化的数据;传输过程加密。适合数据迁移、灾备、混合云同步,可按计划或事件触发。
AWS Direct Connect
专用网络连接服务,通过物理专线把本地数据中心/办公室直连到 AWS,绕开公网拥堵。接口容量 1Gbps 到 100Gbps,低延迟,可直连 VPC,适合混合云。建设周期较长、成本较高,常配合 Site-to-Site VPN 做辅助安全。
AWS Snow Family
离线物理迁移设备家族:
- Snowcone:最小、便携,适合无网络环境的边缘计算和数据采集,容量小。
- Snowball / Snowball Edge:物理设备,AWS 寄给你,你拷数据后寄回导入云端,几十 TB 到 PB 级。Snowball Edge 还能在本地跑计算工作负载,适合断网或网络受限环境(油田、矿山、船舶等)的边缘处理。安全、低成本、不受带宽限制,交付周期几天到数周。
- Snowmobile:装硬盘的拖车卡车,几十 PB 到 EB 级数据中心整体迁移。
计费上,从 Snowball Edge 导入数据到 S3 是免费的(数据入云不收费);反过来从 S3 导出到 Snowball Edge 会产生出站数据传输费。
PB 级海量数据且不走公网时的选型:短期快速用 Snowball;超大规模或长期传输上 Direct Connect 专线;数据量极大用 Snowmobile。
配套的两个评估工具:Application Discovery Service 自动探测本地基础设施的配置和依赖关系(主机名、IP、MAC 等),为迁移规划提供全貌;Migration Evaluator(迁移评估器) 基于数据评估迁移到 AWS 后的成本、性能和运维变化,帮企业算业务账。
AWS Transfer Family
托管文件传输服务,用标准协议(SFTP、FTPS、FTP)安全地把文件传进/传出 S3 和 EFS,省掉自建传输服务器。自动扩展和高可用;文件直接落到 S3 或 EFS;用 IAM 和 SCP 控权限,支持传输层加密和多种身份验证(服务自带、LDAP、自定义身份提供者);集成 CloudTrail 和 CloudWatch 做审计监控。
一个典型考题:公司原来用两台带弹性 IP 的 EC2 Linux 实例跑高可用 SFTP,想换成无服务器、高 IOPS、安全可配置且自己控权限的方案。答案是建一个默认加密的 S3 桶,在私有子网里创建带 VPC 终端节点的 Transfer Family SFTP 服务,挂安全组只放行指定 IP,把 S3 桶接到 SFTP 终端,再授予用户权限。Transfer Family 直接集成 S3 无需 EC2,满足无服务器要求;私有子网 + 安全组限 IP 提升安全性;S3 默认加密 + 细粒度用户权限符合要求。
Amazon AppFlow
无服务器集成服务,在各种 SaaS 应用(Salesforce、Google Analytics、Slack 等)和 AWS 服务(S3、Redshift、EventBridge)之间安全地自动传输数据,不用写代码或管基础设施。内置连接器;传输过程中可做字段映射、过滤、转换;用 IAM 和加密保障安全,支持 VPC 端点;可按计划或事件触发;提供流量跟踪、日志和告警。常用于把营销/销售/客服 SaaS 数据同步到数据湖或数仓做分析。
AI 数据转换
一组把语音、文本、媒体在不同形态间转换的服务:
- Amazon Transcribe:语音转文本,适合会议记录、客服录音转录。
- Amazon Polly:文本转语音。
- Amazon Textract:从文档中提取文本和数据。
- Amazon Elastic Transcoder:把视频/音频转成适配各种设备(含手机)的格式,处理不同分辨率和格式。