AWS 데이터 & 분석

Amazon Athena

서버리스 SQL 엔진을 사용한 아마존 S3 데이터 분석 → Athena

Performance Improvement

성능향상이 가능하며 시험에서 이를 물어볼 수 있다

Federated Query

실습

서버 설정과 데이터 변환 없이도 적절한 데이터 포맷을 설정함으로써 복잡한 쿼리를 직접 실행해 원하는 결과를 얻을 수 있다

Redshift

Redshift Cluster

Redshift - Snapshots & DR(스냅샷과 재해복구)

Redshift에 데이터 주입 방법

Redshift Spectrum

Amazon OpenSearch

OpenSearch Patterns

DynamoDB

CloudWatch Logs

Amazon EMR(Elastic MapReduce)

데이터 처리, 머신러닝, 웹 인덱싱, 빅데이터 작업

EMR - Node types & purchasing

장기 실행 클러스터에서 예약 인스턴스 사용 혹은 임시 클러스터를 사용해 특정 작업을 수행하고 분석 완료 후 삭제하는 방식이다

Amazon QuickSight

QuickSight 통합

시험에서는 QuickSight를 Athena or Redshift와 함께 사용하는 문제가 나온다 다른 통합도 가능

Dashboard & Analysis

AWS Glue

데이터를 Parquet format하는 예시

Glue Data Catalo

리소스에서 데이터를 가져와 ETL작업을 거쳐 다른 데이터 분석 서비스로 전달이 가능하다

더 알아야 하는 부분

AWS Lake Formation

Lake Formation이 사용되는 가장 핵심적인 이유

중앙화된 권한 → 사용자가 볼 수 있는 데이터를 제어할 수 있다

Kinesis Data Analytics

SQL 애플리케이션용 Kinesis Data Analytics

Apache Flink용 Kinesis Data Analytics

Amazon Managed Streaming for Apache Kafka (Amazon MSK)

MSK Serverless

Apache Kafka - 더 알아야하는 부분

Apache Kafka는 데이터를 스트리밍하는 방식

KinesisData streams vs Amazon MSK

KinesisData streams

Amazon MSK

두가지 다 저장 데이터 암호화가 가능

MSK의 데이터 소비자 및 소비하는 방법

Big Data Ingestion Pipeline

IoT Core는 IoT 장치 관리를 돕는다

IoT Core에서 실시간으로 Kinesis로 보낸다

Firehose를 거쳐 1분마다 데이터를 S3 버킷에 입력하고 오프로드한다

→ 여러 장치에서 많은 데이터를 실시간으로 얻을 수 있는 파이프라인

이후 Ingestion Bucket에서는 SQS로 메시지를 넣거나 혹은 Athena가데이터를 Pull 해간다

이후 다른 버킷으로 보고, 정리, 분석을 위해 저장된다

보고 버킷에는 분석된 데이터가 포함되어 있어 QuickSight, Redshift 등의 보고 도구에서 사용