본문 바로가기
📊

Data 348개 용어

ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진

Data Mesh 원칙👁 128
도메인 소유권·Data Product·셀프서비스 플랫폼·연합 거버넌스.
dbt Unit Tests👁 128
dbt 1.8+ 모델 단위 SQL 테스트. 가짜 입력·기대 출력.
Feast Architecture👁 128
오픈소스 Feature Store. Registry·Online·Offline·Serving.
Hightouch👁 128
Warehouse → SaaS 동기화 Reverse ETL 선두. Data Activation.
ML 평가 지표 선택👁 128
분류·회귀·랭킹·생성 각기 다른 지표. 비즈니스 목표와 정렬 필수.
Thoughtspot👁 128
검색·자연어 BI. "Search-driven Analytics".
Databricks Model Serving👁 127
관리형 모델 서빙. 내장 메트릭·A/B.
dbt Snapshot👁 127
SCD Type 2 자동 구현. 변경 이력 자동 추적.
GE Test Suite👁 127
Great Expectations의 expectation 묶음. 재사용·CI 통합.
Metabase Embedding👁 127
Metabase 대시보드를 앱에 임베드. SaaS 분석 제공.
MongoDB Atlas👁 127
MongoDB 매니지드 클라우드. 자동 샤딩·백업·검색·벡터.
Pulsar Functions👁 127
Pulsar 내장 스트림 처리. 메시지→함수→토픽.
Ray Serve👁 127
Ray 기반 모델 서빙. 복잡 pipeline·multi-model.
Apache Kafka👁 126
분산 스트리밍 플랫폼. 대용량 이벤트 처리의 사실상 표준. LinkedIn이 오픈소스화.
Databricks Genie👁 126
Databricks의 자연어 → SQL·분석 챗봇.
Delta Liquid Clustering👁 126
Databricks Delta의 동적 파티셔닝. Z-Ordering 후속.
Hudi vs Iceberg vs Delta👁 126
오픈 lakehouse 포맷 3대장 비교.
Kafka Consumer Group👁 126
같은 그룹 내 컨슈머가 파티션을 나눠 병렬 소비.
Kafka Exactly-Once👁 126
프로듀서 idempotence + 트랜잭션으로 정확히 한 번 처리 보장.
Lambda Architecture👁 126
Batch + Speed 레이어 혼합 아키텍처. Kappa로 단순화 추세.
Project Nessie👁 126
Iceberg용 Git-like 카탈로그. 브랜치·머지.
ByteHouse👁 125
ByteDance의 ClickHouse 포크 상용화.
ClickHouse Cloud👁 125
ClickHouse의 매니지드 서비스. 서버리스 분석.
dbt Source Freshness👁 125
원본 테이블의 신선도 감사. 지연 알람.
Deep Learning👁 125
DL
다층 신경망을 사용하는 ML의 하위 분야. 이미지·음성·NLP에 혁명적 성능.
Feature Store Online/Offline👁 125
훈련·추론 간 피처 일관성을 위한 dual store.
Kafka KRaft👁 125
Kafka 3.3+ ZooKeeper 제거 모드. 운영 단순화.
Kafka Partition👁 125
Kafka 토픽의 분산 단위. 병렬 처리·순서 보장·확장성의 기본.
LlamaIndex for Data👁 125
LlamaIndex의 구조화 데이터 지원. SQL·Pandas·NL Query.
Metric Tree👁 125
비즈니스 메트릭의 계층·의존성 모델링. North Star 분해.
Analytics API👁 124
제품에 분석 API 임베드. GoodData·Cube·Hightouch Events.
Apache DataFusion👁 124
Rust 기반 임베디드 SQL 쿼리 엔진. Arrow·Iceberg 네이티브.
Apache NiFi👁 124
GUI 기반 데이터 플로우. IoT·통합·라우팅에 강점.
BigQuery + Gemini👁 124
BigQuery의 Gemini AI 통합. 자연어 쿼리·데이터 준비 자동화.
Google Cloud Dataflow👁 124
GCP 관리형 Beam. 오토스케일·streaming engine.
Iceberg Partition Evolution👁 124
Iceberg의 파티션 스키마 변경 안전성. 과거 데이터 재처리 불필요.
Iceberg REST Catalog 채택👁 124
2024년부터 Snowflake·Databricks·Glue 모두 REST Catalog 지원.
Kafka Tiered Storage👁 124
오래된 세그먼트를 S3로 이동. 디스크 비용 절감.
Kappa Architecture👁 124
스트리밍 단일 레이어 아키텍처. Lambda 대안.
Dagster Software-Defined Assets👁 123
Dagster의 자산 중심 오케스트레이션. 데이터 객체가 1급.
Feast (Feature Store)👁 122
오픈소스 Feature Store. Online·Offline·Streaming feature.
KPI👁 122
Key Performance Indicator
비즈니스 목표를 측정하는 핵심 지표. 매출·MAU·Churn·NPS 등.
Bufstream👁 121
Buf의 Kafka 호환 + 스키마 거버넌스. Protobuf 기반.
Flink State👁 120
Flink 스트림의 상태 관리. KeyedState·OperatorState·Checkpointing.
Log Compaction👁 120
같은 키의 오래된 메시지를 제거해 최신 값만 유지.
Apache Doris👁 115
Real-time MPP DB. 중국에서 개발, 글로벌 확산.
Ray Train👁 112
Ray의 분산 훈련 라이브러리. PyTorch DDP·FSDP 추상화.
Evidence👁 109
Markdown + SQL로 데이터 앱·리포트 제작. BI의 Next-gen.