📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
Change Data Capture👁 145
CDC
DB의 INSERT/UPDATE/DELETE를 실시간으로 캡처해 다른 시스템에 전파하는 기법.
DVC👁 145
Data Version Control
ML용 Git-like 버전 관리. 데이터·모델을 외부 스토리지에 두고 Git으로 참조.
Feature Attribution👁 145
어떤 기능이 전환·리텐션에 기여했는지 분석. 인과 추론과 연관.
Headless Semantic Layer👁 145
dbt Semantic·Cube·AtScale. BI 도구 중립 메트릭 정의.
Metaflow👁 145
Netflix가 만든 ML 파이프라인 프레임워크. Python 클래스 기반, AWS 통합.
Photon👁 145
Databricks의 C++ 벡터화 쿼리 엔진. Spark SQL 10배+ 빠름.
SCD👁 145
Slowly Changing Dimension
디멘션 테이블의 변경 이력 처리 방식. Type 1·2·3·6 등.
Steampipe👁 145
클라우드 API를 SQL로 쿼리하는 도구. AWS·GCP·Azure·Kubernetes.
Streaming-first Architecture👁 145
배치 대신 스트림을 기본으로. Kappa Architecture.
Superset vs Metabase👁 145
OSS BI 비교. Superset은 복잡·강력, Metabase는 단순.
Unity Catalog Lineage👁 145
테이블·컬럼 수준 데이터 계보 자동 추적.
Census👁 144
Hightouch 경쟁 Reverse ETL. Marketo·Hubspot·Iterable 동기화.
Data Cleaning👁 144
raw 데이터의 결측·이상·중복·오타를 정리하는 작업. 데이터 사이언스 시간의 80%.
North Star Metric👁 144
조직의 유일한 핵심 지표. 모든 팀이 이것에 정렬.
Reverse ETL Use Cases👁 144
Warehouse 데이터를 SaaS(Salesforce·Mailchimp)로 동기화해 실행 가능하게 만듦.
Vanna.ai👁 144
Text-to-SQL 오픈소스. RAG 기반으로 스키마 이해.
CDP👁 143
Customer Data Platform
여러 소스의 고객 데이터를 통합·세분화·활성화. Segment·mParticle·Rudderstack.
Dagster👁 143
데이터 애셋 중심 오케스트레이터. Airflow·Prefect 대비 타입·테스트 강함.
DuckDB UI👁 143
DuckDB 내장 웹 UI. 2024년 출시, 로컬 분석 편의.
Metric Layer👁 143
비즈니스 지표를 중앙 정의해 여러 BI 툴이 일관된 값 사용. Cube·dbt Semantic Layer·MetricFlow.
Prefect👁 143
현대적 워크플로 오케스트레이터. Airflow의 Python 네이티브 대안.
Presto/Trino👁 143
분산 SQL 쿼리 엔진. Facebook이 시작(Presto), 창시자들이 포크한 Trino가 주류.
Profile-based Reverse ETL👁 143
Rudderstack Profiles처럼 dbt 모델이 프로파일을 생성.
Redpanda👁 143
C++로 작성된 Kafka API 호환 스트리밍 플랫폼. JVM 없음, 10배 빠름.
SQLGlot👁 143
Python SQL 파서·변환기. 방언 간 쿼리 변환.
Weights & Biases 심화👁 143
실험·모델·데이터·LLM 프롬프트 관리.
Data 팀 역할👁 142
Data Engineer·Analytics Engineer·Data Scientist·ML Engineer·Data Analyst 구분.
Data Contracts 실무👁 142
Protobuf·JSON Schema로 데이터 스키마 계약. 배포 전 검증.
Datafold👁 142
데이터 차이(diff)·리그레션 테스트 SaaS. PR마다 자동 데이터 검증.
DataHub👁 142
LinkedIn이 오픈소스화한 데이터 카탈로그·거버넌스. Metadata graph.
Materialize👁 142
스트리밍 재료화 뷰 DB. PG 호환 + 실시간.
RudderStack👁 142
Segment의 오픈소스 대안. Warehouse-first 접근.
Semantic Search (Data)👁 142
키워드가 아닌 의미 기반 데이터 검색. 임베딩 활용.
Vector Search 알고리즘👁 142
HNSW·IVF·PQ·ScaNN. ANN 알고리즘.
Data Maturity 모델👁 141
조직의 데이터 활용 수준. Reactive→Predictive→Prescriptive.
dbt Semantic Layer👁 141
dbt의 메트릭 중앙 정의. MetricFlow.
Fivetran vs Airbyte👁 141
매니지드 vs 오픈소스. 비용·커넥터·유연성 트레이드오프.
Inmon 방법론👁 141
Bill Inmon의 "Corporate Information Factory". 하향식·3NF 중앙 Warehouse.
Medallion Architecture👁 141
Databricks의 Bronze·Silver·Gold 3단계 데이터 레이크.
Prefect 3👁 141
2024년 메이저 업데이트. 동기 API·빠른 실행·엔진 리팩터.
Snowflake Iceberg Tables👁 141
Snowflake가 외부 Iceberg 테이블 네이티브 지원. 벤더 락 감소.
Spark Connect👁 141
Spark 클라이언트-서버 프로토콜. 원격 실행·다국어 클라이언트.
Data Vault 2.0👁 140
감사·변경 추적·확장성에 최적화된 Warehouse 모델링. Hub-Link-Satellite.
MTEB👁 140
Massive Text Embedding Benchmark
임베딩 모델 종합 벤치마크. Hugging Face 리더보드.
OpenLineage👁 140
데이터 리니지 오픈 표준. Marquez·OpenMetadata·DataHub 지원.
Preset.io👁 140
Superset의 매니지드 SaaS. 엔터프라이즈 기능 추가.
StarRocks👁 140
MPP 분석 DB. Apache Doris 포크. Iceberg 네이티브.
Apache Spark👁 139
분산 빅데이터 처리 엔진. Hadoop MapReduce 대체. Python·Scala·SQL 지원.
Data Contract👁 139
데이터 생산자와 소비자 간 스키마·품질·SLA 계약. 데이터 품질 문제 예방.
Data Mesh👁 139
중앙 데이터 팀이 아닌 도메인 팀이 데이터를 "제품처럼" 소유하는 조직·기술 아키텍처.