📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
DAU / MAU / Ratio👁 154
Daily·Monthly Active Users. DAU/MAU 비율이 제품 참여도 지표.
NATS JetStream👁 154
NATS의 영속성·재시도·스트림. Kafka 경량 대안.
Soda👁 154
SQL 기반 데이터 품질 검사 도구. SodaCL DSL로 선언적 체크.
Spark Structured Streaming👁 154
Spark의 스트리밍 API. 배치처럼 작성·실시간 실행.
Star Schema👁 154
Warehouse의 고전적 설계. 중앙 팩트 테이블 + 여러 디멘션 테이블.
Unstructured Data👁 154
정형 스키마 없는 데이터. 텍스트·이미지·음성·비디오. 전체 기업 데이터의 80%+.
Cohort Analysis👁 153
공통 속성의 사용자 그룹을 시간에 따라 추적하는 분석. 리텐션·LTV에 필수.
CUPED👁 153
실험 분산을 줄여 검정력을 높이는 기법. Microsoft가 A/B에 적용.
Redpanda👁 153
Kafka 호환 스트리밍 엔진. C++·thread-per-core.
Unity Catalog Open Source👁 153
Databricks가 2024년 오픈소스화. 카탈로그·거버넌스.
Pinecone Serverless👁 152
Pinecone 서버리스 벡터 DB. 사용량 과금.
Unity Catalog👁 152
Databricks의 데이터 거버넌스 계층. 2024년 OSS.
VictoriaMetrics👁 152
Prometheus 호환 TSDB. 장기 저장·메모리 효율.
Chroma👁 151
개발자 친화 OSS 벡터 DB. Python 우선.
Materialize👁 151
실시간 스트리밍 SQL 엔진. Kafka 이벤트를 SQL view로 계속 갱신.
Mixpanel👁 151
제품 분석 SaaS의 대표. 이벤트 기반 퍼널·리텐션·코호트.
Ray Data👁 151
Ray의 데이터 처리 라이브러리. Spark 대안, Python 네이티브 경험.
scikit-learn👁 151
Python의 전통 ML 라이브러리. 분류·회귀·클러스터링·전처리 포괄.
Tecton👁 151
상용 Feature Platform. 실시간 feature pipeline·서빙.
Time-Series Database👁 151
시계열 특화 DB. InfluxDB·TimescaleDB·VictoriaMetrics.
Feature Engineering👁 150
원본 데이터에서 모델 성능에 도움되는 특성을 설계·추출하는 작업. 전통 ML의 핵심.
NDCG👁 150
Normalized Discounted Cumulative Gain
검색·추천의 순위 품질 지표. 상위 순위 가중치.
Apache Hudi👁 149
Lakehouse 테이블 포맷. Upsert·Delete·Time Travel. Iceberg·Delta 경쟁.
Apache Spark 4👁 149
2025년 릴리스. ANSI 기본, VARIANT·String Collation·Python Data Source.
MLflow👁 149
오픈소스 ML 수명 주기 관리 도구. 실험 추적·모델 레지스트리·배포.
Synthetic Data👁 149
실제 데이터 통계 속성을 유지하며 인공 생성한 데이터. 프라이버시·편향 문제 대응.
Tabular Data👁 149
행·열로 구성된 구조화 데이터. DB 테이블·CSV·Excel. 전통 ML의 주 대상.
Unity vs Polaris👁 149
Databricks Unity Catalog와 Snowflake Polaris 대결.
Windmill👁 149
오픈소스 개발자 플랫폼. 스크립트·워크플로·UI 통합.
Data Quality👁 148
데이터의 정확성·완전성·일관성·적시성을 측정·관리.
Feature Store👁 148
ML 피처를 저장·공유·서빙하는 플랫폼. 학습-서빙 간 일관성 보장.
Heap Analytics👁 148
자동 이벤트 추적 분석 도구. SDK 심으면 모든 UI 이벤트 자동 수집.
Kafka Streams👁 148
Kafka 내장 스트림 처리 라이브러리. JVM 앱에 포함해 사용.
Sigma Computing👁 148
Warehouse 네이티브 BI. 스프레드시트 UX + SQL 파워.
Spark RDD👁 148
Spark의 저수준 분산 컬렉션. DataFrame 이전 세대.
Churn Rate👁 147
이탈률. 일정 기간 동안 서비스를 떠난 사용자 비율. SaaS의 핵심 지표.
Data Observability 5 Pillars👁 147
Freshness·Volume·Distribution·Schema·Lineage.
Data Profiling👁 147
데이터의 분포·결측·품질을 자동 분석하는 과정. pandas-profiling·ydata-profiling.
Data Warehouse👁 147
분석용 대규모 구조화 데이터 저장소. OLAP 최적화. Snowflake, BigQuery, Redshift.
MLOps👁 147
ML 모델의 개발·배포·모니터링을 DevOps처럼 체계화한 실천. CI/CD + 데이터·모델 버전 관리.
Neural Network👁 147
인간 뇌의 뉴런을 모방한 연산 모델. 층 구조로 입력→출력 매핑을 학습.
Reverse ETL Platforms👁 147
Hightouch·Census·Rudderstack Profiles 비교.
Segment👁 147
이벤트 추적·전달 플랫폼. 하나의 SDK로 여러 destination에 분배.
Streamlit 대시보드👁 147
Python 스크립트로 인터랙티브 웹 앱. 데이터 팀 프로토타입.
ksqlDB👁 146
Kafka 스트림에 SQL로 쿼리하는 엔진. Confluent 제공.
Real-time Analytics👁 146
초·분 단위 실시간 분석. Druid·ClickHouse·Pinot.
Text-to-SQL👁 146
자연어를 SQL로 변환. LLM 기반. BI 민주화의 핵심.
Weaviate👁 146
모듈형 OSS 벡터 DB. Hybrid 검색·임베딩 자동 생성.
Apache Iceberg👁 145
대규모 Data Lake용 오픈 테이블 포맷. Netflix가 오픈소스화. Delta Lake와 경쟁.
Change Data Capture👁 145
CDC
DB의 INSERT/UPDATE/DELETE를 실시간으로 캡처해 다른 시스템에 전파하는 기법.