📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
Polaris Catalog👁 134
Snowflake가 Apache Foundation에 기증한 Iceberg REST 카탈로그.
Databricks LakeFlow👁 133
2024 발표 통합 데이터 엔지니어링. ingest·transform·orchestrate.
Databricks Serverless SQL👁 133
SQL Warehouse의 서버리스 옵션. 기동 없이 즉시 쿼리.
dbt Incremental Model👁 133
증분 업데이트 전략. 전체 재빌드 대신 신규 데이터만.
Delta Live Tables (DLT)👁 133
Databricks 선언적 ETL. 데이터 품질 규칙·자동 오케스트레이션.
Flink CDC👁 133
Ververica 오픈 CDC 커넥터. MySQL·PG·Mongo를 Flink 소스로.
Cube.dev👁 132
Headless BI·Semantic Layer. SQL·REST·GraphQL 노출.
Delta Sharing👁 132
회사 간 데이터를 복사 없이 공유하는 오픈 프로토콜.
GraphRAG (Microsoft)👁 132
지식 그래프 기반 RAG. 엔티티·커뮤니티 수준 요약.
Iceberg REST Catalog👁 132
Iceberg 카탈로그 표준 API. Glue·Polaris·Tabular 호환.
Kubeflow Trainer👁 132
K8s 분산 ML 훈련. PyTorch·TF·XGBoost 오퍼레이터.
Omni👁 132
Looker 창시자들의 새 BI. AI·Semantic Layer.
RisingWave👁 132
Apache 2.0 스트리밍 DB. Materialize 오픈소스 경쟁.
Data App👁 131
Streamlit·Gradio·Retool·Hex로 데이터 기반 내부 앱 개발.
dbt Exposures👁 131
dbt 모델을 사용하는 downstream(대시보드·앱) 정의.
dbt Test👁 131
스키마 테스트·커스텀 SQL 테스트. 데이터 품질 게이트.
Embedding Dimension👁 131
임베딩 벡터 차원. 품질·저장·속도 트레이드오프.
Kafka Offset👁 131
파티션 내 메시지 위치. 컨슈머가 자신의 진행 상태로 커밋.
Kestra👁 131
선언적 YAML 오케스트레이터. 이벤트·스케줄·UI 강력.
Machine Learning👁 131
ML
데이터로부터 패턴을 학습해 예측·분류하는 AI의 하위 분야. 지도·비지도·강화학습으로 나뉨.
Operational Analytics👁 131
분석 결과를 운영 시스템으로 되돌려 자동 행동 유도. Activation 철학.
ORC👁 131
Optimized Row Columnar
Hive 최적화 컬럼 포맷. Parquet과 경쟁.
Parquet 상세👁 131
컬럼 저장·압축·encoding·row group·page 구조.
Advanced RAG 패턴👁 130
Self-RAG·CRAG·HyDE·Query Expansion·ReRanker.
Apache Airflow 3👁 130
2024 Airflow 3. DAG 버저닝·UI 재작성·데이터 자산.
Data Fabric👁 130
메타데이터·AI 기반 통합 데이터 아키텍처. Data Mesh 대안.
dbt Docs👁 130
dbt 프로젝트의 자동 문서·Lineage 그래프.
Event Schema👁 130
제품 분석 이벤트 명명·속성 스키마. 일관성이 분석 품질.
Funnel Drop-off👁 130
퍼널 각 단계의 이탈률 분석. 가장 큰 드롭 지점이 개선 우선순위.
Hex👁 130
SQL·Python 노트북 협업 플랫폼. AI 통합 강점.
Qdrant👁 130
Rust 기반 오픈소스 벡터 DB. Payload filter 강점.
QuestDB👁 130
SQL·시계열 특화 고성능 DB. 금융·IoT.
Reciprocal Rank Fusion (RRF)👁 130
여러 검색 순위를 통합하는 방법. 하이브리드 검색의 표준.
Schema Change Management👁 130
DB·Warehouse 스키마 변경 안전 배포. Liquibase·Flyway·schemachange.
Apache Druid👁 129
실시간·시계열 OLAP. 이벤트 분석 특화.
BigQuery ML👁 129
BigQuery에서 SQL로 ML 모델 학습·추론.
Catalog 비교👁 129
Amundsen·DataHub·OpenMetadata. 오픈소스 데이터 카탈로그.
CDP vs Warehouse👁 129
Segment·mParticle 같은 CDP와 Snowflake 직접 사용 비교.
ClickHouse MV👁 129
ClickHouse의 실시간 사전 집계. INSERT 시 자동 갱신.
Customer 360 / CDP Profile👁 129
고객을 중심으로 행동·거래·서포트를 통합한 레코드.
Data Clean Room👁 129
여러 회사가 데이터를 공유 없이 조인·분석. 광고·의료.
Dremio👁 129
Data Lake 위의 SQL 엔진. Iceberg 네이티브.
Funnel Analysis👁 129
사용자가 목표(구매·가입)에 도달하기까지 단계별 이탈률 분석.
Great Expectations👁 129
오픈소스 데이터 품질 테스트 프레임워크. 데이터에 "기대치"를 코드로 표현.
Iceberg v3 Spec👁 129
2024 Iceberg v3. Deletion Vectors·Row Lineage·Variant.
Kimball 방법론👁 129
Dimensional Modeling 선구자. Star Schema 중심.
Master Data👁 129
조직의 핵심 엔티티(고객·상품·직원) 정보. 여러 시스템 간 일관성 필요.
Open Table Format👁 129
Iceberg·Delta·Hudi 비교. Lake에 ACID·Schema·Time Travel 추가.
pgvector 튜닝👁 129
IVFFlat·HNSW 선택. lists·ef_search.
Baseline Model👁 128
실험의 기준이 되는 단순 모델. Majority·Random·간단한 규칙.