📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
Apache Spark👁 139
분산 빅데이터 처리 엔진. Hadoop MapReduce 대체. Python·Scala·SQL 지원.
Data Product👁 139
데이터를 제품처럼 취급. SLA·문서·소유자·사용자 경험. Data Mesh 핵심.
Rockset👁 139
실시간 인덱스 DB. 2024 OpenAI 인수. Converged Index.
Windowing👁 139
무한 스트림을 유한 창으로 분할. Tumbling·Sliding·Session.
Airflow TaskFlow API👁 138
@task 데코레이터로 함수 기반 DAG. XCom 자동.
DuckDB Extensions👁 138
DuckDB 확장 시스템. httpfs·parquet·vss·spatial·delta.
Late Chunking👁 138
긴 문서를 먼저 임베딩 후 청크 경계에서 자르기.
Reinforcement Learning👁 138
RL
에이전트가 환경과 상호작용하며 보상을 최대화하는 방향으로 학습. AlphaGo·로봇 제어에 활용.
Retention Curve👁 138
사용자가 시간에 따라 얼마나 남아있는지 그리는 곡선. 평평해지는 지점이 PMF 시그널.
Snowflake Copilot👁 138
Snowflake의 AI 어시스턴트. Cortex 기반 자연어 SQL.
Text-to-SQL (NL2SQL)👁 138
자연어 질문을 SQL로 변환. BI·분석의 민주화.
Apache Beam👁 137
배치·스트리밍 통합 프로그래밍 모델. Dataflow·Flink·Spark 러너.
Apache Pinot👁 137
LinkedIn의 실시간 OLAP. 저지연·고처리량.
Arrow Flight👁 137
Arrow 기반 고성능 데이터 전송 프로토콜. ODBC/JDBC 대체.
Dagster Pipes👁 137
외부 프로세스(Spark·Databricks·Kubernetes) 통합 프로토콜.
Data Mesh Governance👁 137
분산 소유 + 연방 거버넌스. 공통 표준·상호 운용성.
dbt Mesh👁 137
여러 dbt 프로젝트를 조직 단위로 연결. 데이터 메시 구현.
dbt Model 유형👁 137
View·Table·Incremental·Ephemeral 등 dbt materialization.
dbt Sources👁 137
원본 raw 테이블을 dbt 프로젝트에서 명명·테스트.
Inmon 방법론👁 137
Corporate Information Factory. 3NF 기반 중앙 Warehouse.
OpenMetadata👁 137
통합 메타데이터 플랫폼. 카탈로그·lineage·품질·거버넌스 한 번에.
Ray👁 137
분산 Python 프레임워크. ML·강화학습·배치 병렬화. Anyscale 상용화.
Redshift ML👁 137
AWS Redshift에서 SQL로 SageMaker 모델 학습·추론.
Spark DataFrame👁 137
Spark의 분산 DataFrame API. SQL처럼 편리·Catalyst 최적화.
Streamlit in Snowflake👁 137
Streamlit 앱을 Snowflake 데이터에 안전하게 배포.
BigQuery Omni👁 136
AWS·Azure 데이터를 BigQuery에서 쿼리. 멀티 클라우드.
ClickStream👁 136
사용자의 웹·앱 클릭·탐색 이벤트 데이터. 제품 분석의 핵심 원료.
Data Activation👁 136
분석 인사이트를 실제 운영에 반영. Hightouch·Census의 핵심 메시지.
Data Contracts with Protobuf👁 136
Protobuf·Buf로 스키마 강제. 업스트림·다운스트림 계약.
MLflow Tracking·Registry👁 136
실험 추적·모델 버전 관리. Databricks 오픈 표준.
Modern ETL/ELT 선택👁 136
Warehouse 내 SQL 변환이 강력해져 ELT가 주류.
OLAP 엔진 비교👁 136
OLAP 엔진 종류: ROLAP·MOLAP·HOLAP. 현대는 대부분 ROLAP(Snowflake·BigQuery).
OpenMetadata👁 136
오픈소스 데이터 카탈로그·거버넌스. DataHub 경쟁.
데이터 Product Thinking👁 136
데이터를 제품처럼. SLA·소비자·버저닝·문서.
Semantic Layer + AI👁 136
LLM이 의미 레이어를 기반으로 정확한 쿼리 생성.
Snowflake Openflow👁 136
Apache NiFi 기반 Snowflake 공식 인제스트.
Delta Live Tables👁 135
Databricks의 선언적 파이프라인. 의존성·품질·모니터링 자동.
Lightdash👁 135
dbt 기반 OSS BI. dbt 메트릭을 대시보드로.
RAG 평가 프레임워크👁 135
RAGAS·TruLens·DeepEval·Phoenix.
Real-time OLAP👁 135
Druid·Pinot·ClickHouse. 실시간 집계·이벤트 분석.
Apache Polaris👁 134
Snowflake가 오픈소스화한 Iceberg 카탈로그.
dbt Macros👁 134
Jinja 기반 재사용 SQL 함수. 복잡 로직 캡슐화.
dbt Packages👁 134
dbt-utils·dbt-expectations 등 공식·커뮤니티 패키지.
dbt Seeds👁 134
CSV 파일을 Warehouse 테이블로 로드. 기준 데이터용.
Grafana Mimir👁 134
Prometheus 대규모 확장. Cortex 후속.
ksqlDB👁 134
Kafka 스트림을 SQL로 처리. CREATE STREAM·CREATE TABLE.
lakeFS👁 134
데이터 레이크의 Git. 브랜치·커밋·머지로 데이터 관리.
Polaris Catalog👁 134
Snowflake가 Apache Foundation에 기증한 Iceberg REST 카탈로그.
Arrow Flight SQL👁 133
Arrow Flight 위의 SQL 프로토콜. JDBC/ODBC를 대체.
Auto Loader👁 133
Databricks의 점진적 파일 인제스트. 스키마 추론·진화.