📊
Data — 348개 용어
ML·데이터 파이프라인·ETL·Warehouse·MLOps·분석 엔진
Databricks SQL👁 167
Databricks의 Warehouse 엔드포인트. Photon 엔진·Unity Catalog.
ETL Pipeline Design👁 167
ETL/ELT 설계 원칙. 멱등성·재실행·체크포인트·모니터링.
TensorFlow👁 167
Google이 개발한 딥러닝 프레임워크. 프로덕션·모바일 배포에 강점.
Zero-ETL👁 167
복사 없이 소스 DB를 직접 Warehouse에서 쿼리. AWS가 제안.
BigQuery👁 166
Google Cloud의 서버리스 Data Warehouse. Petabyte급 SQL 분석.
Kubeflow👁 166
Kubernetes 기반 ML 플랫폼. 학습·튜닝·서빙을 K8s 네이티브로.
PostHog👁 166
오픈소스 제품 분석 플랫폼. 이벤트·퍼널·리텐션·Feature Flag 통합.
Tecton👁 166
Feature Store SaaS. Feast 창시자들이 창업.
Parquet👁 165
컬럼 지향 파일 포맷. Lake·Warehouse 표준. 압축·쿼리 효율 탁월.
PyTorch👁 165
Meta(Facebook)의 딥러닝 프레임워크. 연구 커뮤니티 주류. 동적 그래프.
Metabase👁 164
오픈소스 BI. 비기술자도 쉽게 쿼리·대시보드 제작. 설치 10분.
WarpStream👁 164
컴퓨트·스토리지 분리한 Kafka 호환. S3만으로 운영.
Analytics Engineer👁 163
dbt로 Warehouse 내 데이터 모델링을 담당하는 신생 역할. 2020년 이후 부상.
Data Observability👁 163
데이터 파이프라인의 신선도·양·스키마·품질을 모니터링하는 분야.
Headless BI👁 163
BI의 지표 정의 계층을 UI와 분리. 여러 프런트(대시보드·앱·AI)가 공통 지표 사용.
Hugging Face👁 163
ML 모델·데이터셋·앱의 허브. "ML계의 GitHub". Transformers 라이브러리 포함.
Looker👁 163
Google이 인수한 엔터프라이즈 BI. LookML로 데이터 모델링. Semantic Layer 선구자.
Monte Carlo Data👁 163
데이터 관측성 SaaS 선두. 이상 감지·알림·lineage.
Power BI👁 163
Microsoft의 BI 도구. Office 365 통합. 엔터프라이즈·Tableau 대안.
Pandas👁 162
Python의 데이터프레임 라이브러리. 분석·전처리의 사실상 표준.
Thanos👁 161
Prometheus를 글로벌·장기 저장으로 확장. S3 기반.
Airflow 2+👁 160
Airflow 2.x 메이저 개편. TaskFlow API·Deferrable·Dynamic DAG. 3.0에서 더 현대화.
OLTP👁 160
Online Transaction Processing
실시간 트랜잭션 처리 DB 워크로드. 작은 CRUD가 많은 운영 DB.
Redshift👁 160
AWS의 Data Warehouse. PostgreSQL 포크 기반. Snowflake·BigQuery와 경쟁.
Reverse ETL👁 160
Warehouse의 정제된 데이터를 다시 SaaS(Salesforce·Mailchimp)로 동기화.
Data Governance👁 159
데이터의 품질·보안·접근 권한·소유권을 관리하는 체계.
SQLMesh👁 159
dbt 대안. 가상 데이터 환경·자동 증분·플랜 기반.
Unsupervised Learning👁 159
레이블 없이 데이터의 구조·패턴을 학습. 클러스터링·차원 축소가 대표.
Weights & Biases👁 159
W&B
ML 실험 추적·시각화 SaaS. 대시보드·보고서·하이퍼파라미터 스윕 강력.
AWS MWAA / GCP Composer👁 158
관리형 Airflow. AWS·GCP 클라우드 오퍼링.
Data Catalog👁 158
조직의 모든 데이터 자산을 카탈로그화해 검색·이해·거버넌스를 돕는 도구.
Data Observability 지표👁 158
신선도·양·스키마·품질·분포·Lineage 5대 축으로 데이터 건강 측정.
OLAP👁 158
Online Analytical Processing
분석·집계 최적화 DB 워크로드. OLTP(트랜잭션)와 대비. 컬럼 저장이 특징.
Tabular👁 158
Iceberg 창시자들이 창업. 2024년 Databricks가 인수.
A/B 유의성👁 157
통계적 유의성·검정력·샘플 크기 계산. p-value·신뢰구간·효과 크기.
BM25👁 157
전통 키워드 검색 점수 알고리즘. Elasticsearch·OpenSearch 기본.
dbt Cloud👁 157
dbt의 매니지드 SaaS. 스케줄링·IDE·CI 통합. 대기업 사용.
Fact Table👁 157
비즈니스 이벤트(매출·주문·방문)를 기록하는 Warehouse 중심 테이블.
HTAP👁 157
Hybrid Transactional/Analytical Processing
OLTP와 OLAP를 같은 DB에서 처리하는 하이브리드 모델. TiDB·SingleStore·CockroachDB.
Snowflake Cortex👁 157
Snowflake의 AI·LLM 기능. Cortex Search·Cortex Analyst.
Starburst / Trino Galaxy👁 157
Trino 상용 매니지드. 연합 쿼리 플랫폼.
Train/Val/Test Split👁 157
데이터를 학습·검증·테스트로 나눔. 보통 70/15/15. Data leakage 주의.
Watermark👁 157
스트리밍에서 시점 T까지 이벤트 수신 완료 마커.
Kafka Connect👁 156
Kafka와 외부 시스템 연결을 위한 프레임워크. Source·Sink 커넥터.
Mode👁 156
SQL + Python 분석 협업 플랫폼. ThoughtSpot 인수.
Streaming ETL👁 156
실시간 스트림에서 ETL. Kafka·Flink·Materialize로 구현.
Apache Flink👁 155
저지연 실시간 스트림 처리 엔진. Kafka와 함께 이벤트 스트리밍 스택의 양대 축.
NumPy👁 155
Python 수치 계산의 기반 라이브러리. 배열·행렬·벡터 연산.
Tinybird👁 155
ClickHouse 기반 서버리스 실시간 분석 API.
Databricks👁 154
Apache Spark 창시자들이 만든 통합 데이터·AI 플랫폼. Lakehouse 개념 주도.