# 넷플릭스, 장애 해결 시간 줄일 통합 관측성 구축

> 넷플릭스 관측성 팀이 로그·메트릭·이벤트·트레이스를 통합하는 단일 데이터 계층을 만들었다. 디버깅 부담을 줄이고 사용자 경험을 개선하는 것이 목표다.

Oossa · 2026-10-09 · https://oossa.com/ko/netflix-builds-unified-observability-layer-to-cut-incident-resolution-time

넷플릭스의 관측성 엔지니어인 Prasanna Vijayanathan과 Renzo Sanchez‑Silva는 온톨로지 기반의 새로운 시스템을 소개했다. 이 시스템은 텔레메트리의 4대 유형인 메트릭, 이벤트, 로그, 트레이스를 하나의 “MELT” 계층으로 통합한다. 현재는 여러 팀이 수동으로 대응해 몇 시간씩 걸릴 수 있지만, 이 시스템은 경보의 우선순위를 자동으로 정하고 담당 팀에 전달하며 근본 원인까지 제안하는 것을 목표로 한다.

## 팩트

- 2024년 라이브 복싱 경기 중 최대 동시 스트리밍 수는 65 million을 기록했다.
- 넷플릭스는 초당 2 billion건이 넘는 요청과 38 million건의 로그 이벤트를 처리한다.

## 왜 중요한가

통합 관측성 계층은 장애 대응 시간을 몇 시간에서 몇 분으로 줄여 시청자가 넷플릭스 콘텐츠를 더 원활하게 시청하도록 도울 수 있다.

## 출처 및 참고 자료

1. [Presentation: Ontology‐Driven Observability: Building the E2E Knowledge Graph at Netflix Scale](https://www.infoq.com/presentations/netflix-observability-aiops-ontology-scale/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

최종 업데이트: 2026-10-09
