#개념

데이터 시각화(Data Visualization)는 숫자와 범주로 이루어진 데이터를 위치, 길이, 색상, 면적 같은 시각적 속성에 대응시켜 사람이 한눈에 패턴, 추세, 이상치, 관계를 파악할 수 있도록 표현하는 기법이다. 사람의 시각 체계는 수천 개의 숫자가 나열된 표보다 한 장의 그래프에서 구조를 훨씬 빠르게 읽어내므로, 시각화는 데이터 분석의 입력이자 결과 전달의 출력으로 기능한다.
데이터 시각화의 고전적 원칙은 Edward Tufte의 저서 『The Visual Display of Quantitative Information』(1983)에 정리되어 있다. Tufte는 그래프에서 데이터를 표현하는 데 쓰인 잉크의 비율을 데이터-잉크 비율(Data-Ink Ratio)로 정의하고, 격자선, 불필요한 테두리, 장식 같은 차트 정크(Chartjunk)를 제거하여 이 비율을 최대화하라고 주장했다. 또한 그래프가 나타내는 효과의 크기와 데이터의 실제 크기가 비례해야 한다는 거짓말 지수(Lie Factor) 개념으로 왜곡을 경계했고, 작은 그래프를 격자로 반복 배치하여 비교를 쉽게 하는 스몰 멀티플(Small Multiples)을 제안했다.
시각화의 첫 단계는 데이터의 종류와 전달하려는 메시지에 맞는 차트를 고르는 일이다. 데이터 종류별 기본 선택지는 다음과 같다.
데이터 종류별 기본 차트
  • 시간에 따른 추세: 꺾은선 그래프가 기본 선택지다.
  • 범주 간 크기 비교: 막대 그래프가 기본 선택지다.
  • 두 연속 변수의 관계: 산점도가 기본 선택지다.
  • 단일 변수의 분포: 히스토그램·밀도 곡선·상자 그림(box plot)·바이올린 그림이 기본 선택지다.
  • 전체 중 비율: 누적 막대나 트리맵이 기본 선택지다.
  • 두 범주 변수의 교차 집계나 상관 행렬: 히트맵이 기본 선택지다.
  • 지리 데이터: 단계구분도(choropleth)가 기본 선택지다.
범주형 데이터는 막대의 길이로, 연속 데이터는 공통 축 위의 위치로 표현하고, 변수의 수와 데이터 크기에 따라 차트를 결정하는 것이 원칙이다. 차트 선택의 근거는 시각적 지각(Visual Perception) 연구에서 나온다. Cleveland와 McGill(1984)은 사람이 시각적 속성에서 수치를 얼마나 정확하게 읽어내는지 실험하여, 공통 축 위의 위치 > 정렬되지 않은 위치 > 길이 > 각도·기울기 > 면적 > 부피·색상 농도 순으로 정확도가 떨어진다는 지각 정확도 서열을 밝혔다.
이 결과는 각도로 비율을 읽어야 하는 파이 차트보다 길이로 읽는 막대 그래프가, 면적으로 읽는 버블 차트보다 위치로 읽는 점 그래프(dot plot)가 더 정확하게 전달된다는 실천 지침의 근거가 되었다. Bertin이 정리한 위치, 크기, 모양, 색상(색조·명도·채도), 방향, 질감 등의 시각 변수(Visual Variables)는 양적 데이터와 범주형 데이터 각각에 적합한 속성이 다르다는 점을 알려 주며, 전주의적(pre-attentive) 처리가 가능한 색상과 크기 차이는 의식적 탐색 없이 즉시 눈에 띄므로 강조하려는 요소에만 제한적으로 써야 한다.
색상은 특히 신중하게 다뤄야 한다. 데이터의 성격에 따라 적합한 팔레트는 다음과 같다.
데이터 성격별 색상 팔레트
  • 정성적(qualitative) 팔레트: 순서가 없는 범주에는 서로 구별되는 색상을 사용한다.
  • 순차적(sequential) 팔레트: 낮은 값에서 높은 값으로 이어지는 양에는 명도가 단조롭게 변하는 색상을 사용한다.
  • 발산형(diverging) 팔레트: 기준점을 중심으로 양방향으로 벌어지는 값에 사용한다.
무지개(jet) 색상표는 명도가 일정하지 않아 데이터에 없는 경계를 만들어내므로 Viridis처럼 지각적으로 균일한(perceptually uniform) 색상표가 권장된다. 접근성(Accessibility) 측면에서는 남성의 약 8%가 적록 색각 이상을 가지므로 빨강-초록 대비에만 의존하지 않고 ColorBrewer나 Okabe-Ito 팔레트처럼 색각 이상자도 구별할 수 있는 팔레트를 쓰며, 색상 외에 모양·패턴·직접 레이블로 정보를 중복 인코딩하고, 충분한 명도 대비와 대체 텍스트, 스크린 리더가 읽을 수 있는 데이터 표를 함께 제공한다.
시각화는 목적에 따라 두 유형으로 나뉜다. 탐색적 시각화(Exploratory Visualization)는 분석가 자신이 데이터를 이해하기 위해 빠르게 많은 그래프를 그려 보는 과정으로, 탐색적 데이터 분석(Exploratory Data Analysis)의 핵심 도구다. 완성도보다 속도와 다양한 관점이 중요하므로 산점도 행렬(pair plot), 분포 그래프, 결측치 패턴 그래프를 대량으로 생성하며, 통계량이 같아도 분포가 전혀 다른 Anscombe의 사중주(Anscombe's Quartet)가 보여주듯 요약 통계만으로는 놓치는 구조를 발견하는 것이 목적이다.
반면 설명적 시각화(Explanatory Visualization)는 분석을 마친 뒤 발견한 통찰을 특정 청중에게 전달하기 위한 것으로, 하나의 메시지에 집중하여 불필요한 요소를 제거하고, 제목에 결론을 담으며, 주석과 강조 색으로 시선을 유도한다. 설명적 시각화가 일련의 흐름으로 구성되면 데이터 스토리텔링(Data Storytelling)이 된다. Cole Nussbaumer Knaflic이 『Storytelling with Data』에서 정리한 것처럼, 맥락을 먼저 파악하고 적절한 시각 형식을 고른 뒤, 잡음을 제거하고 청중의 주의를 핵심에 집중시키며, 설정-갈등-해결의 서사 구조로 배치하는 것이 핵심이다.
여러 지표를 한 화면에 모아 지속적으로 감시하도록 설계한 것이 대시보드(Dashboard)로, 비즈니스 인텔리전스(Business Intelligence) 도구에서 핵심 성과 지표(KPI)를 추적하는 데 널리 쓰인다. 좋은 대시보드는 가장 중요한 지표를 왼쪽 위에 배치하고, 숫자 카드·추세선·비교 막대처럼 질문별로 적합한 형식을 섞으며, 필터와 드릴다운으로 상세 수준을 조정할 수 있게 하되 한 화면에 너무 많은 차트를 넣어 집중을 흩뜨리지 않는다.
흔히 저지르는 오류는 지각 원리에서 벗어나는 데서 비롯된다. 막대 그래프의 세로축을 0이 아닌 값에서 시작하는 잘린 축(Truncated Axis)은 막대 길이의 비례 관계를 깨뜨려 작은 차이를 극적으로 과장하며, 꺾은선 그래프는 0에서 시작하지 않아도 되지만 축 범위를 명시해야 한다. 이중 세로축(dual axis)은 축 범위를 조정하는 것만으로 두 계열이 상관된 것처럼 보이게 할 수 있어 가급적 피하고, 로그 축을 쓸 때는 그 사실을 분명히 표시한다.
3D 효과는 원근 왜곡으로 뒤쪽 요소를 작게 보이게 하고 값을 축에 대응시키기 어렵게 만들며, 3D 파이 차트는 앞쪽 조각이 실제보다 커 보이는 대표적인 왜곡 사례다. 파이 차트(Pie Chart)는 각도와 면적으로 비율을 읽어야 하므로 조각이 많거나 크기가 비슷하면 비교가 거의 불가능하며, 2~3개의 범주로 "전체 중 일부"를 강조할 때만 제한적으로 쓰고 그 외에는 막대 그래프로 대체하는 것이 좋다. 그 밖에 범주형 축에 꺾은선을 그어 존재하지 않는 추세를 암시하는 것, 단위나 축 레이블을 생략하는 것, 표본 수를 표시하지 않고 평균만 비교하는 것, 상관관계를 인과관계처럼 보이는 제목을 다는 것도 피해야 한다.
데이터가 매우 크거나 고차원일 때는 별도의 전략이 필요하다. 수백만 개의 점을 산점도에 그리면 겹쳐서(overplotting) 밀도를 읽을 수 없으므로 투명도 조절, 육각형 구간화(hexbin), 2차원 밀도 추정, 또는 Datashader처럼 픽셀 단위로 집계해 래스터 이미지로 그리는 방법을 쓴다. 변수가 수십 개 이상인 고차원 데이터는 차원 축소(Dimensionality Reduction)로 2~3차원에 투영한 뒤 시각화한다.
주성분 분석(Principal Component Analysis)은 분산이 큰 선형 축을 찾아 전역 구조를 보존하고, t-SNE(t-distributed Stochastic Neighbor Embedding)는 고차원에서의 이웃 관계를 저차원에서 확률적으로 보존하여 군집(Clustering) 구조를 선명하게 드러내며, UMAP(Uniform Manifold Approximation and Projection)은 t-SNE보다 빠르고 전역 구조를 상대적으로 잘 유지하여 임베딩(Embedding) 벡터의 탐색에 널리 쓰인다.
다만 t-SNE와 UMAP의 결과에서 군집 간 거리나 군집의 크기는 원 공간의 거리를 그대로 반영하지 않으며, perplexity나 n_neighbors 같은 하이퍼파라미터에 따라 모양이 크게 달라지므로 여러 설정으로 그려 보고 해석에 주의해야 한다. 평행 좌표(parallel coordinates)나 산점도 행렬은 차원 축소 없이 고차원 데이터를 살펴보는 대안이다.
도구 생태계는 용도에 따라 층을 이룬다. 파이썬의 주요 라이브러리는 다음과 같다.
파이썬 시각화 라이브러리
  • Matplotlib: 가장 기본적인 저수준 라이브러리로, Figure와 Axes 객체 위에 거의 모든 요소를 세밀하게 제어하여 출판용 정적 그림을 만들 수 있다.
  • seaborn: Matplotlib 위에서 통계 시각화(분포, 회귀, 범주 비교, 히트맵, pair plot)를 데이터프레임 한 줄로 그릴 수 있게 한 고수준 라이브러리다.
  • Plotly: 브라우저에서 확대·호버·선택이 가능한 인터랙티브 차트를 만들고 Dash로 웹 대시보드까지 확장한다.
  • Vega-Altair: Wilkinson의 그래픽 문법(Grammar of Graphics)을 계승한 Vega-Lite 명세를 선언적으로 생성하여 데이터, 마크(mark), 인코딩(encoding)의 조합만으로 복잡한 인터랙션을 간결하게 표현한다.
R의 ggplot2 역시 그래픽 문법에 기반한 대표적인 라이브러리다. 웹에서는 D3.js가 데이터와 DOM 요소를 결합하여 SVG·Canvas로 완전히 맞춤화된 시각화를 만들 수 있는 저수준 표준이며, Observable Plot처럼 D3 위에 구축된 고수준 라이브러리와 ECharts, Vega 같은 독자적인 고수준 라이브러리가 더 간결한 API를 제공한다.
조직 차원의 공유와 셀프서비스 분석에는 Tableau, Looker, Power BI, Apache Superset, Metabase 같은 BI 도구가 데이터 웨어하우스(Data Warehouse)에 직접 연결하여 드래그 앤 드롭으로 대시보드를 만들고 권한 관리와 예약 배포를 제공한다. 도구를 고를 때는 정적 보고서인지 인터랙티브 탐색인지, 코드로 재현 가능해야 하는지, 데이터 규모가 브라우저가 감당할 수준인지, 청중이 분석가인지 경영진인지를 기준으로 삼는다.
결론적으로 데이터 시각화는 단순히 예쁜 그림을 만드는 일이 아니라, 지각 원리에 근거하여 데이터를 정직하게 인코딩하고 청중이 올바른 결론에 도달하도록 설계하는 분석과 커뮤니케이션의 교차점이며, 데이터 분석가(Data Analyst)와 데이터 과학자(Data Scientist) 모두에게 가장 자주 쓰이는 기본 역량이다.

#관련 용어

탐색적 데이터 분석
본격적인 모델링에 앞서 그래프와 요약 통계로 데이터의 구조와 특이점을 파악하는 분석 과정
데이터-잉크 비율
그래프에서 실제 데이터를 표현하는 데 쓰인 잉크가 전체 잉크에서 차지하는 비율로, 높을수록 군더더기가 적은 시각화
그래픽 문법
데이터, 기하 객체(마크), 시각 속성 인코딩, 척도, 좌표계의 조합으로 모든 차트를 기술하는 체계
차원 축소
고차원 데이터의 구조를 보존하면서 2~3차원으로 변환하여 시각화할 수 있게 하는 기법
비즈니스 인텔리전스
조직의 데이터를 수집·분석하고 대시보드와 보고서로 전달하여 의사 결정을 지원하는 체계와 도구
데이터 분석가
데이터를 분석하고 시각화하여 비즈니스 의사 결정에 필요한 통찰을 도출하는 직무

#직무 연관도

DA
Data Analyst
밀접
데이터 분석 결과를 차트와 대시보드로 전달하는 것이 핵심 업무이며, 차트 선택, 색상·접근성, 스토리텔링과 BI 도구 활용 능력이 직접적인 성과로 이어진다
DS
Data Scientist
높음
탐색적 데이터 분석, 모델 결과와 임베딩 공간의 해석, 실험 결과의 전달에 시각화를 일상적으로 활용하며 차원 축소 기법의 한계를 이해해야 한다
DE
Data Engineer
보통
파이프라인 모니터링 대시보드와 데이터 품질 지표를 시각화하고, BI 도구가 접근할 데이터 모델을 설계하며 대규모 데이터의 집계·렌더링 전략을 구현한다

#사용 사례

인터넷 서비스전자상거래금융의료제조미디어공공
개요
데이터 시각화는 경영 KPI 대시보드, 마케팅 퍼널과 코호트 분석, 금융 시계열과 리스크 모니터링, 의료 영상·임상 데이터 탐색, 제조 공정의 품질 관리도, 뉴스 미디어의 인포그래픽, 공공 통계의 지도 시각화, 머신러닝 실험 추적과 임베딩 공간 탐색 등 데이터가 있는 모든 영역에서 분석과 의사소통의 수단으로 활용된다.
사례
전자상거래 기업의 주간 성과 보고에서 카테고리별 매출을 3D 파이 차트로 보여주던 것을, 매출 상위 카테고리를 정렬한 수평 막대 그래프와 주차별 추세를 담은 스몰 멀티플 꺾은선 그래프로 바꾸고 전주 대비 하락한 카테고리만 강조색으로 표시하자, 경영진이 문제 카테고리를 즉시 식별하고 논의 시간이 절반으로 줄었다.

#참고 자료

#추천 포스트

© 2024 diki All rights reserved.