관리
← 모든 글

평균과 중앙값 차이: 치우친 데이터에서 읽을 숫자

평균·중앙값 계산기

입력은 이 화면에서만 처리되며 서버에 전송하거나 저장하지 않습니다.

평균·중앙값 직접 계산하기

쉼표나 공백으로 숫자를 나누어 입력하세요. 최대 500개, 각 숫자의 절댓값은 1조 이하입니다. 단위가 같은 값끼리 비교하세요. 입력은 이 화면에서만 계산합니다.

계산할 숫자

설명용 예시의 평균은 100, 중앙값은 30입니다. 표본의 대표성이나 자료의 정확성을 이 계산으로 확인할 수는 없습니다.

JavaScript가 꺼져 있습니다. 계산식: 평균=합÷개수, 중앙값=크기순 정렬 후 가운데 값(짝수 개는 가운데 두 값의 평균).

평균과 중앙값은 서로 다른 질문에 답한다

“평균 대기 시간이 10분”이라는 안내를 보면 대부분 10분쯤 기다렸다고 생각하기 쉽습니다. 그러나 오래 기다린 사람이 몇 명만 있어도 평균은 올라갈 수 있습니다. 중앙값은 크기순으로 정렬한 자료의 가운데를 기준으로 읽는 수치입니다. 두 값 중 하나를 무조건 더 정확하다고 정하기보다, 전체 부담을 알고 싶은지 보통의 경험을 알고 싶은지부터 구별하는 것이 좋습니다.

평균과 중앙값 차이: 치우친 데이터에서 읽을 숫자 — 개념 설명 그림
개념 설명 그림

이 글에서는 가상의 대기 시간 자료를 사용합니다. 수치는 설명을 위해 만든 예시이며 어느 기관의 실제 통계나 실측 결과가 아닙니다. 간단한 다섯 개의 값으로 계산을 따라가고, 평균만 합칠 때 생기는 오류와 누락 처리의 영향을 함께 살펴봅니다. NIST와 호주 통계청의 공식 설명을 참고하되 아래 상황과 계산 예시는 독자의 판단을 돕기 위해 새로 구성했습니다.

평균과 중앙값을 확인하기 전에 자료의 단위와 대상이 같아야 합니다. 고객별 대기 시간인지 창구별 하루 평균인지, 초인지 분인지, 대기하지 않은 사람도 포함했는지에 따라 숫자가 달라집니다. 대표값을 잘 계산했더라도 질문과 자료의 범위가 다르면 읽는 사람이 잘못 해석할 수 있습니다.

1. 같은 다섯 명의 자료로 직접 계산하기

설명용 대기 시간이 2, 3, 4, 5, 36분이라고 가정합니다. 합계는 50분이고 다섯 명으로 나누면 평균은 10분입니다. 이미 크기순으로 정렬되어 있으므로 세 번째 값인 4분이 중앙값입니다. 평균 10분과 중앙값 4분은 같은 자료에서 나온 결과이며 둘 중 하나가 계산 오류인 것은 아닙니다.

비교를 위해 마지막 값만 6분으로 바꾼 2, 3, 4, 5, 6분을 생각해 봅시다. 합계는 20분, 평균은 4분, 중앙값도 4분입니다. 두 자료는 가운데 순서의 값이 같지만 총 대기 시간이 다릅니다. 이 차이는 평균과 중앙값이 자료에서 서로 다른 정보를 가져온다는 것을 보여 줍니다. 한 값을 극단적으로 바꿨을 때 평균이 크게 바뀌는 모습을 직접 볼 수 있습니다.

가상 자료 / 분평균중앙값
2, 3, 4, 5, 620 ÷ 5 = 4분4분
2, 3, 4, 5, 3650 ÷ 5 = 10분4분
2, 3, 5, 616 ÷ 4 = 4분(3 + 5) ÷ 2 = 4분

2. 중앙값이 실제 관측값일 필요는 없다

자료가 홀수 개이면 가운데 한 값을 찾지만 짝수 개이면 가운데 두 값의 평균을 사용합니다. 위의 네 개 자료 2, 3, 5, 6분에서는 가운데 두 값이 3과 5이므로 중앙값은 4분입니다. 실제로 4분 기다린 사람이 없어도 중앙값이 4분일 수 있습니다. “중앙값과 같은 사람이 반드시 한 명 있다”는 해석은 맞지 않습니다.

정렬을 잊으면 가운데 위치를 잘못 읽습니다. 입력 순서가 36, 2, 5, 3, 4분이라면 세 번째 입력값 5분을 중앙값으로 고르면 안 됩니다. 크기순 정렬 후 가운데를 찾아야 합니다. 표에서 행 순서를 바꾸기 어려우면 원본 행 ID를 유지한 채 계산용 사본을 정렬합니다. 결과 보고서에 원본 순서를 보존했는지도 함께 남기면 다른 열과의 연결이 끊기지 않습니다.

값을 정렬할 수 있다는 것과 산술 계산이 의미 있다는 것도 구별합니다. 색상처럼 크기 순서가 없는 범주에는 평균이나 중앙값을 붙이기 어렵습니다. 만족도 순위 같은 자료에서는 순서의 의미와 등급 사이 간격의 의미가 다를 수 있습니다. 숫자로 코딩된 자료라고 곧바로 시간이나 길이처럼 더하고 나눌 수 있다고 가정하지 않습니다.

3. 평균이 필요한 질문과 중앙값이 필요한 질문

전체 대기 시간의 합을 알고 싶다면 인원수와 평균의 관계가 유용합니다. 가상의 다섯 명 사례에서 평균 10분에 인원수 5를 곱하면 전체 50분입니다. 어느 창구에서 누적 지연이 큰지 비교할 때 이런 총량을 함께 볼 수 있습니다. 다만 서로 겹쳐 기다린 시간의 합은 창구가 멈춘 실제 경과 시간과 같지 않을 수 있으므로 지표의 의미를 적어야 합니다.

대표적인 한 사람의 경험을 설명하고 싶다면 중앙값을 함께 제시하는 것이 도움이 됩니다. 예시 자료에서는 중앙값 4분이 가운데 위치의 대기 시간을 보여 줍니다. 하지만 이 값 하나로 오래 기다린 사람이 얼마나 있는지 알 수는 없습니다. 평균을 중앙값으로 바꿔 적는 것만으로 대기 문제를 충분히 설명했다고 볼 수 없습니다.

실용적인 보고서는 “다섯 명의 평균 10분, 중앙값 4분, 최솟값 2분, 최댓값 36분”처럼 대상 수와 범위를 함께 적을 수 있습니다. 표본이 다섯 명뿐이라는 사실도 중요합니다. 한 명의 특이한 상황이 전체 결과를 크게 바꿀 수 있으므로 이 수치로 다음 날 모든 이용자의 대기 시간을 예측했다고 주장하지 않습니다.

4. 큰 값이 있다고 바로 지우지 않기

36분이 다른 값보다 커 보인다고 자동 삭제하면 실제 오래 기다린 경험을 숨길 수 있습니다. 먼저 입력 오류인지 실제 사건인지 확인합니다. 분 단위 열에 초 값을 넣었는지, 대기 시작 시각을 잘못 입력했는지, 특정 절차 때문에 오래 걸렸는지 조사할 수 있습니다. 오류로 확인되었다면 수정 사유를 남기고, 실제 관측이면 분석 목적에 맞게 포함 여부를 판단합니다.

정상적인 긴 대기가 포함된 자료라면 평균과 중앙값을 함께 보여 주고 왜 차이가 나는지 설명합니다. 반대로 오타로 확인된 값은 원본과 수정 값을 연결해 보존합니다. 단지 원하는 결과가 나오지 않는다는 이유로 큰 값을 제외하지 않습니다. 제외 전후 수치가 모두 필요한 상황이면 두 결과와 제외 기준을 나란히 제시할 수 있습니다.

평균과 중앙값 차이: 치우친 데이터에서 읽을 숫자 — 본문의 핵심 항목을 살펴보는 설명 그림
본문의 핵심 항목을 살펴보는 설명 그림

NIST의 위치 대표값 설명은 치우침이나 긴 꼬리가 있을 때 평균과 중앙값의 반응이 달라질 수 있음을 다룹니다. 이것을 “오른쪽으로 치우친 모든 작은 자료에서 평균은 반드시 중앙값보다 크다”는 판정 규칙으로 쓰지는 않습니다. 실제 값과 분포를 함께 확인합니다. 차이의 방향만 보고 데이터의 모양 전체를 확정하지 않는 편이 좋습니다.

5. 여러 집단의 평균을 합칠 때 인원수 확인하기

가상의 A 창구는 이용자 두 명의 평균 대기 시간이 10분이고, B 창구는 여덟 명의 평균이 20분이라고 가정합니다. 창구 평균 두 개를 단순히 더해 2로 나누면 15분입니다. 그러나 전체 열 명의 평균을 구할 때는 각 창구의 인원수가 다르다는 사실을 반영해야 합니다. A의 합계 20분과 B의 합계 160분을 합쳐 열 명으로 나누면 18분입니다.

여기서 15분은 두 창구의 평균값을 동일한 비중으로 평균낸 수치이고, 18분은 이용자 한 명을 같은 비중으로 계산한 전체 평균입니다. 둘은 다른 질문에 답합니다. 어떤 목적의 수치인지 적지 않으면 둘 중 하나를 계산 오류로 오해할 수 있습니다. 전체 이용자 경험을 말하는 보고서라면 집단별 인원수를 가중치로 쓰는 계산을 확인합니다.

집단의 중앙값 두 개를 평균내어 전체 중앙값을 구할 수도 없습니다. 중앙값은 전체 자료에서 가운데 순서가 어디인지 알아야 하기 때문입니다. 집단별 대표값만 받았으면 전체 중앙값을 계산하기에 정보가 부족할 수 있습니다. 그런 경우에는 원자료나 분포 정보가 필요한 이유를 적고, 알 수 없는 수치를 임의로 추정하지 않습니다.

6. 빈칸과 0은 분모를 바꾼다

설명용 자료 2, 3, 빈칸을 생각해 봅시다. 빈칸을 관측하지 못한 값으로 처리하면 알려진 두 값의 평균은 2.5입니다. 빈칸을 실제 0으로 바꾸면 세 값의 평균은 약 1.67입니다. 같은 표처럼 보이지만 서로 다른 의미의 계산입니다. 대기하지 않은 사람의 0과 측정하지 못한 사람의 빈칸을 구별해야 합니다.

보고서에는 “유효 관측 두 건, 누락 한 건”처럼 분모와 누락 수를 적습니다. 원래 대상이 세 명이라고 해서 평균의 분모가 항상 3이 되는 것은 아닙니다. 반대로 대기 시간이 0인 유효 관측을 빈칸으로 제외하면 대표값이 달라집니다. 계산 전에 각 코드의 의미를 확인하고, 자료 정리 단계에서 누락 값을 어떻게 다뤘는지 남깁니다.

단위 혼합도 비슷한 문제를 만듭니다. 어떤 행은 120초, 다른 행은 3분인데 숫자만 120과 3으로 저장되어 있으면 그대로 평균내면 안 됩니다. 먼저 같은 단위로 변환하고 원래 단위를 보존합니다. 소수점 자리수는 마지막 표시 단계에서 정하되, 계산 중간의 반올림이 결과를 바꾸는지 확인합니다.

7. 그래프와 숫자를 함께 읽는 방법

다섯 개의 설명용 자료는 가로축을 분으로 둔 점 그림으로 표현할 수 있습니다. 2, 3, 4, 5 부근에 네 점이 있고 36에 한 점이 떨어져 있습니다. 평균 10분과 중앙값 4분을 함께 표시하면 두 대표값의 차이를 이해하기 쉽습니다. 실제 통계 그래프를 만들 때는 축 단위와 표본 수, 자료의 출처를 함께 적습니다.

많은 자료를 비교할 때는 대표값뿐 아니라 분포와 집단 구성이 중요합니다. 오전에는 짧은 업무가 많고 오후에는 긴 업무가 많았다면 시간대별 평균 차이가 창구 성능 차이만을 뜻하지 않을 수 있습니다. 어떤 이용자가 포함되었는지와 측정 기준이 같았는지를 먼저 확인합니다. 숫자를 합칠수록 원래 자료의 조건을 다시 읽는 일이 필요합니다.

작은 표의 최대값과 최소값은 계산하기 쉽지만 흔한 경험을 설명하는 데 한계가 있습니다. 그래프가 한 점 때문에 넓게 늘어나면 짧은 대기 구간의 차이가 잘 보이지 않을 수도 있습니다. 축을 잘라 표시할 때는 범위와 표시 방법을 명확히 적고, 큰 값을 화면에서 감추지 않습니다. 시각화의 목적은 대표값을 유리하게 보이게 하는 것이 아니라 분포를 읽게 하는 것입니다.

8. 통계 문장을 확인하는 마지막 질문

이 숫자는 누구의 어떤 자료인가, 단위는 무엇인가, 유효한 값은 몇 개인가, 누락과 제외는 어떻게 처리했는가를 먼저 확인합니다. 다음으로 평균과 중앙값이 어떤 질문에 답하는지 읽고, 여러 집단을 합쳤다면 비중을 확인합니다. 마지막으로 분포나 범위 정보가 있어 대표값 뒤의 차이를 볼 수 있는지 살펴봅니다.

독자가 직접 보고서를 쓴다면 “설명용 자료 다섯 건에서 평균 10분, 중앙값 4분이며 긴 대기 한 건이 포함되어 있다”처럼 조건을 문장에 넣을 수 있습니다. “보통 10분 기다린다”는 짧은 표현보다 무엇을 계산했는지 분명합니다. 표와 설명을 같이 제공하면 두 대표값을 모두 읽는 사람이 필요한 판단을 할 수 있습니다.

평균과 중앙값의 차이는 통계 용어를 외우는 문제를 넘어 자료를 어떤 관점으로 요약했는지 확인하는 도구입니다. 같은 자료에서 총량과 가운데 경험이 다르게 보일 수 있음을 이해하면 뉴스, 업무 보고서, 서비스 안내의 숫자를 더 정확하게 읽을 수 있습니다. 실제 의사결정에는 예시 계산을 그대로 적용하기보다 원자료의 범위와 조건을 먼저 확인합니다.

공식 출처와 작성 기준

자료 확인일: 2026-10-03. 실제로 연 공식 자료를 바탕으로 AI가 작성한 설명입니다. 별도 표시한 계산·코드·점검 사례는 설명용이며 사용자 환경을 직접 시험하거나 실측한 결과가 아닙니다. 발행일에는 기능과 자료의 변경 여부를 다시 확인합니다.

본문의 이해를 돕기 위해 제작한 설명용 삽화입니다.

티스토리 원문 ↗