02단계 · 표 다루기 (pandas)
기초 통계 — 그리고 표준편차의 함정
평균·중앙값·표준편차·사분위수를 구하고, `ddof` 가 표준편차를 바꾸는 것을 확인한다.
먼저 알아볼게요
코드로 이동 ↓mean() 평균, median() 중앙값, min()·max(), sum() 합, count() 는 결측치가 아닌 값의 개수다. len(df) 와 달리 빈 칸을 세지 않는다.
quantile(0.75) 는 3사분위수다. 0.25 는 1사분위수, 0.5 는 중앙값과 같다.
표준편차는 두 가지가 있다. pandas 의 std() 는 기본이 ddof=1(표본표준편차), numpy 의 np.std() 는 기본이 ddof=0(모표준편차)다. 같은 데이터인데 값이 다르게 나온다.
어느 쪽을 쓸지는 발문이 정한다. 표본표준편차인지 모표준편차인지 적혀 있으면 그대로 따르고, 아무 말이 없으면 적어도 내가 어느 정의를 썼는지는 알고 있어야 한다. 답이 미묘하게 안 맞을 때 가장 먼저 의심할 곳이 여기다 — 이 한 글자로 소수 둘째 자리가 어긋난다.
df.describe() 는 개수·평균·표준편차·사분위수를 한 번에 보여 준다. 탐색할 때 편하지만, 제출할 값은 필요한 것 하나만 골라 자리수를 고정해 출력한다.
import pandas as pd
import numpy as np
df = pd.read_csv("emp.csv")
print(df["연봉"].describe().round(2))
print(round(np.std(df["연봉"]), 4))pandas std() 는 ddof=1, numpy np.std() 는 ddof=0. 답이 미세하게 어긋나면 여기를 본다.
emp.csv 의 연봉 에서 ① 평균(소수 2) ② 중앙값(소수 2) ③ std()(소수 4) ④ std(ddof=0)(소수 4) ⑤ 3사분위수(소수 2) ⑥ 연봉·고객만족도 의 count() 를 한 줄에 출력하세요.
제공 파일 1개 · 내용 보기
파일은 준비되어 있어요. 코드에서 이름으로 불러오세요.
사번,이름,부서,직급,연봉,근속연수,고객만족도,입사일 1001,김서준,인사,사원,3230,2,3.8,2024-08-28 1002,이지우,인사,사원,4083,3,4.2,2023-07-26 1003,박도윤,인사,사원,3222,1,3.4,2025-09-24 1004,최하은,지원,부장,7395,18,4.6,2008-06-09 1005,정예준,영업,부장,8075,17,,2009-05-20 1006,강수아,인사,부장,7466,18,4.7,2008-06-01 1007,조민준,지원,대리,4558,5,4.7,2021-01-28 1008,윤지아,영업,과장,5796,,4.6,2015-04-13 1009,장시우,지원,과장,5878,13,4.6,2013-12-15 1010,임하윤,지원,대리,4686,9,3.3,2017-05-19 1011,한도현,지원,부장,7426,20,4.3,2006-07-27 1012,오채원,영업,사원,3545,4,,2022-06-25 1013,신건우,영업,사원,3724,1,3.8,2025-02-19 1014,권서연,영업,대리,4327,7,3.2,2019-05-06 1015,황준서,개발,부장,7732,21,4.7,2005-05-13 1016,안다은,영업,사원,3823,4,4.2,2022-01-13 1017,송지호,개발,부장,7262,19,4.4,2007-07-27 1018,전유진,지원,과장,6006,15,3.6,2011-03-16 1019,홍현우,개발,과장,5806,14,4.7,2012-10-17 1020,문소율,지원,사원,4008,,3.2,2023-01-06 1021,양지훈,개발,부장,7754,13,3.4,2013-07-10 1022,배가은,개발,과장,5483,13,3.4,2013-03-21 1023,백태윤,지원,사원,3510,4,4.1,2022-10-07 1024,유서윤,인사,사원,3477,2,,2024-06-22 1025,남주원,지원,사원,3581,1,3.3,2025-06-12 1026,노예린,영업,대리,4410,4,4.9,2022-06-04 1027,하시윤,지원,부장,7820,21,3.6,2005-04-15 1028,구다인,인사,사원,3846,1,3.2,2025-11-08 1029,서준혁,인사,대리,4549,4,3.2,2022-06-24 1030,민하율,개발,부장,7903,15,3.2,2011-12-03
들여쓰기: Tab · 편집기에서 나가기: Esc 다음 Tab
실행 결과
실행하면 코드가 출력한 내용이 여기에 나타나요.
막혔을 때
풀이와 비교하기
내 코드와 한 줄씩 비교해 보세요. 풀이를 보는 것만으로 완료되지는 않아요.
import pandas as pd
df = pd.read_csv("emp.csv")
pay = df["연봉"]
print(round(pay.mean(), 2))
print(round(pay.median(), 2))
print(round(pay.std(), 4))
print(round(pay.std(ddof=0), 4))
print(round(pay.quantile(0.75), 2))
print(pay.count(), df["고객만족도"].count())