02단계 · 표 다루기 (pandas)
그룹으로 묶어 계산하기
`groupby` 로 묶고 평균·개수·최대를 구하고, 여러 열로 묶는다.
먼저 알아볼게요
코드로 이동 ↓df.groupby("부서")["연봉"].mean() 은 "부서별로 묶어서 연봉의 평균" 이다. 읽는 순서 그대로다: 무엇으로 묶고 → 어떤 열을 → 어떻게 계산한다.
결과의 왼쪽에 부서 이름이 오는데, 이것이 인덱스가 된 것이다. .reset_index() 를 붙이면 다시 평범한 열로 내려온다.
.agg(["count", "max"]) 처럼 리스트를 주면 여러 계산을 한 번에 한다. 결과는 계산 이름이 열이 된 표다.
groupby(["부서", "직급"]) 처럼 리스트를 주면 두 열의 조합으로 묶인다. 결과 인덱스가 두 층이 되는데, 이것을 멀티인덱스라고 한다.
groupby 결과에 .max() 를 한 번 더 붙이면 "그룹별 평균 중 가장 큰 값" 이 된다. 1유형에서 자주 요구하는 모양이다.
이렇게 써요
import pandas as pd
df = pd.read_csv("sales.csv")
print(df.groupby("지점")["수량"].sum())
print(df.groupby("지점")["수량"].mean().round(2).reset_index())기억할 한 가지
groupby(묶을 열)[계산할 열].계산() — 읽는 순서 그대로 쓰면 된다.
직접 해보기
emp.csv 에서 ① 부서별 연봉 평균(소수 2) ② 부서별 연봉의 count·max ③ 직급별 연봉 평균 중 가장 큰 값(소수 2)을 출력하세요.
제공 파일 2개 · 내용 보기
파일은 준비되어 있어요. 코드에서 이름으로 불러오세요.
emp.csv
사번,이름,부서,직급,연봉,근속연수,고객만족도,입사일 1001,김서준,인사,사원,3230,2,3.8,2024-08-28 1002,이지우,인사,사원,4083,3,4.2,2023-07-26 1003,박도윤,인사,사원,3222,1,3.4,2025-09-24 1004,최하은,지원,부장,7395,18,4.6,2008-06-09 1005,정예준,영업,부장,8075,17,,2009-05-20 1006,강수아,인사,부장,7466,18,4.7,2008-06-01 1007,조민준,지원,대리,4558,5,4.7,2021-01-28 1008,윤지아,영업,과장,5796,,4.6,2015-04-13 1009,장시우,지원,과장,5878,13,4.6,2013-12-15 1010,임하윤,지원,대리,4686,9,3.3,2017-05-19 1011,한도현,지원,부장,7426,20,4.3,2006-07-27 1012,오채원,영업,사원,3545,4,,2022-06-25 1013,신건우,영업,사원,3724,1,3.8,2025-02-19 1014,권서연,영업,대리,4327,7,3.2,2019-05-06 1015,황준서,개발,부장,7732,21,4.7,2005-05-13 1016,안다은,영업,사원,3823,4,4.2,2022-01-13 1017,송지호,개발,부장,7262,19,4.4,2007-07-27 1018,전유진,지원,과장,6006,15,3.6,2011-03-16 1019,홍현우,개발,과장,5806,14,4.7,2012-10-17 1020,문소율,지원,사원,4008,,3.2,2023-01-06 1021,양지훈,개발,부장,7754,13,3.4,2013-07-10 1022,배가은,개발,과장,5483,13,3.4,2013-03-21 1023,백태윤,지원,사원,3510,4,4.1,2022-10-07 1024,유서윤,인사,사원,3477,2,,2024-06-22 1025,남주원,지원,사원,3581,1,3.3,2025-06-12 1026,노예린,영업,대리,4410,4,4.9,2022-06-04 1027,하시윤,지원,부장,7820,21,3.6,2005-04-15 1028,구다인,인사,사원,3846,1,3.2,2025-11-08 1029,서준혁,인사,대리,4549,4,3.2,2022-06-24 1030,민하율,개발,부장,7903,15,3.2,2011-12-03
sales.csv
주문일,지점,상품,수량,단가,회원등급 2026-01-24,홍대점,키보드,2,89000,Silver 2026-02-19,강남점,마우스,1,32000,Gold 2026-01-02,판교점,모니터,4,245000,Silver 2026-01-23,강남점,마우스,5,32000,Gold 2026-03-19,판교점,노트북,1,1290000,VIP 2026-01-03,판교점,노트북,5,1290000,Gold 2026-01-01,홍대점,키보드,3,89000,VIP 2026-01-25,홍대점,키보드,2,89000,Silver 2026-03-05,판교점,모니터,3,245000,Gold 2026-01-12,강남점,마우스,1,32000,VIP 2026-02-26,판교점,마우스,4,32000,Silver 2026-03-16,홍대점,마우스,5,32000,VIP 2026-02-03,판교점,마우스,2,32000,VIP 2026-03-25,판교점,모니터,2,245000,Gold 2026-02-14,홍대점,마우스,1,32000,Silver 2026-02-05,강남점,모니터,4,245000,Gold 2026-02-13,판교점,노트북,1,1290000,Gold 2026-01-12,홍대점,키보드,3,89000,Gold 2026-02-11,홍대점,모니터,1,245000,Gold 2026-03-16,판교점,키보드,4,89000,Silver 2026-03-07,홍대점,마우스,5,32000,Gold 2026-03-05,홍대점,마우스,5,32000,Gold 2026-03-16,홍대점,모니터,4,245000,Gold 2026-01-02,강남점,마우스,3,32000,VIP 2026-02-21,판교점,노트북,1,1290000,Gold 2026-03-28,강남점,키보드,2,89000,Silver 2026-01-24,홍대점,키보드,3,89000,VIP 2026-02-26,판교점,모니터,4,245000,Gold 2026-03-28,강남점,모니터,4,245000,VIP 2026-03-19,판교점,노트북,1,1290000,VIP 2026-01-19,판교점,모니터,4,245000,Gold 2026-01-22,강남점,모니터,4,245000,VIP 2026-01-14,강남점,키보드,4,89000,Silver 2026-01-28,강남점,키보드,1,89000,Gold 2026-01-11,강남점,모니터,3,245000,Gold 2026-01-22,강남점,키보드,1,89000,VIP 2026-03-10,판교점,마우스,5,32000,Silver 2026-01-17,강남점,키보드,5,89000,VIP 2026-02-23,판교점,노트북,5,1290000,VIP 2026-01-22,강남점,노트북,1,1290000,Silver 2026-02-23,판교점,마우스,5,32000,Gold 2026-03-20,강남점,노트북,5,1290000,VIP 2026-02-01,홍대점,모니터,3,245000,Silver 2026-01-01,홍대점,마우스,5,32000,Gold 2026-03-23,홍대점,마우스,3,32000,Gold 2026-02-16,홍대점,노트북,2,1290000,Silver 2026-03-12,강남점,모니터,1,245000,VIP 2026-03-26,강남점,마우스,3,32000,Silver 2026-02-04,판교점,모니터,5,245000,Silver 2026-01-24,홍대점,마우스,3,32000,VIP 2026-03-08,홍대점,모니터,4,245000,Gold 2026-02-11,홍대점,마우스,5,32000,VIP 2026-03-22,강남점,마우스,5,32000,VIP 2026-01-19,강남점,노트북,2,1290000,VIP 2026-01-12,판교점,마우스,1,32000,Gold 2026-02-08,강남점,마우스,2,32000,VIP 2026-02-15,홍대점,모니터,4,245000,VIP 2026-03-16,홍대점,노트북,1,1290000,Silver 2026-01-13,판교점,모니터,4,245000,VIP 2026-02-09,판교점,키보드,3,89000,Silver
내 코드 Python
Python 준비 중… 처음 한 번만 내려받아요
들여쓰기: Tab · 편집기에서 나가기: Esc 다음 Tab
실행 결과
실행하면 코드가 출력한 내용이 여기에 나타나요.
막혔을 때
풀이와 비교하기
내 코드와 한 줄씩 비교해 보세요. 풀이를 보는 것만으로 완료되지는 않아요.
import pandas as pd
df = pd.read_csv("emp.csv")
print(df.groupby("부서")["연봉"].mean().round(2))
print(df.groupby("부서")["연봉"].agg(["count", "max"]))
print(round(df.groupby("직급")["연봉"].mean().max(), 2))