02단계 · 표 다루기 (pandas)

정렬하고 n번째 뽑기

`sort_values` 로 정렬하고, "두 번째로 큰 것" 같은 발문을 코드로 옮긴다.

먼저 알아볼게요

코드로 이동 ↓

df.sort_values("연봉") 은 오름차순, ascending=False 를 주면 내림차순이다. 원본을 바꾸지 않고 정렬된 새 표를 준다.

nlargest(3) 은 큰 것 3개, nsmallest(3) 은 작은 것 3개를 바로 준다. 정렬 후 head(3) 과 같은 결과인데 더 짧다.

실기에서 자주 나오는 발문이 "N 번째로 큰 것" 이다. 내림차순으로 정렬한 뒤 iloc[N-1] 로 꺼낸다. 두 번째면 iloc[1] 이다 — 번호가 0부터라는 것을 여기서 또 만난다.

그룹 결과를 정렬하면 index 에 그룹 이름이 남아 있다. g.index[1] 은 두 번째 그룹의 이름, g.iloc[1] 은 그 값이다.

정렬 기준이 같은 값이 여러 개면 순서가 흔들릴 수 있다. 기준을 두 개 주면(by=["연봉", "사번"]) 결과가 고정된다.

이렇게 써요
import pandas as pd

df = pd.read_csv("emp.csv")
print(df.sort_values("연봉").head(2)[["이름", "연봉"]])
print(df["연봉"].nsmallest(2).tolist())
기억할 한 가지

"두 번째로 큰 것" = 내림차순 정렬 후 [1]. 그룹 이름은 index, 값은 iloc 다.

이 단계의 수업
  1. 1CSV 읽어 오기
  2. 2표의 모양 살펴보기
  3. 3자료형 확인하기 — 왜 정수가 실수가 되었나
  4. 4열 고르기 — Series 와 DataFrame
  5. 5loc 와 iloc — 이름으로 vs 번호로
  6. 6조건으로 행 거르기
  7. 7결측치 세고 채우고 버리기
  8. 8기초 통계 — 그리고 표준편차의 함정
  9. 9범주 세기 — unique 와 value_counts
  10. 10그룹으로 묶어 계산하기
  11. 11정렬하고 n번째 뽑기
  12. 12문자열 열 다루기 — 대소문자 함정
  13. 13날짜 다루기
  14. 14표 두 개 합치기
  15. 15피벗 — 표를 가로로 돌리기
  16. 16새 열 만들기 — 파생변수
직접 해보기

emp.csv 에서 ① 연봉 상위 3명의 이름·연봉 ② 연봉 상위 3개 값의 리스트 ③ 부서별 연봉 평균이 두 번째로 높은 부서의 이름 ④ 그 부서의 평균(소수 2)을 출력하세요.

제공 파일 1개 · 내용 보기

파일은 준비되어 있어요. 코드에서 이름으로 불러오세요.

emp.csv
사번,이름,부서,직급,연봉,근속연수,고객만족도,입사일
1001,김서준,인사,사원,3230,2,3.8,2024-08-28
1002,이지우,인사,사원,4083,3,4.2,2023-07-26
1003,박도윤,인사,사원,3222,1,3.4,2025-09-24
1004,최하은,지원,부장,7395,18,4.6,2008-06-09
1005,정예준,영업,부장,8075,17,,2009-05-20
1006,강수아,인사,부장,7466,18,4.7,2008-06-01
1007,조민준,지원,대리,4558,5,4.7,2021-01-28
1008,윤지아,영업,과장,5796,,4.6,2015-04-13
1009,장시우,지원,과장,5878,13,4.6,2013-12-15
1010,임하윤,지원,대리,4686,9,3.3,2017-05-19
1011,한도현,지원,부장,7426,20,4.3,2006-07-27
1012,오채원,영업,사원,3545,4,,2022-06-25
1013,신건우,영업,사원,3724,1,3.8,2025-02-19
1014,권서연,영업,대리,4327,7,3.2,2019-05-06
1015,황준서,개발,부장,7732,21,4.7,2005-05-13
1016,안다은,영업,사원,3823,4,4.2,2022-01-13
1017,송지호,개발,부장,7262,19,4.4,2007-07-27
1018,전유진,지원,과장,6006,15,3.6,2011-03-16
1019,홍현우,개발,과장,5806,14,4.7,2012-10-17
1020,문소율,지원,사원,4008,,3.2,2023-01-06
1021,양지훈,개발,부장,7754,13,3.4,2013-07-10
1022,배가은,개발,과장,5483,13,3.4,2013-03-21
1023,백태윤,지원,사원,3510,4,4.1,2022-10-07
1024,유서윤,인사,사원,3477,2,,2024-06-22
1025,남주원,지원,사원,3581,1,3.3,2025-06-12
1026,노예린,영업,대리,4410,4,4.9,2022-06-04
1027,하시윤,지원,부장,7820,21,3.6,2005-04-15
1028,구다인,인사,사원,3846,1,3.2,2025-11-08
1029,서준혁,인사,대리,4549,4,3.2,2022-06-24
1030,민하율,개발,부장,7903,15,3.2,2011-12-03
내 코드 Python
Python 준비 중… 처음 한 번만 내려받아요

들여쓰기: Tab · 편집기에서 나가기: Esc 다음 Tab

실행 결과

실행하면 코드가 출력한 내용이 여기에 나타나요.

막혔을 때

풀이와 비교하기

내 코드와 한 줄씩 비교해 보세요. 풀이를 보는 것만으로 완료되지는 않아요.

import pandas as pd

df = pd.read_csv("emp.csv")
print(df.sort_values("연봉", ascending=False).head(3)[["이름", "연봉"]])
print(df["연봉"].nlargest(3).tolist())
g = df.groupby("부서")["연봉"].mean().sort_values(ascending=False)
print(g.index[1])
print(round(g.iloc[1], 2))