스킬 점수 뒤에 숨은 착시, 심슨의 역설로 읽기
"저 사람 파이썬 실력 몇 점이에요?"라는 질문에 누군가 "87점"이라고 답한다면, 우리는 그 숫자를 얼마나 믿어야 할까요. 스킬 매트릭스와 역량 대시보드가 HR의 표준 도구로 자리 잡으면서, 사람의 능력을 하나의 숫자로 압축하는 관행이 빠르게 퍼지고 있습니다. 하지만 그 점수가 만들어지는 순간, 우리는 이미 원본 정보의 상당 부분을 잃어버립니다.
왜 지금인가
저희 팀도 내부적으로 칼럼별 성과를 점검하며 비슷한 고민을 한 적이 있습니다. 다만 그 경험은 엄밀한 통계 검증을 거친 것이 아니었기에, 이번 칼럼에서는 좀 더 확실한 근거를 찾아보기로 했습니다. 여러 산업 리서치와 컨설팅 보고서들은 공통적으로 기업들이 스킬 기반 인재관리(Skill-Based Organization)로 전환하고 있다는 흐름을 지적합니다. 채용·배치·승진 과정에서 정성적 판단을 정량 지표로 대체하려는 시도가 늘고 있다는 것인데, 문제는 이 전환 과정에서 측정 방식의 차이가 소리 없이 사라진다는 점입니다.
정량화는 의사결정을 빠르게 만들지만, 그 빠름의 대가로 '어떻게 측정했는가'라는 맥락을 종종 생략합니다.
이 현상을 설명하는 데 가장 널리 인용되는 학술 사례가 바로 심슨의 역설(Simpson's Paradox)입니다. 전체 집단을 합쳐서 보면 특정 경향이 보이지만, 집단을 세부 항목으로 쪼개서 보면 정반대 경향이 나타나는 통계 현상을 말합니다. 스킬 점수처럼 여러 출처의 데이터를 하나의 숫자로 합칠 때 이 역설이 발생할 위험이 특히 큽니다.
숫자로 보는 현황
심슨의 역설을 실증한 대표 사례는 1973년 미국 버클리 대학교(UC Berkeley) 대학원 입학 데이터입니다. 통계학자 피터 비켈(Peter Bickel) 등이 1975년 학술지 Science에 발표한 분석에 따르면, 그해 가을학기 대학원 지원자 중 남성 지원자의 합격률은 약 44%, 여성 지원자의 합격률은 약 35%로 집계돼 얼핏 성차별로 보였습니다.
그러나 연구진이 학과별로 데이터를 쪼개어 재분석하자 그림이 달라졌습니다. 대부분의 개별 학과에서는 여성 합격률이 남성과 비슷하거나 오히려 더 높게 나타났습니다. 원인은 여성 지원자들이 경쟁률이 높고 정원이 적은 학과(인문·사회 계열)에 상대적으로 더 많이 지원한 반면, 남성 지원자들은 정원이 넉넉한 학과(이공 계열)에 몰려 있었기 때문입니다. 즉 '전체 합격률'이라는 단일 지표는 학과별 지원 분포라는 숨은 변수를 지워버린 착시였던 셈입니다. 이 사례는 이후 통계학·사회과학 교재에서 정량 지표의 함정을 설명하는 표준 예시로 자리 잡았습니다.
1973년 UC 버클리 대학원 지원자 합격률 비교 (단위: %)
| 항목 | 합격률 |
|---|---|
| 남성 지원자 | 44 |
| 여성 지원자 | 35 |
출처: Bickel, Hammel & O'Connell (1975), Science, Vol. 187
전체 합격률만 보면 남성이 여성보다 약 9%포인트 높지만, 학과별로 쪼개보면 이 격차의 의미가 달라집니다.
스킬이 점수가 되는 순간
역량을 숫자로 바꾸는 작업은 필연적으로 맥락의 압축을 동반합니다. 자기평가, 동료평가, 프로젝트 성과, 시험 점수처럼 서로 다른 성격의 데이터가 하나의 지표로 합산될 때, 측정 방식의 차이는 사라지고 결과값만 남습니다. '데이터 분석 역량 4.2점'이라는 숫자는 그 사람이 통계에 강한지, 시각화에 강한지, 혹은 자기평가를 후하게 했을 뿐인지를 구분해주지 않습니다.
왜 착시가 생기는가
버클리 사례에서 학과별 분포가 숨은 변수였듯, 스킬 점수에서는 평가자 집단·업무 난이도·측정 시점이 숨은 변수 역할을 합니다. 난이도가 높은 프로젝트를 맡은 직원은 상대적으로 낮은 점수를 받기 쉽고, 관대한 평가자를 만난 직원은 실력과 무관하게 높은 점수를 받기 쉽습니다. 이 두 요인이 뒤섞인 채 전체 평균만 제시되면, 조직은 '누가 더 잘하는가'가 아니라 '누가 더 유리한 조건에 있었는가'를 측정하게 됩니다.
비교 가능성의 착시
더 큰 문제는 서로 다른 척도로 측정된 점수를 나란히 놓았을 때 생깁니다. 우리는 무의식적으로 그것이 동일한 기준으로 산출됐다고 가정하게 되는데, 이는 심슨의 역설이 보여준 '집단을 합치면 숨은 변수가 사라진다'는 구조와 정확히 닮아 있습니다. 물론 정량화 자체를 폐기하자는 주장은 아닙니다. 숫자는 대규모 비교와 추세 파악에 여전히 강력한 도구이며, 문제는 정량화 그 자체가 아니라 분해 없이 합산된 정량화에 있습니다.
현장의 변화
실제 사례: O*NET의 이중 지표 체계
미국 노동부가 운영하는 직업정보시스템 O*NET은 스킬을 다룰 때 '수준(Level)'과 '중요도(Importance)'를 별도 지표로 병기합니다. 단일 점수로 합치지 않고 두 축을 나란히 제시함으로써, 같은 점수라도 맥락에 따라 다르게 해석될 수 있음을 구조적으로 반영한 사례입니다. 이는 버클리 사례가 '전체 대신 학과별로 쪼개보라'고 제안한 방식과 같은 원리를 실무에 적용한 결과라 볼 수 있습니다.
가상 시나리오: 부서별 채점 편차
이해를 돕기 위한 가상의 예시를 하나 들어보겠습니다. 어느 조직에서 부서마다 평가자의 채점 성향이 달라 A부서는 평균 4.5점, B부서는 평균 3.2점을 기록했다고 가정해봅시다. 두 부서의 실제 역량 수준 차이가 아니라 단순히 평가 기준의 관대함 차이일 가능성이 높은데, 이런 경우 부서 간 척도 차이를 보정하는 절차 없이 승진·배치를 결정하면 심슨의 역설과 같은 왜곡이 발생할 위험이 있습니다.
시사점: 우리가 갖춰야 할 것
- 스킬 점수를 볼 때는 항상 '측정 방법'과 '평가자 맥락'을 함께 확인하기: 점수만 보지 말고 그 점수가 어떤 평가자 풀, 어떤 업무 난이도에서 나왔는지 원자료를 함께 조회하는 습관을 들여야 합니다.
- 단일 숫자보다 분포·추이·구성 요소를 함께 시각화해 착시를 줄이기: O*NET처럼 수준과 중요도를 분리하거나, 학과별 재분석처럼 세부 집단으로 쪼갠 도표를 병기하는 것이 효과적입니다.
- 부서·평가자 간 척도 차이를 보정하는 표준화 절차 마련하기: 평가자별 관대성 지수를 산출해 원점수를 보정하는 통계적 절차를 도입하면 심슨의 역설류 착시를 줄일 수 있습니다.
- 점수 기반 의사결정 전, 원본 정성 데이터를 재검토하는 습관 들이기: 프로젝트 평가서나 면담 기록 등 숫자로 압축되기 전 자료를 최소 표본이라도 다시 읽어보는 절차를 마련합니다.
- 조직 내 지표를 설계할 때 '무엇을 숫자로 만들지 못하는가'도 함께 논의하기: 지표 설계 회의 안건에 '이 숫자가 감추는 변수는 무엇인가'라는 질문을 정례화하는 것이 도움이 됩니다.
맺음말
숫자는 편리하지만, 그 편리함이 곧 진실을 보장하지는 않습니다. 버클리 대학원 입학 데이터가 보여주듯, 전체를 합친 숫자와 쪼개서 본 숫자는 전혀 다른 이야기를 할 수 있습니다. 스킬을 점수로 바꾸는 순간 우리가 얻는 것은 명료함이고, 잃는 것은 맥락이라는 사실을 기억할 때, 비로소 데이터는 착시가 아닌 통찰이 됩니다.
참고 자료
- Bickel, P. J., Hammel, E. A., & O'Connell, J. W. (1975), "Sex Bias in Graduate Admissions: Data from Berkeley", Science, Vol. 187
- LinkedIn Learning, 「Workplace Learning Report」(연례 발행 보고서)
- Deloitte, 「Global Human Capital Trends」(연례 보고서)
- McKinsey & Company, 스킬 기반 조직(Skills-Based Organization) 관련 리서치
- U.S. Department of Labor, 「O*NET Content Model」 (스킬 수준·중요도 병기 체계)
테크창 연구팀 | 인천대학교 창의인재개발학과 전공심화연구모임
댓글 (0)
아직 댓글이 없습니다. 첫 번째 댓글을 작성해보세요!