같은 날 의과대학을 졸업한 두 사람을 생각해 보자.
첫 번째 의사는 그 뒤 10년 동안 외과의 한 세부 전공만 파고들었다. 수천 건의 사례를 거치며 자기 분야에서는 멀리서 환자를 보기만 해도 병을 짚어낼 만큼 뛰어난 패턴 인식을 갖췄다. 전문 분야 안에서는 압도적이지만, 그 밖에서는 놀라울 만큼 평범하다. 익숙한 증상처럼 보이는 다른 질환을 만나면 스스로 의심해 보기도 전에 기존 범주에 끼워 맞추곤 한다. 동료들은 이 의사가 이례적인 증상을 가끔 놓친다는 사실을 안다.
두 번째 의사는 여러 분야를 두루 거쳤다. 응급의학과 농촌 진료, 국제 보건을 경험했고 공중보건 정책 업무도 맡았다. 더 다양한 사례를 본 덕분에 시야가 넓고, 서로 다른 분야의 증상을 연결할 수 있다. 애매한 사례에도 쉽게 흔들리지 않는다. 다만 어떤 한 시술의 정밀도에서는 전문의를 따라가지 못한다. 같은 일을 1만 번 반복해야 생기는 깊은 숙련은 부족하다.
어느 의사가 더 잘 배웠을까?
정직한 답은 무엇을 묻느냐에 따라 달라진다는 것이다. 자기 전문 분야에서는 첫 번째 의사의 판단이 날카롭고 정확하다. 그러나 학습 과정에서 접하지 못한 환자 집단, 이를테면 낯선 인구집단이나 이례적인 증상, 새로운 병원체를 만나면 판단이 흔들리기 시작한다. 두 번째 의사의 넓은 경험은 그런 변화에 더 잘 대응한다.
두 사람의 차이는 두 개념으로 정리할 수 있다. 편향은 모델이 가장 잘 맞는 영역에서도 얼마나 일관되게 빗나가는지를 나타낸다. 분산은 환경이 바뀔 때 모델의 판단이 얼마나 크게 흔들리는지를 나타낸다. 전문의의 렌즈는 자기 분야에서는 편향이 매우 낮지만 그 밖에서는 분산이 높다. 일반의의 렌즈는 개별 분야에서는 편향이 더 높다. 전문의만큼 세밀하게 보지는 못한다. 그러나 의료 전반에서의 분산은 더 낮다. 낯선 상황에도 덜 흔들린다.
이것이 편향-분산 트레이드오프다. 이 글의 핵심은 이 상충 관계가 통계 이론에만 나타나는 특수한 현상이 아니라는 데 있다. 끊임없이 변하는 세계에서 제한된 경험으로 모델을 만들어야 하는 모든 학습자가 맞닥뜨리는 제약이다. 시장을 읽는 방식과 가족이 나쁜 소식을 해석하는 방식, 규제기관이 위기를 놓치는 방식과 병원의 알고리즘이 환자를 판단하는 방식 모두에 영향을 미친다.
모든 렌즈는 어디에 해상도를 집중할지 선택해야 한다. 모든 곳을 똑같이 선명하게 보는 렌즈는 없다. 어떤 믿음 모델도 낮은 편향과 낮은 분산을 동시에 가질 수 없다. 이 선택은 구조적으로 피할 수 없다. 의식적으로 선택할 것인지, 과거 경험의 우연에 맡길 것인지만 남는다.
여기서 말하는 것은 ‘믿음 모델’이다. 이 표현이 뜻하는 바를 천천히 살펴볼 필요가 있다. 두 의사는 그저 서로 다른 의견에 도달한 것이 아니다. 10년 동안 서로 다른 데이터에 맞춰진 내면의 무언가가 각기 다른 의견을 만들어 냈다. 이 글은 바로 그 무언가를 다룬다.
믿음의 실체
믿음의 주체성은 믿음을 스스로 선택하고 책임질 수 있다고 주장했다. 당신은 무엇을 믿는가?는 믿음이라는 한 단어가 서로 다른 여섯 가지 역할을 한다고 설명했다. 이번에는 한 층 더 깊이 내려가 보자.
믿음이 실제로 무엇인지 자세히 들여다보면 익숙한 통념은 무너진다. 믿음은 머릿속 서랍에 넣어 둔 사실이 아니다. 세계의 신호를 받아 해석과 예상, 행동을 내놓는 장치의 출력이다. 그 장치를 더 간단히 부르면 모델이다.
회의실에 들어설 때면 우리는 회의가 어떻게 흘러갈지 이미 어느 정도 예상한다. 목록에서 답을 꺼낸 것이 아니다. 비슷한 회의에서 쌓인 경험으로 만든 모델이 주어진 단서를 바탕으로 예측을 내놓은 것이다. 훈련된 신경망에 이미지를 넣었을 때 예측값이 나오는 것과 비슷하다. 낯선 사람을 바라볼 때도, 가격 차트를 읽을 때도, 문단을 훑거나 연기 냄새를 맡을 때도 같은 일이 일어난다. 지각할 때마다 모델이 출력을 내놓고, 그 예측이 믿음으로 의식에 떠오른다. 모델이 렌즈인 셈이다.
우리는 모델 자체를 거의 보지 못한다. 보이는 것은 출력뿐이다. 그 출력은 세상을 직접 읽어 낸 사실처럼 느껴진다. 철학자 에릭 슈비츠게벨은 그 밑바탕의 장치를 성향적 프로필, 곧 해석을 만들어 내는 인지적·행동적·정서적 경향의 패턴이라고 부른다. 같은 뉴스가 한 사람에게는 안심할 만한 소식으로, 다른 사람에게는 위협으로 느껴지는 까닭이 여기에 있다. 같은 이력서를 보고도 한 사람은 인상 깊다고 여기고 다른 사람은 의심한다. 증거는 같아도 모델이 다르면 믿음도 달라진다.
여기서 중요한 결론이 나온다. 모델이 틀리면 그 모델이 만든 믿음도 틀리지만, 정작 모델 자체는 보이지 않는다. 보이는 것은 잘못된 믿음뿐이다. 그 믿음도 다른 믿음과 마찬가지로 직접 보고 안 사실처럼 느껴진다. 모델은 렌즈이고, 렌즈는 자기 자신을 볼 수 없다.
이 관점으로 두 의사를 다시 보자. 두 사람 모두 자기 렌즈를 직접 선택하지 않았다. 서로 다른 경험을 10년 동안 모델에 넣었고, 각 모델은 자기 데이터에 맞춰졌다. 전문의가 곳곳에서 익숙한 범주를 발견하는 까닭은 1만 번의 반복 경험이 그런 범주가 대체로 존재한다고 가르쳤기 때문이다. 일반의가 분야 사이의 연결을 보는 까닭은 모델이 어느 한 영역에 고정되지 않았기 때문이다. 자신의 믿음을 진정으로 책임지려면 믿음을 하나씩 점검하는 것만으로는 부족하다. 믿음을 만들어 내는 모델 자체를 이해해야 한다. 편향과 분산은 그 모델을 살펴보는 데 특히 유용한 도구다.
경력이 믿음 모델에 가르치는 것
두 의사의 사례가 선명한 까닭은 의료에는 측정 가능한 결과가 있기 때문이다. 같은 과정은 각자의 경력에서도 조금 덜 눈에 띄는 형태로 일어난다.
경력이 쌓일수록 모델은 직업 경험에 더 촘촘히 맞춰진다. 직관과 휴리스틱에 자리 잡아 사람과 상황을 판단하고 다음 일을 내다보는 방식에 영향을 준다. 경력 초기의 모델은 느슨하다. 무엇을 모르는지도 모르고, 뜻밖의 결과에 열려 있다. 분산이 높은 시기다. 많은 것을 흡수하고 큰 실수를 저지르며 방향도 쉽게 바꾼다.
경험이 쌓이면 모델이 단단해진다. 일이 어떻게 흘러가리라는 강한 사전 기대가 생긴다. 회의에서 반복되는 패턴이 보이고, 일부 이메일은 읽자마자 무시할 대상으로 분류되며, 결정도 빨라진다. 이런 능숙함은 대단히 유용하지만 함정의 시작이기도 하다.
모델이 단단해질수록 과거 경험의 구체적인 분포를 더 정밀하게 반영한다. 같은 산업과 역할, 문화가 유지되면 그 모델은 정확하고 효율적이다. 전문의가 되는 것이다. 그러나 새로운 기술이나 시장, 문화를 만나 분포가 달라지면 같은 모델이 확신에 찬 오판을 내놓기 시작한다. 과거 질서의 패턴으로 현재를 해석하다가 새로운 질서를 놓친다. 이른바 ‘지난 전쟁을 다시 치르는’ 전문가가 된다.
머신러닝에서는 이를 과적합이라고 한다. 모델이 학습 데이터를 지나치게 잘 익혀 실제 신호와 무관한 잡음과 우연까지 배운 탓에, 다른 세계에서 나온 데이터를 만나면 성능이 무너지는 현상이다. 지난해의 제품 구분에서 벗어나지 못하는 베테랑 영업사원, 직원 50명일 때 통하던 운영 방식을 5천 명 조직에도 고집하는 스타트업 관리자, 1990년부터 2007년까지 잘 맞던 모델이 2008년에 무너진 경제학자가 그런 예다.
불편한 점은 과적합이 안에서 어떻게 느껴지느냐에 있다. 과적합은 틀린 것처럼 느껴지지 않는다. 오히려 확신처럼 느껴진다. 모델은 한때 살았던 세계의 패턴을 깊이 내면화했기 때문에 또렷하고 자신 있는 출력을 내놓는다. 그 선명함은 옳다는 증거가 아니다. 이제는 떠나온 과거의 분포에 모델이 잘 맞는다는 증거일 수 있다.
반대편에는 과소적합이 있다. 모델이 너무 거칠어 실제 패턴을 포착하지 못하는 경우다. 몇 가지 분석 틀만 알고 판단력은 아직 없는 신입, 무엇이든 말할 수 있지만 실제로 해내는 일은 없는 제너럴리스트, 어느 고객에게나 맞는 듯하지만 정작 누구에게도 꼭 맞지 않는 발표 자료를 들고 다니는 컨설턴트가 그렇다. 과소적합한 사람은 과적합한 사람과 다른 방식으로 틀린다. 자신이 모른다는 사실과 그 간극을 어느 정도 느낀다. 과적합한 사람은 간극을 보지 못하고, 끝나 버린 질서의 패턴으로 자신 있게 메운다.
과적합과 과소적합 사이에는 좁은 적정 구간이 있다. 경력이 쌓이는 과정은 환경이 계속 바뀌는 가운데 그 구간을 찾아 머무는 일에 가깝다. 믿음 모델도 마찬가지다. 고정된 목적지가 아니라 계속 움직이는 목표다.
아래 인터랙티브 그래프에서 슬라이더를 움직여 다항식의 복잡도를 조절해 보자. 왼쪽으로 옮기면 경직된 모델(높은 편향, 낮은 분산)이, 오른쪽으로 옮기면 유연한 모델(낮은 편향, 높은 분산)이 나타난다. 복잡도가 높아질수록 학습 오차와 시험 오차의 차이가 벌어지는 모습도 확인할 수 있다. Resample Data(데이터 다시 추출)를 누르면 잡음이 새로 생성되어 분산이 실제로 어떻게 나타나는지 볼 수 있다.
이 그림에서 3~5차 부근이 좁은 적정 구간이다. 1차 모델은 너무 단순해 곡선을 포착하지 못한다. 과소적합한 렌즈다. 15차 모델은 모든 학습점을 지나려고 요동치다가 전체 형태를 놓친다. 과적합한 렌즈다. 믿음 모델도 이 슬라이더 위 어딘가에 놓여 있으며, 살아가는 동안 그 위치는 계속 달라진다.
정규화 장치와 의도적인 제약의 가치
적정 구간에 머물려면 때로는 데이터에서 덜 배우거나, 더 신중하게 배워야 한다. 직관에 어긋나지만 중요한 교훈이다.
머신러닝의 *정규화 장치(regularizer)*는 모델이 잡음을 좇지 못하도록 유연성을 의도적으로 제한한다. 편향이 조금 늘어나는 대가로 분산을 크게 줄이는 것이다. 모델은 미세한 패턴 일부를 놓치지만 실제로 없는 패턴을 만들어 내는 일도 줄인다. 학습 데이터에는 덜 완벽하게 맞더라도 새로운 데이터에서는 더 나은 성능을 낸다.
믿음 모델의 첫 번째 정규화 장치는 지적 겸손이다. 성격상의 미덕이 아니라 실제로 작동하는 장치로서의 겸손이다. 경험이 많아도 “확실하지 않다”고 말하는 태도는, 아직 근거가 충분하지 않은 패턴을 성급히 확정하지 못하게 제약한다.
두 번째는 자신의 판단과 어긋나는 증거에 의도적으로 노출되는 일이다. 자기 분야 밖의 글을 읽고, 직관이 다른 사람과 이야기하며, 평소 모델이 억누를 질문을 던져 보는 것이다. 인지과학에서는 마지막 방법을 ‘반대를 고려하기(consider the opposite)’ 개입이라고 부른다. 판단을 확정하기 전에 “내가 틀리려면 무엇이 참이어야 하는가?”라고 묻는 훈련이다.
이런 태도는 도덕적 의미의 미덕이라기보다 정규화 장치다. 익숙한 환경에서 약간의 해상도를 포기하는 대신, 환경이 달라졌을 때 쉽게 무너지지 않는 힘을 얻는다. 머신러닝의 정규화와 같은 원리다.
간단한 경험 법칙도 정규화 장치가 된다. 심리학자 게르트 기거렌처는 빠르고 간소한 휴리스틱이 새로운 데이터에서 정교한 통계 모델보다 더 나은 성과를 내는 경우를 수십 년간 연구했다. 가장 단순한 휴리스틱은 아는 것 대부분을 무시하고 좋은 단서 하나만으로 결정한다. 구조적으로 편향은 높지만 분산이 매우 낮다. 표본이 바뀌어도 안정적이다. 정교한 모델은 학습 데이터에는 절묘하게 맞지만 다음 표본에서 무너질 수 있다. 숙련자가 때때로 스프레드시트보다 직관을 믿는 형식적 이유가 여기에 있다. 직관은 덜 엄밀한 도구가 아니라 정규화 장치일 수 있다.
더 깊은 통찰은 세계를 모델에 맞출 수 있는 표현의 폭, 곧 모델 용량에 관한 것이다. 작업 기억과 축적된 지식, 추상화 능력은 모두 유한하다. 얼마나 많이 가졌는지만큼 어디에 배분하는지도 중요하다. 체스 고수의 원초적 기억력이 초보자보다 반드시 좋은 것은 아니다. 대신 체스판의 수많은 배열을 의미 있는 덩어리로 저장한 패턴 라이브러리가 있다. 초보자에게는 말만 보이는 곳에서 고수는 구조를 본다. 고차원의 경험을 압축해 중요한 것은 보존하고 나머지는 버리면서 실제로 쓸 수 있는 용량이 늘어난다. 신경망은 유용한 특징을 학습할 때 같은 일을 하고, 사람은 전문성을 쌓으며 같은 일을 한다. 언제나 중요한 질문은 올바른 패턴을 부호화하고 있느냐는 것이다.
과거 성공의 작동 원리가 아니라 겉모습처럼 잘못된 패턴을 부호화하면, 경험이 늘수록 판단은 더 어긋난다. 틀린 생각을 더 굳게 믿게 되는 셈이다. 믿음 모델의 정규화는 이런 일을 막는 훈련이다. 오랜 경험으로 얻은 패턴도 다음번 뜻밖의 사건이 수정할 수 있을 만큼 가볍게 쥐는 태도다.
이중 하강과 다차원적인 삶
여기서 이야기는 더 낯설어진다.
수십 년 동안 머신러닝의 통설은 편향-분산 트레이드오프가 U자형 곡선을 따른다는 것이었다. 복잡도가 너무 낮으면 과소적합하고, 너무 높으면 과적합한다. 적정 지점은 중간 어딘가에 있었다. 1992년 논문은 이 그림을 정식화해 한 세대의 연구에 영향을 줬다.
2019년 연구진은 이 곡선이 불완전하다는 사실을 보였다. 모델의 복잡도를 학습 데이터를 완전히 외우는 지점 너머까지 계속 높이면, 뜻밖에도 오차가 다시 줄어든다. 이를 이중 하강이라고 한다. 과적합 구간을 지나면 학습 과정은 데이터를 외울 수 있는 수많은 해 가운데 비교적 단순하고 안정적인 해를 찾아낸다. 겉보기에는 지나치게 복잡한 모델이 새로운 데이터에도 잘 작동하는 것이다.
아래 그림은 이 현상을 구체적으로 보여 준다. 매개변수 수가 학습점 수와 같아지는 지점에서 오차가 크게 치솟는다. 데이터를 외울 수 있는 용량이 겨우 생긴 상태라 잡음이 엄청나게 증폭되기 때문이다. 그 지점을 지나 복잡도를 더 높이면 오차는 꾸준히 낮아진다. 로그 눈금을 켜면 전체 변화를 더 분명히 볼 수 있다.
삶에서도 비슷한 일이 나타난다. 팀 어번의 진로 선택 틀은 삶을 다차원 최적화 문제로 본다. 우리는 의미와 경제적 안정, 자율성, 사회적 지위 등 서로 다른 욕구를 동시에 충족하려 한다. 어번은 여러 촉수가 각기 다른 방향으로 잡아당기는 이 구조를 ‘갈망하는 문어(Yearning Octopus)‘라고 부른다. 촉수 하나하나는 무엇이 중요한지에 대한 믿음을 담은 하위 모델이며, 다른 촉수와 가중치를 겨뤄 선호라는 충동을 만들어 낸다.
편향과 분산의 상충 관계는 모든 촉수에서 동시에 작동한다. 경제적 안정 모델의 편향을 줄이려고 안전한 급여를 택하면 의미 모델의 편향이 커질 수 있다. 자신이 진정으로 중요하게 여기는 것을 탐색하지 않기 때문이다. 사회적 지위 모델의 분산을 줄이려고 이미 인정받는 자리에 머물면 성장 모델의 분산이 커질 수 있다. 자신을 시험할 새로운 상황을 만나지 못하기 때문이다. 여러 하위 모델을 합친 전체 모델은 머신러닝의 표현으로 보면 심하게 과매개변수화돼 있다. 짧은 삶에서 얻은 경험만으로 결정하기에는 자유도가 너무 많다.
이중 하강과의 연결점이 여기서 나온다. 관심사가 너무 많고 시작만 한 길도 많아, 겉으로는 결단하지 못하는 듯 보이는 혼란과 정체성 위기를 통과한 사람도 있다. 이런 사람은 처음부터 한 길만 좁게 최적화한 사람보다 더 폭넓고 통합된 관점을 갖게 되기도 한다. 심리학자 로버트 키건은 성인 발달 단계에서 이와 비슷한 상태를 *자기 주도적 마음(self-authoring mind)*이라고 불렀다. 여러 분석 틀을 동시에 붙들고 필요에 따라 전환할 수 있는 상태다. 자기 인식과 메타인지, 모호함을 견디는 힘이라는 내부 구조가 가능한 수많은 삶 가운데 좋은 해법을 고르기 때문에 복잡성이 힘으로 바뀐다.
계속 탐색하느라 서른 살에는 ‘뒤처져’ 보이던 사람이, 스물두 살에 진로를 확정한 사람보다 마흔다섯 살에는 더 앞서 있을 수 있다. 삶에서 나타나는 이중 하강이다. 다만 지나치게 유연한 시기를 견디려면 주의를 다루는 습관과 계속 생각을 고치는 태도, 불확실성을 견디는 힘이 정규화 장치로 작동해야 한다.
이 글은 믿음의 주체성과 당신은 무엇을 믿는가?에 이은 ‘강력한 믿음’ 시리즈의 세 번째 글이다. 이 틀은 고전적인 통계학습 연구(Geman, Bienenstock, Doursat, 1992)와 현대의 이중 하강 연구(Belkin 외, 2019), 기거렌처의 빠르고 간소한 휴리스틱 연구를 바탕으로 한다. 믿음을 저장된 명제가 아니라 출력을 생성하는 모델로 보는 관점은 에릭 슈비츠게벨의 성향적 설명과 당신은 무엇을 믿는가?에서 소개한 다차원 분석을 확장한다. 이어지는 글 회복탄력성의 구조에서는 같은 트레이드오프가 조직과 문명에서 어떻게 나타나는지 살핀다.