답 없이 이어진 질문의 사슬은 어떻게 애덤 스미스의 각주에 머물던 듯한 관찰을 현대 경제학의 가장 강력한 개념 중 하나로 바꾸었을까? 그리고 왜 그 문제는 이제 AI 개발자들을 괴롭히고 있을까?

정비공은 당신이 모르는 것을 안다. 그 비대칭은 부수적인 것이 아니다. 그것이 문제 전체다. (U.S. National Archives / NARA)
지금 이 순간에도 당신 삶의 어딘가에서는 누군가가 당신을 대신해 결정을 내리고 있고, 당신은 그 사람이 일을 잘하고 있는지 알 수 없다.
재무 상담사는 펀드를 고른다. 정비공은 엔진을 진단한다. 직원은 근무표를 작성한다. 외과의는 수술을 권한다. 선출직 대표는 법안에 투표한다. 그때마다 우리는 더 많은 정보를 가졌지만 이해관계는 서로 다르고, 완전히 들여다볼 수도 없는 사람에게 권한을 넘긴다.
이것이 주인-대리인 문제(principal-agent problem)다. 제도는 왜 실패하고 계약은 왜 지금과 같은 형태가 되었으며, 우리가 원하는 것과 실제로 얻는 것 사이의 간극은 왜 끝내 닫히지 않는가. 이 문제를 이해하는 데 경제학이 만든 개념 가운데 가장 유용한 것일지도 모른다.
경제학자들이 이 문제를 이해해 온 과정은 정리와 명제의 건조한 목록이 아니다. 2세기 반에 걸친 지적 추리소설에 가깝다. 답 하나가 나올 때마다 더 깊은 수수께끼가 열렸고, 그 질문의 연쇄가 이야기를 밀고 갔다. 아래에는 그 질문들과 답을 찾으려 했던 연구자들의 기록을 담았다. 그 시도들의 성과는 저마다 달랐다.
I. “다른 사람이 당신 돈을 관리하면 무슨 일이 벌어지는가?”

이 문제를 거의 각주처럼 처음 알아차린 사람. “남의 돈”을 관리하는 이사들에 대한 그의 관찰은, 경제학이 그것이 왜 중요한지 설명할 도구를 갖추기 전까지 150년 동안 거의 발전하지 않은 채 남아 있었다. (Wikimedia Commons)
그 문제의식은 경제학 자체보다 오래되었다.
1776년 애덤 스미스는 오늘날 기업의 전신인 주식회사에서 불편한 점을 발견했다. 그는 《국부론》에서 이사들이 ‘남의 돈’을 관리하므로 자기 돈을 지킬 때와 같은 경계심을 기대하기 어렵다고 썼다. 이를 중심으로 이론을 세우지는 않았다. 위임은 태만을 낳는다는 관찰을 거의 지나가듯 남겼을 뿐이다.
그 관찰은 150년이 넘도록 발전되지 않은 채 그 자리에 놓여 있었다.
그러다 1932년 컬럼비아대학교의 애돌프 벌리와 가디너 민스가 《현대 기업과 사유재산》을 출간했다. 이 책은 스미스의 시대 이후 미국 자본주의에 일어난 변화를 기록했다. 대기업의 소유권은 수백만 주주에게 흩어졌고, 누구도 의미 있는 통제력을 행사하지 못했다. 경영진은 스스로 지위를 이어 가는 독립된 계층이 되었다. 회사를 운영하는 사람과 소유한 사람은 사실상 서로 다른 목표를 좇는 집단이었다.
벌리와 민스는 질문을 날카롭게 던졌다. 재무적 위험을 지는 사람에게는 실제 권력이 없고, 권력을 가진 사람은 거의 아무 위험도 지지 않는다면 기업은 대체 누구를 위해 일하는가?
뼈아픈 관찰이었다. 그러나 여전히 현상을 서술하는 데 그쳤다. 무언가 잘못되었다는 사실 은 알려 주었지만, 왜 그 문제가 구조적으로 생기며 무엇을 할 수 있는지는 설명하지 못했다.
II. “이걸 정밀하게 만들 수 있을까? 정보가 한쪽에 치우치면 정확히 무엇이 잘못되는가?”

_애컬로프의 1970년 논문은 중고차를 다뤘지만, 진짜 주제는 한쪽만 정보를 가진 모든 시장이었다. 판매자는 언제나 더 많이 안다. (위키미디어 공용)_
이 질문에 답할 도구는 예상 밖의 방향에서 왔다. 보험의 경제학이었다.
1960년대 초 케네스 애로는 보험 시장이 왜 이상하게 움직이는지 연구하기 시작했다. 그는 도덕적 해이(moral hazard) 라는 현상을 찾아냈다. 누군가가 나쁜 결과에 대비해 보험에 들면 행동이 달라진다. 종합보험에 가입한 운전자는 덜 조심해서 운전하고, 화재보험에 든 집주인은 기름 묻은 걸레를 지하실에 쌓아 둔다. 위험을 이전하는 행위가 새로운 위험을 만든다.
애로의 통찰은 깊었다. 정보 문제는 단순한 시장 마찰이 아니라, 한쪽의 행동이 다른 쪽에게 보이지 않는 모든 관계의 구조적 특징임을 드러냈기 때문이다.
1970년 조지 애컬로프는 〈레몬 시장〉이라는 짧고 얼핏 장난스러워 보이는 논문을 발표했다. 이 논문은 하마터면 출간되지 못할 뻔했다. 두 학술지가 사소한 주제라는 이유로 거절했기 때문이다. 질문은 중고차에 관한 것이었지만 답은 경제학을 바꾸었다. 판매자는 자기 차가 불량품인지 알지만 구매자는 모른다면, 구매자는 최악의 경우를 가정해 낮은 가격을 제시한다. 결국 우량차가 빠져나가고 시장 자체가 와해된다. 이것이 역선택(adverse selection) 이다. 숨겨진 행동 이 아닌 숨겨진 특성 의 문제이며, 건강보험의 죽음의 나선부터 신용도가 충분한 사람이 대출을 받지 못하는 이유까지 설명한다.
마이클 스펜스는 이어서 거울상 같은 질문을 던졌다. 정보를 가진 쪽이 자신이 아는 것을 자발적으로 드러낼 수 있을까? 그의 노동시장 신호 모형(1973)은 노동자가 교육의 내용과 별개로 교육을 잠재 능력의 믿을 만한 신호(signal)로 사용할 수 있음을 보였다. 그 신호를 신뢰할 수 있는 까닭은 비용이 들기 때문이다. 능력이 높은 노동자만 그만한 투자를 할 가치가 있다고 판단하리라는 논리다.
이 세 사람, 애로와 애컬로프, 스펜스는 비대칭 정보(asymmetric information)가 특수한 예외가 아니라는 점을 확립한 공로로 2001년 노벨 경제학상을 받았다. 정보 비대칭은 경제생활의 일상적인 조건이다. 모든 거래와 계약, 권한 위임은 그 영향 아래 놓인다.
그러나 여기까지는 시장 수준 의 분석이었다. 남은 질문은 더 구체적이고 실무적이었다. 특정한 일을 특정한 사람에게 반드시 위임해야 한다면 거래를 어떻게 설계해야 하는가?
III. “그들이 무엇을 하는지 볼 수 없다면, 사람들에게 어떻게 보수를 줘야 하는가?”
여기서 주인-대리인 문제가 형식 이론으로 태어났다.
스펜스의 신호 논문과 같은 해인 1973년, 스티븐 로스는 *미국경제학회지(American Economic Review)*에 이 문제에 이름을 붙인 논문을 발표했다. 로스는 대리 관계(agency relationship)를 엄밀하게 정의했다. 한쪽 당사자, 곧 주인(principal)이 다른 쪽 당사자인 대리인(agent)을 고용해 서비스를 맡기고 의사결정 권한을 위임하는 관계다. 이어서 주인이 대리인의 노력을 직접 볼 수 없을 때 최적 보상 구조는 어떤 모습이어야 하는지 물었다.
3년 뒤 마이클 젠슨과 윌리엄 메클링은 경제학에서 가장 많이 인용되는 논문 가운데 하나를 발표했다. 두 사람은 대리인 비용(agency costs) 이라는 개념을 도입했다. 위임이 불완전하기 때문에 사회가 치르는 총비용이다. 대리인 비용은 세 가지로 나뉜다. 주인이 감시에 쓰는 비용, 대리인이 약속의 신뢰성을 보이기 위해 부담하는 보증 비용(bonding cost), 그리고 대리인이 실제로 한 일과 이해관계가 완전히 일치했다면 했을 일 사이의 줄일 수 없는 간극인 잔여 손실(residual loss) 이다. 젠슨과 메클링의 급진적인 주장은 기업 자체가 이런 대리 관계의 그물망에 지나지 않는다는 것이었다. 깊이 파고들수록 남는 것은 기업이라는 단일 실체가 아니라 계약의 연쇄다.
하지만 문제가 존재하고 비용이 든다는 것을 아는 것만으로는 해법 이 어떤 모습인지 알 수 없다. 그러려면 경제학에는 실제 최적화 문제를 푸는 사람이 필요했다. 노력은 볼 수 없고 결과만 볼 수 있다면, 수학적으로 가장 좋은 계약은 무엇인가?
IV. “최적 계약은 실제로 어떤 모습인가?”
그 답은 핀란드의 젊은 경제학자 벵트 홀름스트룀에게서 나왔다.
*벨 경제학 저널(Bell Journal of Economics)*에 실린 홀름스트룀의 1979년 논문 〈도덕적 해이와 관찰 가능성〉은 핵심 수학 문제를 풀어 놀라울 만큼 우아한 결과를 냈다. 최적 계약이 통계 검정처럼 작동한다는 것이다. 보상은 가능도비(likelihood ratio) 에 따라 달라져야 한다. 관찰된 결과가 대리인이 적은 노력을 들였을 때보다 큰 노력을 들였을 때 얼마나 더 그럴듯한가? 성실한 대리인이 게으른 대리인보다 훨씬 자주 만드는 결과라면 큰 보너스를 지급한다. 어느 노력 수준에서도 똑같이 나타날 법한 결과라면 노력에 관한 정보가 없으므로 보상에 반영해서는 안 된다.
이 논문에는 인센티브 이론에서 가장 중요한 결과로 꼽히는 정보성 원리(informativeness principle) 도 들어 있었다. 어떤 신호든 기존 지표가 담지 못한 추가 정보를 줄 때에만 계약에 포함해야 한다는 원리다. 함의는 분명하다. 최고경영자의 보너스는 자기 회사뿐 아니라 경쟁사의 주가와도 비교해 정해야 한다. 그래야 경영 능력과 무관한 시장 전체의 변동을 걸러낼 수 있다.
거의 같은 시기 샌퍼드 그로스먼과 올리버 하트(1983)는 수학적 구조를 더 명확히 하는 분석을 제시했다. 주인이 풀어야 할 문제는 두 단계 최적화다. 먼저 가능한 각 노력 수준을 가장 낮은 비용으로 구현하는 방법을 찾고, 다음으로 더 큰 노력을 유도할 때 얻는 한계편익과 인센티브 장치의 한계비용이 같아지는 수준을 선택한다.
이론적으로는 큰 성공이었다. 그러나 곧 더 깊은 질문이 드러났다.
V. “그냥 보수를 결과에 완벽하게 묶으면 안 되는가?”

소작 분배율이 곧 홀름스트룀-밀그롬 모형의 인센티브 강도를 정한다. 지주는 더 많은 노력을 끌어낼 필요와 소작인이 모든 위험을 감당할 수 없다는 사실 사이에서 균형을 잡는다. 계약 이론은 이 상충관계를 발명한 것이 아니라, 수세기 동안 존재하던 관계에 이름을 붙였을 뿐이다. (위키미디어 공용)
대리인은 인간이고, 인간은 위험을 싫어하기 때문이다.
이것이 인센티브와 보험의 상충관계(incentive-insurance trade-off) 다. 전체 이론의 심장부에 있는 긴장이다. 대리인이 위험중립적이라면 해법은 간단하다. 사업 전체를 일시금에 넘기고 모든 이익을 가져가게 하면 된다. 대리인이 곧 주인 이 되므로 이해관계도 일치한다. 소규모 자영업에서 본질적으로 일어나는 일이다.
하지만 대부분의 대리인은 위험회피적이다. 그들은 $200,000와 0달러 사이의 50대 50 도박보다 확실한 $100,000 연봉을 선호한다. 그래서 보수를 결과에 연결할 때, 그 결과가 일부는 그들의 노력에 달려 있지만 운, 시장 상황, 날씨, 그리고 수천 가지 통제 불가능한 요인에도 달려 있을 때, 당신은 그들이 부담하고 싶지 않은 위험을 흡수하라고 강요하는 셈이다. 그들은 그 위험을 부담하는 대가를 요구하고, 주인은 결국 더 높은 총 기대보상의 형태로 그것을 지불한다.
홀름스트룀과 폴 밀그롬의 1987년 논문은 이 상충관계에 결정적인 수학적 형태를 부여했다. 대리인이 시간에 따라 행동을 계속 조정할 수 있다는 현실적인 조건에서는 최적 계약이 총산출에 대한 단순한 선형 함수가 된다는 결과였다. 수수료율, 소작 분배율, 매출의 일정 비율로 정하는 보너스가 그 예다. 복잡한 장치의 조악한 근사치가 아니라 실제로 최적일 수 있다. 공식도 직관적이다. 성과 지표의 잡음이 적고 대리인이 위험을 덜 회피할수록 인센티브는 강해야 한다. 결과의 변동성이 크거나 대리인이 불확실성을 견디기 어려울수록 약해야 한다.
이것은 이론가들을 괴롭히던 수수께끼를 풀었다. 초기 이론이 권하는 것처럼 보였던 복잡한 비선형 장치들보다 현실 세계의 계약은 왜 그렇게 단순한가? 답은 현실적인 조건에서는 단순함이 최적 이라는 것이다.
그러나 그 해법은 훨씬 더 어려운 문제를 드러냈다.
VI. “측정할 수 없는 부분이 있는 일에서는 무슨 일이 벌어지는가?”
여기서 이론은 정말로 흥미로워지고, 정말로 불안해진다.
교사를 생각해 보자. 시험 점수는 측정할 수 있다. 학생이 호기심과 회복력, 창의성, 배움에 대한 애정을 기르는지는 쉽게 잴 수 없다. 경찰관의 체포 건수는 셀 수 있지만, 동네가 안전하다고 느끼는지, 공동체의 신뢰가 자라는지, 시민의 권리가 존중되는지는 쉽게 측정할 수 없다. 소프트웨어 엔지니어가 작성한 코드 줄 수와 처리한 티켓 수는 셀 수 있다. 코드가 관리하기 쉬워졌는지, 후배를 잘 지도하는지는 수치로 드러내기 어렵다.
1991년의 기념비적인 논문에서 홀름스트룀과 밀그롬은 대리인이 측정 용이성이 서로 다른 여러 과업을 맡을 때, 측정 가능한 과업에 인센티브를 주면 측정하기 어려운 과업이 훼손된다는 사실을 보였다. 부수적인 문제가 아니라 모형의 핵심 예측이다. 한 차원에 강한 인센티브를 걸면 다른 차원에서 노력이 빠져나간다.
학계를 충격에 빠뜨린 결과는 이렇다. 한 과업이 충분히 측정하기 어렵다면, 측정 가능한 과업에 대한 최적 인센티브가 완전히 0까지 떨어질 수 있다. 겉으로 보기에는 상상할 수 있는 가장 이빨 빠진 인센티브 장치인 고정급이 최선의 정책이 된다. 동기를 포기했기 때문이 아니다. 한쪽으로 치우친 인센티브가 인센티브 없음보다 더 나쁘다는 것을 인정했기 때문이다.
이 결과는 현실의 조직이 움직이는 방식을 상당 부분 설명한다. 공무원이 고정급을 받고 대학이 종신재직권을 주어 단기 성과 압박을 덜어 주는 까닭도 여기에 있다. 학자의 가장 중요한 산출물인 독창적 아이디어는 실시간으로 평가하기가 거의 불가능하기 때문이다. 웰스파고의 유령 계좌 스캔들도 같은 틀로 설명할 수 있다. 공격적인 판매 목표가 직원들에게 수백만 개의 무단 계좌를 만들도록 압박했다. 측정된 과업인 계좌 개설이 측정하기 어려운 과업인 고객의 필요를 충족하는 일을 집어삼켰다.
홀름스트룀은 나중에 노벨상 수상 강연에서 다중 과업 인센티브에 관한 이 통찰이 자신의 가장 중대한 기여였을지 모른다고 회고했다. 정보성 원리보다 더 중요했을 수도 있다. 현실의 인센티브 제도가 단일 과업 이론의 예측보다 일관되게 약한 까닭과, 조직이 순수한 성과급보다 관료적 규칙과 규범, 직무 설계에 크게 의존하는 까닭을 설명했기 때문이다.
VII. “계약이 꼭 필요하기는 한가? 평판이 일을 대신할 수 있을까?”
여기서 이론은 우아하게 방향을 튼다.
명시적인 계약만이 인센티브를 만드는 것은 아니다. 미래의 고용주가 과거 성과를 볼 수 있는 노동시장에서 일한다면, 유능해 보이고 싶은 욕구가 그 자체로 인센티브가 된다. 현재 고용주에게 고정급을 받더라도 마찬가지다.
홀름스트룀은 1982년에 처음 배포하고 1999년에 출판한 모형에서 이 생각을 정식화했다. 설정은 단순하다. 노동자의 성과는 능력과 노력, 운에 달려 있다. 능력은 누구도 확실히 알지 못하고 노력은 노동자만 통제한다. 노동시장은 관찰된 성과를 바탕으로 능력에 대한 평가를 갱신한다. 오늘의 높은 성과는 내일의 더 높은 임금 제안으로 이어진다.
이것이 홀름스트룀이 경력 평판에 대한 우려(career concerns) 라고 부른 효과다. 계약 조항이 아니라 시장이 사람을 학습하는 과정에서 생기는 암묵적 인센티브다. 이 효과는 경력 초기에 가장 강하다. 능력이 아직 불확실해 새 성과 자료 하나하나가 평가를 크게 바꾸기 때문이다. 노동시장이 그 사람의 능력 수준을 파악하면 암묵적 인센티브는 약해진다. 로펌의 젊은 변호사가 명시적 보너스 없이도 고된 장시간 노동을 하는 반면, 능력이 이미 알려진 고참 파트너에게는 지분과 이익분배가 필요한 이유가 여기에 있다.
그러나 경력 평판 효과는 양날의 칼이다. 로버트 기번스와 케빈 머피는 암묵적 인센티브와 명시적 인센티브가 서로 대체된다는 사실을 보였다. 경력 평판에 대한 우려가 강할수록 최적의 명시적 성과보수는 낮다. 더 큰 문제는 이 효과가 단기주의(short-termism) 를 낳을 수 있다는 점이다. 관리자는 장기 가치를 만드는 투자라도 자신의 능력에 관한 나쁜 신호를 드러낼 위험이 있으면 피할 수 있다.
주인이 미래의 계약 조건을 약속할 수 없는 반복 관계에서는 또 다른 왜곡이 나타난다. 래칫 효과(ratchet effect) 다. 올해 뛰어난 성과를 내면 내년에 목표만 높아진다고 예상한 대리인은 미래의 기준을 낮게 유지하려고 현재의 생산 능력을 숨긴다. 장자크 라퐁과 장 티롤은 이 동학을 정식화했다. 소련의 중앙계획가도 이 문제를 잘 알았다. 공장 관리자는 할당량을 감당할 수 있는 수준으로 유지하려고 생산 능력을 일상적으로 감췄다.
VIII. “이 중 실제로 작동하는 것이 있기는 한가?”
이론과 현실은 다르다. 이 이론은 현실에서도 살아남을까?
실증 연구에서는 놀라운 결과가 나왔다. 임원 보수 연구에서 젠슨과 머피의 1990년 연구는 미국 최고경영자의 실제 성과-보수 민감도를 측정했다. 주주가치가 1,000달러 변할 때 최고경영자의 총보상은 겨우 3.25달러 움직였다. 정보성 원리에 비추어 보면 터무니없이 낮은 수준이었다. 기업 이사회가 인센티브를 맞추려는 시도조차 하지 않는 것처럼 보였다.
이 발견은 뜻하지 않게 1990년대 스톡옵션 지급이 폭증하는 계기가 되었을지도 모른다. 그 결과 보수와 성과의 연결은 크게 강해졌다. 그러나 뤼시앙 베브추크와 제시 프리드의 영향력 있는 2003년 비판은 임원 보수 자체가 해법이 아니라 대리인 문제의 일부 가 되었다고 주장했다. 힘 있는 경영자가 이사회를 장악하고, 성과와 무관하게 자신을 부유하게 만드는 보상안을 설계했다는 것이다. 두 사람은 이를 경영자 권력 접근법(managerial power approach) 이라고 불렀다.
한편 마리안 베르트랑과 센딜 멀레이너선의 2001년 연구는 실제 기업 현장에서 정보성 원리가 뚜렷하게 위반되는 장면을 보여 주었다. 최고경영자는 유가나 환율로 업계 전체의 이익이 늘어난 경우처럼 경영 노력과 무관한 ‘운’에도 체계적으로 보상받았다. 이런 보상은 지배구조가 취약한 기업에 집중됐다. 지배구조가 좋은 기업은 홀름스트룀의 이론이 처방한 대로 잡음을 걸러냈다. 정보성 원리는 맞았지만, 정작 그 원리가 가장 필요한 기업들이 무시하고 있었다.
노동시장에서는 증거가 더 고무적이었다. 에드워드 레이지어의 세이프라이트 글래스 연구(2000)는 한 회사가 시간급에서 성과급으로 바꿨을 때 나타난 변화를 기록했다. 노동자 1인당 산출이 44% 뛰었다. 같은 노동자가 더 열심히 일한 인센티브 효과와 생산적인 노동자가 들어오고 그렇지 않은 노동자가 떠난 선별 효과가 함께 작용했다. 두 메커니즘은 이론이 예측한 대로 서로를 강화했다.
정치에서 주인-대리인이라는 관점은 민주주의가 어느 정도 작동하면서도 더 잘 작동하지 못하는 까닭을 비춘다. 존 피어존의 1986년 모형은 합리적인 유권자가 정책의 세부 내용을 몰라도 정치인을 통제할 수 있음을 보였다. 성과가 충분히 좋을 때만 현직자를 재선시키는 단순한 회고적 규칙을 쓰면 된다. 다만 모형은 한계도 드러냈다. 임기 제한은 재선의 동기를 없애 인센티브 장치를 약화한다. 임기 말에 가까워질수록 정치인의 행동은 관찰 가능한 정도로 나빠진다.
의료에서도 같은 틀은 행위별 수가제가 왜 과잉진료를 만들고 인두제가 왜 과소진료를 만드는지 설명한다. 두 제도는 인센티브와 보험의 상충관계에서 서로 다른 지점을 택하며, 어느 쪽도 완전하지 않다. 수십 년에 걸친 의료 지불제도 개혁 논쟁은 생사가 걸린 주인-대리인 이론의 응용 문제다.
IX. “어떤 계약도 모든 시나리오를 다룰 수 없다면?”

_올리버 하트와 벵트 홀름스트룀도 이 줄에 서 있다. 계약 이론의 서로 다른 절반을 발전시킨 두 사람은 같은 퍼즐의 상호보완적인 조각을 맞춘 공로로 같은 해 상을 받았다. (벵트 뉘만·위키미디어 공용, CC BY 2.0)_
지금까지의 이론은 아무리 영리하게 설계되었든 계약이 관찰 가능한 모든 결과에 대해 보수를 지정할 수 있다고 가정한다. 하지만 아무도 예상하지 못한 결과는 어떨까? 너무 복잡해서 완전한 조건부 계약을 쓰는 것이 물리적으로 불가능한 상황은 어떨까?
이것이 올리버 하트와 공동연구자들이 발전시킨 불완전 계약(incomplete contracts) 의 영역이다. 그로스먼과 함께 쓴 1986년의 기초 논문에서 하트는 실제 계약에 언제나 빈틈이 남는다면 누가 잔여 통제권(residual rights of control) 을 갖는지가 중요하다고 주장했다. 잔여 통제권은 계약에 명시되지 않은 상황에서 결정을 내릴 권한이다.
이 통찰은 분석의 무게중심을 보상 장치 에서 소유 구조 로 옮겼다. 공급자가 할 수 있는 모든 품질 개선을 계약으로 보상할 수 없다면 공급자의 공장을 직접 소유하는 편이 나을 수 있다. 하트의 이론은 기업은 왜 존재하는가라는 로널드 코스의 유명한 질문에 처음으로 엄밀한 답을 제시했다. 기업은 소유권의 묶음이며, 계약으로 보호하기 가장 어려운 투자를 하는 당사자에게 강한 인센티브를 주도록 구성된다.
하트와 홀름스트룀은 계약 이론에 대한 상호보완적 기여로 2016년 노벨 경제학상을 공동 수상했다. 홀름스트룀은 가능한 상황을 계약에 담을 수 있어도 인센티브가 완전할 수 없는 세계를, 하트는 애초에 모든 상황을 계약에 담는 일 자체가 불가능한 세계를 다뤘다.
X. “그렇다면 기계는?”
이제 이야기는 오늘날로 온다.
주인-대리인 문제의 가장 중대한 새로운 적용처는 AI 정렬(AI alignment) 일지 모른다. 만든 사람이 실제로 의도한 일을 수행하는 AI 시스템을 설계하는 과제다.
두 문제의 구조는 놀랄 만큼 평행하다. 인간 설계자인 주인이 AI 시스템이라는 대리인에게 과업을 맡긴다. AI의 목적함수는 설계자가 진정으로 원하는 것과 어긋날 수 있다. AI가 악의를 품어서가 아니다. 인간의 가치를 수학적으로 정확히 명시하는 일 자체가 대단히 복잡한 불완전 계약 문제이기 때문이다. 예상하지 못한 수백만 가지 맥락에서 작동할 시스템에 완전한 계약을 써 줄 수는 없다.
딜런 해드필드-메넬 등은 주인-대리인 이론이 축적해 온 통찰이 AI 정렬 문제에도 적용된다고 본다. 정보성 원리, 다중 과업 왜곡, 래칫 효과, 측정 가능한 대리지표를 목표로 삼을 때 나타나는 굿하트의 법칙이 모두 여기에 포함된다. 인간 복지의 대리지표에 맞춰 최적화한 AI 시스템은 설계자가 의도하지 않은 방식으로 그 지표를 파고들 수 있다. 홀름스트룀과 밀그롬의 다중 과업 모형이 예측한 것과 같은 결과다. 굿하트의 법칙, 곧 ‘측정 지표가 목표가 되는 순간 좋은 지표로서 기능을 잃는다’는 명제는 다중 과업 주인-대리인 문제를 한 문장으로 압축한다.
인간 직원과 달리 AI 시스템은 잠재적으로 재설계 할 수 있다는 점이 변수다. 주인은 대리인의 선호를 일부 설계할 수 있는 통제력을 갖는다. 고전 이론에는 없던 특징이다. 이것이 문제를 더 쉽게 만드는지 더 어렵게 만드는지는 경제학과 컴퓨터과학 양쪽에 남은 열린 질문이다.
질문을 이어 주는 사슬
한 걸음 물러서서 이 지적 여정의 구조를 보자.
스미스는 물었다. 낯선 사람에게 돈을 맡기면 무슨 일이 벌어지는가? 벌리와 민스는 그것이 경제 전체에서 벌어졌음을 기록했다. 애로와 애컬로프는 정보 비대칭이 근본 원인임을 보였다. 로스와 젠슨은 문제에 이름을 붙이고 비용의 구조를 밝혔다. 홀름스트룀은 최적 계약의 모습을 보인 뒤, 업무에 측정하기 어려운 부분이 있으면 그 계약이 왜 실패하는지도 설명했다. 하트는 계약 자체가 불완전할 때 무엇을 해야 하는지 물었다. 이제 새로운 세대는 소작농과 최고경영자 보수를 둘러싼 논쟁에서 벼려진 개념들이 애덤 스미스가 상상한 어떤 대리인보다 강력한 시스템을 정렬하는 데 도움이 될지 묻고 있다.
답 하나하나가 더 어려운 질문을 낳고, 해법 하나하나가 더 깊은 문제를 드러냈다. 새로운 질문을 낳는 아이디어는 논쟁에 종지부를 찍지 않는다. 아직 풀어야 할 일이 얼마나 많은지 보여 준다.
주인-대리인 문제는 해결되지 않았다. 어쩌면 해결 불가능할지도 모른다. 하지만 그것을 이해하려는 250년의 노력은 해법보다 더 귀한 것을 만들어냈다. 신뢰, 위임, 그리고 우리를 대신해 행동해달라고 타인에게 의존할 때 생기는 줄일 수 없는 비용에 대해 명료하게 생각하기 위한 언어 다.
그리고 정비공이 왜 항상 당신 차에서 추가로 고장 난 곳을 찾아내는지 궁금했던 적이 있다면, 이제 그 이름을 알게 된 셈이다.
이 글은 질문의 흐름을 따라갔다. 짝을 이루는 다음 글은 해법의 지도를 그린다. 인류가 신뢰 문제를 풀기 위해 만든 온갖 무기와, 그 무기들이 저마다 새로운 방식으로 실패하는 까닭을 살핀다.