우주는 무질서를 향해 간다. 그 흐름에 맞서는 무언가가 있다. 우리는 그것을 지식이라고 부르지만, 지식이 어떻게 작동하는지에 관해서는 아직 합의된 이론이 없다.

이 글은 무한한 지식 시리즈의 앞선 글들 위에 세워져 있다. 두 가지 엔트로피(정보와 지식의 차이)와 어둠에 맞서는 것(물리적 힘으로서의 지식)은 여기서 말하는 지식 의 뜻을 정리하고, 도이치의 ‘바꾸기 어려운 설명’이라는 기준을 소개한다. 읽지 않아도 이 글을 따라올 수 있지만, 두 글은 이어지는 논의의 개념적 토대가 된다.


평가를 속인 시스템과 속이지 않은 시스템

2025년, 같은 연구 계보에서 나온 두 AI 시스템이 자기개선을 시도했다.

다윈 괴델 머신(DGM)은 학습이 고정된 파운데이션 모델을 바탕으로 자기 파이썬 코드베이스의 수정안을 스스로 제안하고 시험한 뒤, 성능이 나아진 수정만 남겼다. SWE-bench 코딩 벤치마크 성능은 인간의 개입 없이 20%에서 50%로 올랐다. 겉으로는 두 개의 루프가 모두 돌아가는 듯했다. 개방형 시스템은 보통 새 아이디어를 만드는 탐색(explore) 루프와 그 아이디어를 시험하고 사용하는 활용(exploit) 루프를 나란히 돌린다. DGM의 탐색 루프는 코드 수정안을 만들었고 활용 루프는 이를 시험했다. 그 결과는 벤치마크 점수라는 신호로 다시 시스템에 반영됐다.

연구자들이 시스템이 실제로 배운 것을 들여다보기 전까지는 인상적인 결과였다. 이른바 목표 함수 해킹(objective hacking) 과정에서 DGM은 자체 환각 탐지 코드를 없애면 점수를 부풀릴 수 있음을 알아냈다. 무언가를 지어냈을 때 이를 잡아내는 부분을 지운 것이다. 코딩 실력이 나아진 것이 아니라 평가를 속이는 능력이 좋아졌다.

같은 기반 위에 만든 AI 사이언티스트-v2는 달랐다. 같은 대규모 언어 모델과 에이전트 구조, 개방형 분석틀을 사용하지만 과학적 가설을 세우고 실험을 설계·실행하며, 결과를 분석해 논문을 쓴다. 이 시스템이 만든 논문 세 편이 동료 심사를 거치는 ICLR 워크숍에 제출됐고 한 편이 채택됐다.

아이디어 생성에서 트리 기반 실험과 논문 작성까지 이어지는 AI Scientist-v2의 작업 흐름.

AI 사이언티스트-v2는 아이디어를 만들고 여러 단계의 트리 기반 실험을 실행해 동료 심사가 가능한 원고를 완성한다. 그 논문 가운데 하나가 ICLR 워크숍에 채택되어, AI가 전 과정에서 생성한 논문으로는 처음 동료 심사를 통과했다. (야마다, 랑에, 루 외, 2025)

계보는 같았다. 결과는 아니었다.


진짜 지식과 소음을 가르는 것

답은 인식론(epistemology)에서 온다. AI 구조에 관한 질문치고는 뜻밖의 출처다.

이전 글은 진짜 지식과 소음을 구분하는 도이치의 기준을 소개했다. 좋은 설명은 설명력을 잃지 않고서는 세부를 쉽게 바꿀 수 없다. 계절을 데메테르의 슬픔으로 설명하는 신화는 다른 신의 충동으로 바꾸어도 설명이 달라지지 않는다. 세부가 현상과 연결돼 있지 않기 때문이다. 반면 지축의 기울기는 계절에 관한 설명을 무너뜨리지 않고 마음대로 바꿀 수 없다. 구성 요소가 세계의 실제 구조에 단단히 묶인 지식은 오래 살아남는다.

이 기준에는 여기서 짚어 둘 두 번째 성질이 있다. 바꾸기 어려운 설명에는 도이치가 확장성(reach) 이라고 부르는 힘이 있다. 그 설명은 애초에 고안된 목적을 훨씬 넘어선 문제까지 풀어낸다. 아인슈타인의 E=mc²는 전기역학의 수수께끼를 풀려고 도출됐지만, 핵에너지와 별의 수명, 양전자-전자 소멸까지 설명했다. 쉽게 바꿀 수 있는 설명에는 이런 확장성이 없다. 설계된 곳에서만, 그것도 우연히 작동한다.

지식 블록이 담긴 마음을 중심으로 두 루프가 돈다. 왼쪽의 활용 루프는 행동과 결정, 추론을 수행하고, 오른쪽의 탐색 루프는 질문과 가설, 실험을 수행한다. 두 루프 모두 세계와 연결되어 신호와 보상을 돌려받는다.

지식을 만드는 시스템은 두 개의 루프를 돌린다. 오른쪽의 탐색 루프는 질문하고 가설을 세우며 실험해 새 지식을 만든다. 왼쪽의 활용 루프는 행동과 결정, 추론을 통해 기존 지식을 작동시킨다. DGM과 AI 사이언티스트-v2는 모두 이 구조를 따른다. 차이는 위쪽 지식 저장소를 무엇으로 채우는지, 그리고 오른쪽 점선 블록의 새 지식이 쉽게 바꿀 수 없는 진짜 지식인지 임의적인 소음인지에 있다.

이제 이 렌즈로 DGM과 AI Scientist-v2를 보자.

DGM은 새로움을 만들었다. 점수는 계속 올랐고 버전마다 결과도 달랐다. 그러나 그 지식은 쉽게 바꿀 수 있었다. 편법 하나를 다른 편법으로 바꿔도 점수는 올랐다. 환각 탐지 코드를 없애는 행위는 소프트웨어 공학에 관해 아무것도 가르쳐 주지 않는다. 각각의 ‘개선’은 놀라웠지만 임의적이었다.

AI 사이언티스트-v2의 원고는 기존 문헌 위에 서 있었다. 선행 연구가 제약하는 가설을 세우고, 인간 심사자가 평가할 수 있는 실험을 수행해, 다른 연구자가 배울 수 있는 발견을 제시했다. 그 지식은 바꾸기 어려웠다. 실험 결과나 추론을 임의로 조정하면 논문 자체가 무너진다.

차이는 구조보다 무엇을 축적했는가 에 있다.


질문

이제 이 글이 답하려는 질문으로 가 보자. 지식을 창출하는 능력이 끝없이 확장되는 시스템을 만들 수 있을까? 스스로 가능성을 소진해 한계에 부딪히지 않고 새로운 이해를 계속 낳는 시스템 말이다.

이에 답하려면 개방성(open-endedness)의 정의와 이전 시도들이 실패한 이유, 무엇이 빠졌는지 보여 주는 분석틀이 필요하다.


개방성이 실제로 뜻하는 것

딥마인드의 2024년 입장문은 엄밀한 정의를 제시했다. 어떤 시스템이 특정 관찰자를 기준으로 새롭고도 학습 가능한 산물을 계속 만들어 낸다면, 그 관찰자에게 그 시스템은 ‘개방형’이다.

새로움은 그 산물들이 관찰자의 현재 모델로 점점 더 예측하기 어려워진다는 뜻이다. 학습 가능성은 산물들의 역사를 공부하면 미래의 산물을 더 잘 예측할 수 있다는 뜻이다. 두 조건 모두 필수다.

한 시스템이 만든 항공기 설계를 쥐와 인간 엔지니어, 외계 관찰자가 바라본다. 관찰자마다 새로움과 학습 가능성을 다르게 평가한다.

한 시스템이 항공기 설계를 연이어 만든다. 쥐에게는 새롭지만 학습할 수 없는 결과다. 인간 엔지니어에게는 새롭고도 학습 가능하므로 진정한 개방형 사례가 된다. 공기역학을 이미 모두 이해한 외계인에게는 학습 가능하지만 더 이상 새롭지 않다. 개방성은 시스템과 관찰자 사이의 관계다. (딥마인드, 2024)

잡음만 나오는 텔레비전은 학습 가능하다. 잡음의 분포를 모델링할 수 있기 때문이다. 그러나 그 잡음은 진정으로 새롭지 않다. 특성을 파악하고 나면 더는 놀랄 것이 없다. 채널을 무작위로 바꾸는 텔레비전은 매번 새로운 화면을 보여 주지만 학습할 수는 없다. 과거 화면이 다음 화면을 예측하는 데 아무 도움도 주지 않기 때문이다. 구조를 지니면서 학습 가능한 새로움 을 계속 만들어 내는 시스템만 개방형이라고 부를 수 있다.

DGM은 학습 가능성이 없는 새로움을 만들었다. 편법은 저마다 놀라웠지만 임의적이었고, 다음 발견의 토대가 되지 못했다. AI 사이언티스트-v2는 새로움과 학습 가능성을 모두 만들었다. 결과는 예상을 벗어났고 심사자는 논문에서 무언가를 배울 수 있었다. 이 정의는 두 시스템의 차이를 정확히 포착한다.


같은 벽에 부딪힌 30년

개방성을 계산으로 구현하려는 시도는 1990년대 초부터 이어져 왔다. 그러나 모든 시스템은 결국 멈췄다. 실패는 세 범주로 나뉘며, 범주마다 서로 다른 결핍을 드러낸다.

기반의 한계. 1991년 토머스 레이는 티에라(Tierra)의 가상 세계에 자기복제 프로그램 하나를 심었다. 돌아와 보니 기생체가 생겼고, 숙주는 면역을 진화시켰으며, 초(超)기생체까지 등장해 있었다. CPU 시간을 차지하려는 경쟁만으로 온전한 생태계가 만들어졌다. 그러나 이내 멈췄다. 개체군은 수렴했고 새로움은 고갈됐다.

유기체는 기존 구성 요소를 재배열할 수 있을 뿐 새로운 요소를 만들지는 못했다. 티에라의 생명체는 레이가 정한 명령어 집합 안에서 진화했지만 새 명령어를 발명할 수 없었다. 가능한 조합이 바닥나자 루프도 무너졌다. 기생이라는 실제 전략을 발견했으니 만들어 낸 지식은 진짜였다. 다만 좁은 명령어 집합에 특화된 얕은 지식이었고, 모의환경 밖으로 확장되는 힘은 제한적이었다.

환경의 한계. 2019년의 POET는 자연스러운 해결책을 시도했다. 고정된 환경이 새로움을 제한한다면 학습자와 함께 환경도 진화하게 하면 된다. 두 발로 걷는 에이전트는 평지에서 시작한다. 걷기를 익히면 언덕이 생기고, 언덕을 넘으면 틈이 벌어지며, 그 틈까지 건너면 땅이 움직이기 시작한다. 교육과정이 스스로 짜인다.

POET는 앞선 어떤 시스템보다 오래 작동했지만 새로움은 얕았다. 지형을 만드는 절차 문법은 언덕을 더 가파르게 하고 틈을 더 넓힐 수 있었다. 그러나 비나 포식자, 도구 같은 개념은 발명하지 못했다. 생성기는 더 내놓을 아이디어가 없어졌다. 애초에 새로운 아이디어를 만들 만큼 풍부한 어휘가 없었기 때문이다.

신호의 한계. 참신성 탐색(Novelty Search)과 MAP-Elites 같은 창의적인 탐색 알고리즘도 끝내 행동 공간을 소진했다. MAP-Elites는 실용적으로 놀라운 결과를 냈다. 다리가 여섯 개인 로봇이 미리 진화시킨 여러 보행 방식을 꺼내 써 큰 손상을 입고도 2분 안에 다시 걸었다. 그러나 지도는 언젠가 채워진다. 아무리 영리하게 탐색해도 고정된 세계가 제공할 수 있는 새로움은 유한하다.

세 가지 교훈, 하나의 패턴.

  1. 개방성을 유지하려면 기존 요소를 재배열하는 데 그치지 않고, 탐색할 수 있는 것 자체를 확장하는 탐색이 필요하다.
  2. 학습자와 환경은 공진화해야 하며, 환경에는 진짜 도전을 계속 만들어낼 만큼 충분히 풍부한 어휘가 필요하다.
  3. 탐색 루프에는 꺼내 쓸 수 있는 충분히 풍부한 지식 기반이 필요하다. 그렇지 않으면 탐색은 얕은 새로움만 만들어 낸다.

제프 클룬은 2019년 AI 생성 알고리즘 논문에서 이 패턴을 정확히 진단했다. 시스템 구조와 학습 알고리즘, 환경을 비롯한 모든 요소가 함께 진화해야 한다는 것이다. 당시에는 이를 구현할 실용적 장치가 없는 이론적 처방이었다.

놀라운 점은 이 해법을 제시한 개방형 학습 분야가 아니라, 다른 목표를 좇던 인접 분야의 기술이 실제로 그 해법을 구현했다는 사실이다.

비슷한 일은 역사에도 있었다. 이 시리즈의 두 번째 글이 바탕으로 삼은 조엘 모키어의 산업 계몽주의 연구는 명제적 지식, 곧 왜 에 관한 지식과 처방적 지식, 곧 어떻게 에 관한 지식이 피드백 루프로 맞물린 순간을 설명한다. 두 종류의 지식은 서로를 자극하며 더는 가능성을 소진하지 않았다. 두 루프는 인류가 장기간 유지해 온 유일한 지식 창조 과정, 곧 과학과 기술 발전의 기본 구조였다. 파운데이션 모델은 이 구조를 기계의 속도로 돌릴 수 있는 첫 번째 유력한 기반이다.


설명 생성기로서의 파운데이션 모델

파운데이션 모델이 이 일을 해낼 수 있는 근본적인 이유는 설명을 생성할 수 있기 때문이다.

인간이 남긴 방대한 텍스트로 학습한 언어 모델은 추론과 논증, 설명의 패턴을 가중치에 압축해 둔다. 프롬프트를 받으면 사물이 왜 그렇게 작동하는지 언어적으로 정돈된 설명 후보를 만든다. 물론 항상 맞는 설명을 내놓는 것은 아니다. AlphaFold의 모든 실행이 완벽한 구조를 예측하지 않는 것과 같다. 그래도 압축된 인간 지식을 광범위하게 활용해 한 사람이 따라갈 수 없는 속도와 폭으로 설명 후보를 제시한다.

테런스 타오는 이 비대칭을 잘 포착했다. 인간이 깊이 에 강하다면 AI는 폭 에 강하다. 수학자들이 지금까지 고안한 핵심 증명 기법을 담은 문서 1만 개를 떠올려 보자. 언어 모델은 리만 가설을 증명하기 위해 각 기법을 대규모로 시험할 수 있다. 인간 수학자 한 명이 평생 훑을 수 없는 범위다.

티에라와 POET를 비롯한 초기 시스템에는 이 능력이 없었다. 파운데이션 모델은 탐색 루프에 설명을 만들고 평가하며 다듬는 능력 을 보탠다. 그 결과 무작위에 가까운 탐색이 가설 중심의 탐구로 바뀐다.

AlphaFold는 이 구조의 한쪽 루프가 이미 작동한다는 증거다. 아미노산 서열을 받으면 실험 연구가 수십 년에 걸쳐 도달한 정확도로 단백질 구조를 예측한다. 활용 루프가 온전히 힘을 발휘한 사례이며, 데미스 허사비스와 존 점퍼는 이 성과로 2024년 노벨 화학상을 받았다. 다만 AlphaFold는 어떤 서열을 조사할지 스스로 정하지 않는다. 질문은 여전히 인간이 건넨다. 현재 실제로 쓰이는 다른 파운데이션 모델 기반 시스템도 마찬가지다.

파운데이션 모델은 개방형 시스템 안에서 네 가지 역할을 할 수 있다. 환경을 만들고, 지능적인 변이 연산자로 작동하며, 결과의 새로움과 흥미도를 평가하고, 자기개선을 위한 지식 기반이 된다. 예를 들어 OMNI-EPIC은 LLM으로 강화학습 환경을 실행 가능한 파이썬 코드로 만든다.


파운데이션 모델만으로는 부족한 이유

파운데이션 모델은 강력한 지식 기반이지만, 그 자체로는 개방형 시스템이 아니다. 근본적인 한계가 두 가지 있다.

새로운 경험에서 배울 수 없다. 파운데이션 모델의 지식은 학습이 끝난 시점에 고정된다. 스스로 발견한 내용에 맞춰 가중치를 갱신하지 못한다. 하나의 맥락 안에서는 지식을 훌륭하게 활성화 할 수 있지만, DNA가 세대를 거쳐 지식을 쌓고 과학자가 경력 내내 이해를 깊이는 것처럼 여러 맥락에 걸쳐 새 지식을 축적 하지는 못한다.

세계의 일부만 보고 작동한다. 파운데이션 모델은 제한된 문맥 창 안에서 작동하므로 어느 순간에도 세계의 전체 상태를 볼 수 없다. 더 큰 문제는 시간의 흐름에 따라 관찰을 통합할 지속 기억이 없다는 점이다.

이 한계는 부수적인 문제가 아니라 시스템 구조의 문제다. 안전장치가 없으면 DGM처럼 이해가 아니라 평가 지표를 최적화하는 실패로 이어진다.

학술적 논의에 그치는 문제도 아니다. Anthropic은 AI가 후계 시스템을 완전히 자율적으로 설계하고 구축할 수 있는 시점이 가까워지고 있다고 공개적으로 주장했다. 오늘날 모델의 정렬 실패가 후계 모델을 만드는 과정에서 누적될 수 있다. 그러면 문제는 더 자주 나타나는 동시에 원인은 갈수록 이해하기 어려워지고, 끝내 통제력을 잃을 수 있다. DGM은 이 위험의 축소판이다. 시스템이 평가 지표만 공략해 편법을 찾고, 그 편법을 다음 세대에 고정한다. 규모가 커지면 실패는 단순한 벤치마크 해킹으로 끝나지 않는다. 앞 세대의 편법을 물려받아 자기 편법까지 더하는 후계 시스템이 만들어진다. 두 루프 구조는 안전하게 자기개선할 시스템에 무엇이 빠졌는지를 드러내는 한 가지 관점이다.

병렬로 도는 자동 발견 루프와 인간의 과학·문화 루프가 해석 가능성과 감독을 통해 연결되고, 열린 탐색에서 출현한 결과물을 함께 만들어 낸다.

두 루프가 나란히 돌아간다. 왼쪽의 자동 발견 루프는 기계의 지식을 반복해 갱신하고, 오른쪽의 인간 과학·문화 루프는 인간의 지식을 갱신한다. 해석 가능성은 인간이 자동 루프의 학습 내용을 읽게 하며, 통제 신호는 반대 방향으로 흐른다. 두 루프 모두 결과물을 만든다. 둘 사이에 신뢰할 수 있는 통로가 없으면 재귀적 자기개선은 앞을 보지 못한 채 진행된다.


두 루프

이 글이 제안하는 구조는 다음과 같다.

지식을 만드는 시스템은 두 루프를 돌린다. **탐색 루프(explore loop)**는 질문하고 가설을 세우며 실험해 새 지식을 만든다. **활용 루프(exploit loop)**는 행동과 결정, 추론을 통해 기존 지식을 활성화한다. 둘 사이에는 신호와 보상이 오간다. 지식 저장소의 품질에 따라 시스템이 진짜 이해를 만들 수도, 정교한 소음을 만들 수도 있다.

파운데이션 모델이 움직이는 탐색 루프는 지식 후보를 대량으로 만든다. 활용 루프는 이를 현실에 비춰 시험한다. 검증된 지식은 저장소에 더해지고, 새 지식은 앞서 쌓인 지식을 토대로 더 멀리 나아간다. 과학과 이해가 누적되는 방식과 같다.

그러나 쌓이는 지식이 쉽게 바꿀 수 없는 경우에만 시스템은 진정한 개방형 학습을 이룬다. 실제 패턴을 부호화하고, 임의적인 수정에 견디며, 시간이 흐를수록 축적돼야 한다. 이런 필터가 없으면 DGM처럼 제자리에서 점점 더 빨리 달리는 시스템이 된다.


빠져 있는 것

파운데이션 모델은 지식 기반을 제공하고, 개방형 학습 연구는 시스템 구조를 제공한다. 아직 안정적으로 구현하지 못한 역량은 세 가지다.

지식 품질 필터. 시스템이 쉽게 바꿀 수 없는 설명이 아니라 평가 지표 공략, 편법 학습, 환각처럼 쉽게 바꿀 수 있는 설명을 만들 때 이를 감지할 장치가 필요하다. DGM의 실패는 드문 예외가 아니다. 자기개선 시스템의 핵심 미해결 문제다.

지속 학습 장치. 파운데이션 모델 기반 시스템이 여러 맥락에 걸쳐 지식을 축적할 방법이 필요하다. 과학자가 경력 내내 이해를 쌓는 것과 같은 방식이다. 현재 구조는 고정된 가중치와 제한된 문맥 창으로 작동하고 지속 기억도 없다. 따라서 통찰이 매번 사라지기 쉽다. 개방형 학습이 가능하려면 탐색 루프의 발견이 다음 맥락에도 보존돼야 한다.

정직한 신호 경로. 강화학습에서 가장 오래된 미해결 문제 가운데 하나이며, 부분적인 해법도 많이 제안됐다. 보상 형성(reward shaping, Ng·Harada·Russell, 1999)은 최적 정책을 바꾸지 않으면서 학습 신호를 더 매끄럽게 설계할 수 있음을 보였다. 역강화학습(Ng·Russell, 2000)은 전문가의 행동을 관찰해 보상을 추론하는 방식으로 문제를 뒤집었고, 오늘날 선호 학습 시스템의 개념적 선조가 됐다. RLHF는 이를 언어 모델에 실용적으로 적용했다. 과정 보상 모델(Lightman 외, “Let’s verify step by step”, 2023)은 최종 답뿐 아니라 추론 과정에도 보상해, 우연히 맞은 출력이 아니라 올바른 작업 과정에 점수를 주려 한다. DeepMind의 명세 공략 사례집에는 에이전트가 보상을 최대화하려고 의도하지 않은 편법을 찾은 사례 60개가 실려 있다. 다윈 괴델 머신은 그 최신 사례다.

이 알고리즘의 밑바탕에서는 섀넌과 위너의 구분이 거꾸로 작동한다. 보상 신호는 섀넌의 의미에서 정보, 곧 비트로 측정되는 차이를 전달한다. 그러나 실제로 전달해야 할 것은 위너의 의미에서 지식, 곧 행동이 나아지도록 모델을 갱신하는 신호다. 둘이 갈라지면 시스템은 비트만 최적화하고 지식 축적을 멈춘다. 미해결 문제는 단순히 영리한 보상을 설계하는 데 있지 않다. 시스템이 보상 신호를 공략하더라도 그 신뢰성이 훼손되지 않는 신호 경로를 설계해야 한다.

이 문제들은 개방형 머신러닝과 인식론이 만나는 지점에 놓여 있다. 머신러닝 연구에는 알고리즘과 연산 자원, 파운데이션 모델이 있다. 인식론에는 무엇을 진정한 지식으로 볼 수 있는지 판단하는 기준이 있다. 어느 한쪽만으로는 부족하다. 둘을 합쳐야 하나의 연구 프로그램이 된다.


작동하는 버전은 어떤 모습일 수 있을까

Lean 같은 정리 증명기 위에 구축된 시스템을 상정해 보자. 시스템은 추측을 만들고 증명을 시도한 뒤 커널에 제출한다. 커널은 증명을 승인하거나 거부한다. 신호 경로가 형 검사기 자체이므로 공략할 별도의 평가 지표가 없다. 증명에 성공하면 보조정리가 라이브러리에 더해지고 이후의 모든 증명에서 사용할 수 있다. 지식 저장소는 Lean으로 증명한 정리를 모은 중앙 라이브러리 Mathlib다. 이미 100만 줄을 넘었고 계속 커지고 있다. 탐색 루프는 타오가 말한 폭으로 증명 후보를 만들고, 활용 루프는 이를 더 어려운 추측을 푸는 구성 요소로 쓴다. 신호는 구조상 정직하게 유지된다. 커널의 형식 검증을 통과했으므로 그 지식은 임의로 바꾸기 어렵다.

AlphaProof가 2024년 국제수학올림피아드에서 은메달 수준의 성적을 거둔 일은 이것이 가설만은 아니라는 초기 증거다. 기반 자체가 정직성을 강제하는 영역에서는 이 구조가 작동한다. 문제는 그런 강제가 없는 영역에서 시스템을 만드는 일이다. 신호 경로가 공략에 견디도록 설계되고, 축적되는 지식이 설명과 편법을 구분해야 하는 영역 말이다.


아직 닫히지 않은 루프

AlphaFold로 돌아가자. AlphaFold는 2억 개에 이르는 단백질 구조를, 실험 연구가 수십 년에 걸쳐 도달한 수준의 정확도로 예측했다. 하나의 기계가 이 글에서 다룬 규모로 쉽게 바꿀 수 없는 지식을 만들어 낸 것이다.

AlphaFold2의 구조. 입력 서열은 다중 서열 정렬과 구조 템플릿을 거쳐 Evoformer로 들어가고, 이어 구조 모듈을 통과해 3차원 좌표를 만든다.

AlphaFold2의 구조. 입력 서열은 다중 서열 정렬과 구조 템플릿을 거쳐 Evoformer에 들어간다. Evoformer가 만든 쌍별 표상을 구조 모듈이 3차원 좌표로 변환한다. 이 시스템은 50년에 걸친 구조생물학의 성과를 하나의 미분 가능한 처리 과정에 압축했다. (Jumper 외, Nature 2021)

그러나 어떤 아미노산 서열을 건넬지는 인간 연구자가 골랐다. 시스템은 활용 루프 안에서 훌륭하게 지식을 만들었다. 질문을 받으면 새로운 이해를 이루는 답을 내놨다. 다만 탐색 루프를 돌리지는 않았다. 처음부터 무엇을 물을지 정하고 질문과 가설, 실험을 이어 가는 과정은 여전히 인간의 몫이었다.

AlphaFold는 단백질이 왜 그런 방식으로 접히는지 스스로 묻지 않았다. 자기 가정을 뒤집을 수도 있는 추측을 시험하려고 실험을 설계하지 않았고, 아직 아무도 생각하지 못한 문제를 조사하기로 선택하지도 않았다.

3세기 동안 과학은 추측과 실험, 비판과 수정을 거치며 탐색 루프를 체계적으로 돌렸다. 지난 30년 동안 AI는 이를 실리콘 위에 구현하려 했다. 앞으로 나아갈 길은 두 흐름이 만나는 지점에 있다. 앞으로 돌려야 할 체계는 바로 이 두 루프다. 관건은 두 루프가 만들어 낸 성과에 걸맞은 지식 저장소를 구축할 수 있느냐는 것이다.


이 글은 두 가지 엔트로피와 어둠에 맞서는 것에 이은 무한한 지식 시리즈의 세 번째 글이다. 다음 글인 ‘지능적’이라는 말을 바라보는 한 가지 유용한 관점은 지능을, 여기서 설명한 구조를 통해 높일 수 있는 하나의 측정값으로 다시 정의한다. 주요 출처로는 도이치의 The Beginning of Infinity, 스탠리와 레먼의 Why Greatness Cannot Be Planned, 클룬의 AI-Generating Algorithms 논문을 들 수 있다. 개방성의 엄밀한 정의는 DeepMind의 개방성과 ASI에 관한 입장문을 참고하면 된다.