
다음을 맞히는 기계들
누구도 다음 단어를 알지 못한다는 문장에서 출발해, 미사일의 다음 자리를 맞히는 칼만 필터부터 날씨 예보와 마트의 장바구니, 다음 낱말을 고르는 LLM까지 따라가 본다. 오늘의 한 페이지 두 번째 글.

오늘도 아이디어 노트를 아무 데나 펼쳤다. 손가락이 멈춘 자리에는 이런 문장이 있었다.
우리 모두는 새로운 인생의 문장을 만드는 사람과도 같다. 누구도 다음에 어떤 단어가 주어질지 알지 못한다.
읽자마자 웃음이 났다. 요즘 우리가 AI라고 부르는 것, 그러니까 챗GPT 같은 대형 언어 모델(LLM)이 바로 그 일로 만들어졌기 때문이다. 앞에 놓인 글을 보고 다음에 올 낱말을 맞히는 일. 그걸 어마어마하게 많이, 어마어마하게 잘하도록 훈련시킨 것이 지금의 LLM이다. 사람은 다음 단어를 모르고 살아가는데, 기계는 다음 단어를 맞히는 것으로 먹고산다.
그런데 다음을 맞히는 기계가 LLM이 처음은 아니다. 날아오는 미사일의 다음 자리, 내일 오후의 기압, 태풍이 오기 전 마트 장바구니까지, 사람들은 오래전부터 '다음'을 계산해 왔다. 오늘은 그 기계들을 차례로 만나 본다.
날아가는 것의 다음 자리
1960년, 헝가리 출신의 수학자 루돌프 칼만이 논문 한 편을 냈다. 제목은 「선형 필터링과 예측 문제에 대한 새로운 접근」. 처음에는 반응이 시원찮았다. 그해 가을 칼만은 미국 항공우주국(NASA)의 에임스 연구소를 찾아갔고, 거기서 스탠리 슈밋이라는 연구자를 만난다. 슈밋의 팀은 달로 가는 우주선이 지금 어디 있는지 계산하는 문제로 씨름하고 있었다. 우주선에 실을 컴퓨터는 작고 느렸고, 지상의 관측값은 늘 조금씩 틀렸다.
슈밋은 칼만의 방법을 달 궤도 문제에 맞게 고쳤다. 이 계산법은 아폴로 우주선의 항법 컴퓨터로 들어갔고, 사람을 달에 보냈다가 데려오는 데 쓰였다.

칼만 필터가 하는 일은 셋으로 줄일 수 있다.
첫째, 예측한다. 방금 전의 위치와 속도를 알면 물리 법칙으로 0.1초 뒤의 자리를 계산할 수 있다. 다만 바람이 불고 엔진이 조금씩 흔들리니 이 예측은 시간이 갈수록 흐려진다.
둘째, 잰다. 레이더가 물체를 본다. 이것도 믿을 수만은 없다. 레이더가 본 자리는 매번 조금씩 흔들린다.
셋째, 섞는다. 여기가 칼만 필터의 핵심이다. 예측과 측정 가운데 어느 쪽이 더 확실한지 따져, 더 믿을 만한 쪽으로 기운다. 레이더가 또렷하면 레이더 쪽으로, 레이더가 흐리면 예측 쪽으로. 그렇게 섞은 값은 둘 중 어느 하나만 믿었을 때보다 오차가 작다. 이 대목이 처음엔 이상하게 들리는데, 틀린 정보 두 개를 잘 섞으면 덜 틀린 정보가 된다.

불 꺼진 방에서 화장실을 찾아가는 일과 비슷하다. 걸음 수로 지금 어디쯤인지 어림하다가(예측), 손끝에 벽이 닿으면(측정) 머릿속 지도를 고친다. 손끝이 확실하면 크게 고치고, 뭔가 애매한 게 닿으면 조금만 고친다.
우리도 매일 이 필터를 쓴다. 터널에 들어가 GPS 신호가 끊겨도 휴대폰 지도의 파란 점은 한동안 앞으로 나아간다. 마지막으로 알던 속도와 방향으로 다음 자리를 계속 예측하는 것이다. 터널을 빠져나와 신호가 다시 잡히면 점이 살짝 튀면서 제자리를 찾는다. 예측과 측정이 다시 섞이는 순간이다.
말로만 들으면 감이 잘 안 온다. 그래서 직접 만져볼 수 있게 만들었다.
몇 가지를 해 보면 좋다. 레이더 흔들림을 끝까지 올리면 주황 점은 사방으로 흩어지는데 파란 선은 생각보다 덜 흔들린다. 왼쪽 위 숫자를 보면 추정의 오차가 레이더 한 번의 오차보다 작다. 구름 속 구간에 들어가면 측정이 끊기고, 필터는 예측만으로 버틴다. 그동안 파란 동그라미가 부풀어 오르는데, 모르는 게 늘어난다는 걸 필터 스스로 알고 있다는 뜻이다. '무엇을 더 믿나'를 물리 법칙 쪽 끝으로 밀고 바람을 세게 하면, 필터가 자기 계산을 너무 믿다가 실제 궤적에서 점점 밀려나는 것도 보인다. 예측을 너무 믿어도, 측정을 너무 믿어도 안 된다.
마지막 조절판 '시계 밀림'은 다음 이야기를 위해 넣어 두었다.
0.34초가 만든 687미터
1991년 2월 25일, 걸프전이 한창이던 사우디아라비아 다란. 이라크가 쏜 스커드 미사일 한 발이 날아왔다. 그곳에는 미사일을 요격하는 패트리엇 포대가 있었다.

패트리엇 레이더는 하늘을 한 번 훑어 수상한 물체를 찾으면, 그 물체가 다음에 있을 자리를 계산한다. 그리고 그 자리에 작은 창(range gate)을 열어 다시 들여다본다. 창 안에 물체가 보이면 진짜 미사일로 보고 추적을 시작한다. 방금 본 칼만 필터의 초록 네모가 이것이다.
문제는 시계였다. 패트리엇 컴퓨터는 1970년대 설계라 24비트짜리 숫자로 계산했고, 시간을 0.1초 단위로 셌다. 0.1은 우리에게는 깔끔한 숫자지만 이진법으로는 끝없이 이어지는 소수라 24비트 안에 다 담기지 않는다. 그래서 0.1초를 셀 때마다 아주 작은 오차가 떨어져 나갔다. 한 번은 아무것도 아닌 오차가 켜 둔 시간만큼 쌓였다.
그날 다란의 포대는 100시간 넘게 쉬지 않고 켜져 있었다. 쌓인 오차는 0.3433초. 음속의 다섯 배 가까이로 떨어지는 스커드에게 0.34초는 긴 시간이다. 레이더가 연 창은 실제 미사일에서 687미터나 벗어난 곳을 들여다봤고, 그 안에는 아무것도 없었다. 시스템은 처음 본 것이 헛것이었다고 판단했다. 스커드는 미군 막사에 떨어졌고, 28명이 목숨을 잃었다.

미국 회계감사원(GAO)의 1992년 보고서에 따르면, 약 20시간만 켜 두어도 창이 너무 밀려 스커드를 놓칠 수 있었다. 이 문제는 시스템을 한 번 껐다 켜기만 해도 오차가 0으로 돌아갔다. 시계를 바로잡은 소프트웨어는 사고 다음 날 다란에 도착했다.
놀이판의 '시계 밀림'을 0.34초까지 올려 보면 초록 네모가 빨갛게 바뀌며 물체 뒤쪽 허공으로 밀려난다. 예측은 계산식만큼이나 그 계산이 딛고 선 시계에 기댄다. 다음을 맞히는 기계는 지금이 언제인지부터 정확히 알아야 한다.
법칙이 있어도 멀리는 못 본다: 날씨
하늘의 다음을 맞히는 일도 계산으로 시작했다. 영국의 루이스 프라이 리처드슨은 1차 세계대전 때 구급차를 몰면서 틈틈이 날씨 계산을 했다. 대기의 움직임을 방정식으로 쓰고, 유럽 한 지점의 6시간 뒤 기압을 손으로 풀었다. 6주쯤 걸린 계산이었다. 결과는 6시간 동안 기압이 145헥토파스칼 바뀐다는 것이었는데, 가장 센 태풍에서도 나오기 어려운, 터무니없는 값이었다. 그래도 리처드슨은 1922년 이 실패를 그대로 책에 실었다. 그러고는 6만 4천 명이 거대한 둥근 강당에 둘러앉아 각자 맡은 하늘 조각을 계산하는 '예보 공장'을 상상했다. 사람이 날씨보다 빨리 계산하려면 그만큼 필요하다는 것이었다.
사람 대신 기계가 그 공장이 된 것은 1950년이다. 초기 전자식 컴퓨터 에니악(ENIAC)이 처음으로 컴퓨터 일기예보를 돌렸다. 24시간 뒤를 예보하는 데 계산이 24시간쯤 걸렸다. 겨우 날씨와 같은 속도였지만, 방향은 맞았다.

그런데 1961년, 미국 MIT의 기상학자 에드워드 로렌츠가 이상한 걸 발견한다. 날씨 모의실험을 중간부터 다시 돌리려고 출력지에 찍힌 숫자를 옮겨 넣었다. 컴퓨터 안에는 0.506127이 들어 있었지만, 종이에는 자리를 아끼느라 0.506까지만 찍혀 있었다. 1만분의 1 남짓한 차이였다. 커피를 마시고 돌아와 보니, 처음엔 겹치던 두 날씨가 점점 벌어지더니 결국 전혀 다른 날씨가 되어 있었다.

위 그림은 로렌츠가 1963년 논문에 쓴 세 줄짜리 방정식으로 같은 실험을 다시 해 본 것이다. 한동안은 파란 선과 주황 선이 한 줄처럼 붙어 가다가 어느 순간 서로 딴 길로 간다. 훗날 '나비 효과'라는 이름이 붙은 현상이다. 법칙을 완벽히 알아도, 지금을 완벽히 재지 못하면 먼 미래는 맞힐 수 없다.
그래서 요즘 예보는 모형을 한 번만 돌리지 않는다. 출발값을 조금씩 바꿔 수십 번 돌리고, 그중 몇 번이나 비가 왔는지를 센다. '강수확률 60%'라는 말이 거기서 나온다. 칼만 필터가 동그라미로 자기 불확실성을 그리듯, 예보는 확률로 자기가 모르는 만큼을 말한다. 그렇게 쌓아 올려서 날씨 예보는 지난 40년 동안 10년에 하루꼴로 더 멀리 보게 됐다. 지금의 엿새 뒤 예보가 10년 전의 닷새 뒤 예보만큼 맞는다는 식이다.
법칙이 없어도 되풀이는 있다: 장바구니
어떤 다음에는 물리 법칙이 아예 없다. 사람이 무엇을 살지가 그렇다. 대신 되풀이가 있다.
2004년, 허리케인 프랜시스가 미국 플로리다로 다가오고 있었다. 월마트는 몇 주 전 지나간 허리케인 찰리 때의 구매 기록을 뒤졌다. 폭풍 전에 사람들이 무엇을 쓸어 담는지 보려는 것이었다. 손전등이나 생수 같은 뻔한 것 말고 눈에 띈 게 있었다. 맥주, 그리고 딸기맛 팝타르트였다. 팝타르트는 폭풍을 앞두고 평소보다 일곱 배나 팔렸다. 트럭들이 팝타르트와 맥주를 싣고 고속도로를 따라 폭풍 경로에 있는 매장으로 달렸다.
이 예측은 이유를 모른다. 굽지 않아도 먹을 수 있고 오래가서인지, 아이들이 좋아해서인지 기계는 관심이 없다. 지난번에 그랬으니 이번에도 그럴 거라고 볼 뿐이다. 칼만 필터가 법칙으로 다음을 계산한다면, 이런 예측은 과거의 되풀이로 다음을 짐작한다. 그리고 LLM은 이쪽의 먼 후손이다.
글자의 다음: 푸시킨에서 챗GPT까지
1913년 1월, 러시아의 수학자 안드레이 마르코프는 과학 아카데미에서 좀 엉뚱한 발표를 했다. 푸시킨의 운문 소설 『예브게니 오네긴』 앞부분 2만 자를 하나하나 모음과 자음으로 나눠 세어 본 결과였다. 모음 다음에는 자음이 올 확률이 높고, 자음 다음에는 모음이 올 확률이 높았다. 다음 글자는 앞 글자에 기대고 있었다. 시를 이해하는 데는 아무 도움이 안 되는 계산이었지만, 여기서 '마르코프 연쇄'라는 확률 이론이 태어났다. 바로 앞의 것만 보고 다음을 점치는 방법이다.
1951년에는 정보 이론을 만든 클로드 섀넌이 사람을 상대로 맞히기 놀이를 했다. 영어 글의 앞 100글자를 보여 주고 다음 글자를 맞힐 때까지 계속 부르게 한 것이다. 사람들은 생각보다 잘 맞혔다. 섀넌은 이 실험으로 영어 글자 하나가 담은 정보가 평균 1비트 안팎이라고 셈했다. 알파벳과 띄어쓰기를 합쳐 스물일곱 가지 중 하나를 고르는 일이, 앞 문맥을 알면 동전 한 번 던지는 정도의 불확실성으로 줄어든다는 뜻이다. 글은 생각보다 많이 예측할 수 있다.
휴대폰 자판의 자동완성이 그 연장선에 있다. 오랫동안 자동완성은 바로 앞의 낱말 두세 개만 보고 다음을 골랐다. '오늘 점심은' 다음에 무엇이 많이 왔는지 세어 두었다가 가장 흔한 것을 내미는 식이다. 그래서 문장 앞쪽에 무슨 말을 했든 늘 비슷한 후보가 뜬다.

LLM은 하는 일이 같다. 다음 낱말을 맞힌다. 다른 점은 시야다. 2017년 무렵부터 쓰인 트랜스포머라는 구조 덕에, 모델이 앞에 놓인 글 전체를 한꺼번에 훑어보고 그중 지금 중요한 대목에 주의를 모을 수 있게 됐다. '밤새 비가 왔고 몸이 으슬으슬해서'를 읽은 모델은 '오늘 점심은' 다음에 국물 요리를 높게 친다. 여기에 사람이 평생 읽어도 못 읽을 만큼의 글을 먹이면, 다음 낱말을 잘 맞히려고 모델 안에 문법과 사실과 말투가 저절로 쌓인다. 챗GPT가 답을 쓰는 것도 결국 낱말 하나를 고르고, 그걸 문장 끝에 붙인 뒤 또 다음 하나를 고르는 일의 되풀이다.
틀리는 자리도 여기서 나온다. LLM이 고르는 것은 가장 그럴듯한 다음 낱말이지 참인 다음 낱말이 아니다. 대개는 둘이 같지만, 모르는 것을 물으면 모델은 모른다고 하는 대신 그럴듯한 낱말을 이어 붙인다. 없는 논문 제목, 가 본 적 없는 식당의 메뉴가 그렇게 태어난다. 패트리엇의 창이 헛것을 보고 물체가 없다고 믿었듯, 예측은 딛고 선 바닥만큼만 맞는다.
가장 높은 확률이 아니어도
돌아보면 다음을 맞히는 기계들은 모두 비슷한 일을 한다. 법칙이 있으면 법칙으로, 없으면 되풀이로 다음을 좁힌다. 칼만 필터는 동그라미로, 예보는 강수확률로, LLM은 확률 막대로 제가 모르는 만큼을 드러낸다. 좋은 예측일수록 확신이 아니라 불확실성을 정직하게 말한다.
재미있는 건 LLM도 늘 1등 낱말만 고르지는 않는다는 점이다. 매번 가장 확률 높은 낱말만 이어 붙이면 글이 뻔해지고 같은 말을 되풀이한다. 그래서 일부러 가끔은 둘째, 셋째 후보를 뽑는다. 같은 질문에 매번 조금씩 다른 답이 나오는 까닭이 이것이다. 기계조차 가장 그럴듯한 다음만 고르면 글이 죽는다는 걸 배운 셈이다.
노트의 문장으로 돌아간다. 누구도 다음에 어떤 단어가 주어질지 알지 못한다. 맞는 말이다. 그리고 어쩌면 그래서 괜찮다. 인생의 문장에서 다음 낱말은 확률이 가장 높은 것이 아니어도 된다. 가끔은 3%짜리 낱말이 문장을 살린다.
『오늘의 한 페이지』는 이렇게 이어진다. 노트를 아무 데나 펼쳐, 거기 적힌 한 줄에 그날의 생각을 얹는다. 다음 장에 무엇이 적혀 있을지는 나도 모른다.
참고
- 미국 회계감사원, 「Patriot Missile Defense: Software Problem Led to System Failure at Dhahran, Saudi Arabia」(IMTEC-92-26, 1992)
- NASA, 「Discovery of the Kalman Filter as a Practical Tool for Aerospace and Industry」(1985)
- Peter Bauer 외, 「The quiet revolution of numerical weather prediction」, Nature(2015)
- Brian Hayes, 「First Links in the Markov Chain」, American Scientist(2013)
- 사진: 아폴로 유도 컴퓨터(퍼블릭 도메인, 위키미디어 공용) · 패트리엇 발사(미군, 퍼블릭 도메인) · 에니악(미 육군, 퍼블릭 도메인)