oosioo
아이디어는 딴짓할 때 와서 금방 간다. 왼쪽에는 녹음기에서 나온 소리 물결이 시각이 붙은 받아쓰기 카드로 바뀌고, 오른쪽에는 줄 노트에 손으로 옮겨 적은 오늘의 문장이 있다
연재오늘의 한 페이지 · 10회

아이디어는 딴짓할 때 와서 금방 간다

노트에 적힌 문장은 '아이디어의 샘은 컴퓨터 앞에서 솟아나지 않는다 … 기억력을 믿지 마라. 찾아온 아이디어를 가능한 빨리 기록하라'였다. 물리학자와 작가의 아이디어 일지, 샤워와 운전과 잠들기 직전 15초를 잰 실험, 말하다 보면 생각이 생긴다는 200년 전 글을 따라가며 아이디어가 언제 오고 왜 금방 사라지는지 살핀다. 녹음기를 차고 다니던 시절을 바꿔 놓은 전사 엔진이 어떻게 소리를 글로 바꾸는지, 내 컴퓨터에 설치해 한국어 낭독을 받아 적어 본 결과와 환각, 그리고 그 위에서 생겨난 앱과 기기까지 정리한다. 오늘의 한 페이지 열 번째 글.

· SYSOP · 조회 4

아이디어는 딴짓할 때 와서 금방 간다. 왼쪽에는 녹음기에서 나온 소리 물결이 시각이 붙은 받아쓰기 카드로 바뀌고, 오른쪽에는 줄 노트에 손으로 옮겨 적은 오늘의 문장이 있다

오늘 아이디어 노트를 펼치니 이런 문장이 적혀 있었다.

어디서부터 시작해야 할까? 아이디어의 샘은 컴퓨터 앞에서 솟아나지 않는다. 운전하는 중에, 샤워를 하다가, 꿈에서, 혹은 일과 상관없는 대화에 몰두하고 있을 때 갑자기 훌륭한 아이디어가 떠오른다. 기억력을 믿지 마라. 찾아온 아이디어를 가능한 빨리 기록하라.

다른 날보다 조금 긴 문장이다. 읽자마자 고개가 끄덕여졌다. 나는 좋은 생각이 책상 앞보다 딴짓할 때 훨씬 잘 떠오르는 편이다. 특히 누군가와 이야기하다가 내 입에서 튀어나온 말이 나중에 보니 쓸 만한 아이디어였던 적이 많다. 문제는 내 단기 기억이 약한 편이라는 데 있다. 말로 내뱉은 좋은 생각일수록 붙잡아 두지 않으면 금방 흐려진다. 그래서 한동안은 녹음기를 하루 종일 몸에 차고 다녔다.

오늘은 노트 문장을 둘로 나눠 따라가 본다. 앞쪽은 정말 아이디어가 딴짓할 때 오는지, 왜 그런지다. 이걸 실제로 잰 사람들이 있다. 뒤쪽은 왜 그렇게 금방 사라지는지, 그리고 어떻게 붙잡을지다. 붙잡는 쪽에서는 내가 녹음기를 차고 다니던 시절과 지금이 가장 크게 달라졌다. 녹음을 글로 바꿔 주는 전사 엔진이 그 차이를 만들었다.

135년 전에도 책상 앞은 아니었다

노트 문장과 거의 같은 말을 한 사람이 있다. 독일의 물리학자 헤르만 폰 헬름홀츠는 1891년 일흔 번째 생일 축하연에서 자기가 어떻게 발견해 왔는지 회고했다. 좋은 착상은 노력 없이 영감처럼 갑자기 찾아왔는데, "내 경험으로는 지친 머리에도, 책상 앞에서도 온 적이 없다"고 했다. 아침에 눈뜰 때 이미 와 있는 경우가 많았고, 화창한 날 숲이 우거진 언덕을 천천히 오를 때 특히 잘 왔다. 술은 아주 조금만 마셔도 착상을 쫓아 버리는 것 같았다고 덧붙였다.

헤르만 폰 헬름홀츠. 루트비히 크나우스가 1881년에 그린 초상

*그림: Ludwig Knaus, 「Der Physiker Hermann von Helmholtz」(1881), 퍼블릭 도메인, 위키미디어 커먼즈.jpg)*

그런데 이 회고에는 앞부분이 있다. 그 전에 먼저 문제를 이리저리 뒤집어 보아 모든 굽이와 얽힘을 머릿속에서 훤히 볼 수 있을 만큼 붙들고 있어야 했다고 했다. 그 피로가 가시고 몸이 개운한 한 시간이 온 다음에야 착상이 왔다. 책상을 떠나야 오지만, 책상에서 충분히 씨름한 사람에게만 온다는 말이다.

지난 글에서 소개한 그레이엄 월러스의 '준비, 부화, 발현, 검증' 네 단계는 바로 이 대목을 뼈대로 삼았다. 실험 연구를 모은 결과도 같은 쪽을 가리킨다. 2009년 우트 시오와 토머스 오르메로드가 부화 효과 연구들을 한데 모아 분석했더니, 손을 놓는 시간의 효과는 실제로 있었다. 그리고 그 효과는 미리 문제를 오래 붙잡고 있었을수록 컸고, 쉬는 동안 머리를 많이 쓰는 일을 하면 줄었다. 딴짓이 공짜로 아이디어를 주지는 않는다. 먼저 머리에 문제를 가득 채워 둬야 딴짓이 그걸 굴려 준다.

물리학자와 작가에게 매일 적게 했더니

그럼 실제로 얼마나 많은 아이디어가 책상 밖에서 올까. 이걸 일지로 잰 연구가 있다. 2019년 미국 캘리포니아대 샌타바버라의 셸리 게이블, 엘리자베스 호퍼, 조너선 스쿨러는 전문 작가 98명과 물리학자 87명에게 매일 그날 떠오른 가장 창의적인 아이디어를 적게 했다. 그 순간 무엇을 하고 있었는지, 무슨 생각을 하고 있었는지, "아하" 하는 느낌이 있었는지도 함께 적게 했다.

그날의 가장 중요한 아이디어 가운데 약 5분의 1은 일이 아닌 다른 일을 하면서, 그 아이디어와 상관없는 생각을 하던 중에 나왔다. 그렇게 나온 아이디어는 일하면서 낸 아이디어와 창의성이나 중요도에서 차이가 없었다. 대신 "아하" 느낌을 동반한 경우가 더 많았고, 꽉 막혀 있던 문제를 뚫은 경우가 더 많았다.

이 숫자는 양쪽으로 읽어야 한다. 5분의 1은 작지 않다. 하루 최고의 아이디어 다섯 개 중 하나를 샤워실이나 산책길에서 얻는다는 뜻이니까. 거꾸로 보면 나머지 5분의 4는 일하는 중에 나왔다. "아이디어는 컴퓨터 앞에서 솟아나지 않는다"는 노트 문장은 그래서 조금 과장이다. 더 정확히 말하면 이렇다. 책상 앞에서도 아이디어는 나온다. 그리고 책상 앞에서 막힌 문제는 책상 밖에서 풀리는 일이 잦다.

이 연구에는 덤이 하나 있다. 연구 방법 자체가 떠오르자마자 적는 일지였다. 적지 않았다면 잴 수조차 없었다.

샤워실, 운전석, 그리고 잠들기 직전

노트가 꼽은 장소를 하나씩 보자.

샤워. "사람의 72%가 샤워하다 아이디어를 얻는다"는 말이 자주 돈다. 출처를 따라가면 2014년 한 독일 욕실 설비 회사가 신제품 홍보를 위해 의뢰한 소비자 설문이 나온다. 동료 심사를 거친 연구는 아니다. 실험으로 확인한 쪽은 조건이 붙는다. 2022년 버지니아대의 잭 어빙 연구진은 참가자들에게 물건의 새 쓰임새를 떠올리게 한 뒤, 중간에 3분짜리 영상을 보여 줬다. 한쪽은 두 남자가 빨래를 개는 지루한 영상, 다른 쪽은 영화 〈해리가 샐리를 만났을 때〉의 한 장면이었다. 딴생각을 많이 할수록 아이디어가 늘어난 건 영화 쪽뿐이었다. 지루하기만 한 일보다 살짝 마음이 가는 일을 할 때 떠도는 생각이 아이디어로 이어지기 쉬웠다. 연구진은 샤워나 산책, 정원 일을 그런 일의 예로 들었다. 지난 글에서 쉬운 과제 중의 딴생각이 창의성을 높인다는 2012년 실험이 큰 규모의 재현에서 실패했다고 적었는데, 이 연구는 그 결과를 조건부로 되살린 셈이다.

운전. 운전 중에 아이디어가 늘어나는지 직접 잰 연구는 찾지 못했다. 운전 중 딴생각에 대한 연구는 있다. 2016년 뉴질랜드의 한 연구에서 운전자 502명에게 물었더니 응답자 모두가 운전 중 딴생각을 한다고 답했다. 익숙한 길일수록, 피곤할수록 더 했다. 그런데 주행 시뮬레이터 실험을 보면 딴생각에 빠진 운전자는 돌발 상황에 늦게 반응하고 앞차와의 거리가 짧아졌다. 운전석에서 떠오른 생각은 손으로 적으면 안 된다. 말로 남기거나 차를 세운 뒤에 적어야 한다.

잠들기 직전. 여기에는 꽤 단단한 실험이 있다. 2021년 프랑스 파리 뇌연구소의 셀린 라코 연구진은 103명에게 숨은 규칙이 있는 숫자 문제를 풀게 했다. 규칙을 찾으면 단번에 답이 나오지만 참가자들은 그 사실을 모른다. 중간에 20분 동안 의자에 기대 쉬게 했는데, 손에 물병을 가볍게 쥐고 있게 했다. 잠이 들면 손이 풀려 물병이 떨어진다. 잠들락 말락 하는 첫 단계(N1)에 15초 이상 머문 사람은 83%가 숨은 규칙을 찾았다. 깨어 있던 사람은 30%였다. 더 깊이 잠들어 버린 사람에게서는 효과가 사라졌다.

물병을 쥔 이유가 있다. 에디슨이 쇠구슬을 쥐고 졸다가 구슬이 떨어지는 소리에 깨서 떠오른 생각을 적었다는 이야기가 널리 퍼져 있다. 그런데 이 이야기는 기록으로 확인되지 않는다. 확실한 건 화가 살바도르 달리가 1948년 책에 같은 방법을 적어 둔 것이다. 엄지와 검지로 무거운 열쇠를 쥐고, 아래에 접시를 엎어 둔 채 의자에서 졸면 열쇠가 접시에 떨어지는 소리에 깬다.

숨은 규칙 찾기 실험의 결과. 잠들락 말락 하는 단계에 15초 이상 머문 사람 83%, 깨어 있던 사람 30%, 더 깊이 잠든 사람은 효과가 없었다

꿈. MIT 미디어랩의 아담 하 호로위츠 연구진은 잠이 드는 순간을 감지하는 장갑형 장치 '도르미오'를 만들었다. 손의 근육 긴장과 심장 박동 같은 신호로 잠드는 순간을 알아채고, 그때 "나무를 생각하세요" 같은 말을 들려줘 꿈의 주제를 심는다. 2023년 49명을 대상으로 한 실험에서 이렇게 낮잠을 잔 사람들이 깨어난 뒤 나무에 관한 이야기를 더 창의적으로 썼다. 조건마다 열두 명 남짓인 작은 실험이라 아직은 가능성을 보여 준 정도다. 밤잠에 대해서는 2004년 독일 뤼베크대의 울리히 바그너 연구진이 『네이처』에 낸 실험이 있다. 숨은 규칙이 있는 문제를 연습시킨 뒤 하룻밤 재운 무리에서는, 깨어 있던 무리보다 두 배 넘는 사람이 규칙을 찾았다. 전날 문제와 충분히 씨름한 경우에만 그랬다.

꿈에서 벤젠 고리를 봤다는 케쿨레 이야기도 빠지지 않는다. 케쿨레는 발견 25년 뒤인 1890년 기념 연설에서 난로 앞에서 졸다가 원자들이 뱀처럼 꼬리를 무는 모습을 봤다고 말했다. 이 이야기가 사실인지는 지금도 화학사가들 사이에서 의견이 갈린다.

말하다 보면 생각이 생긴다

노트의 마지막 장소는 '일과 상관없는 대화'다. 나에게 가장 와닿는 대목이다.

200년쯤 전 독일 작가 하인리히 폰 클라이스트가 이 경험에 대해 짧은 글을 썼다. 제목은 「말하면서 생각이 점차 완성되는 것에 관하여」다. 프랑스 속담 "먹다 보면 식욕이 생긴다"를 비틀어 "말하다 보면 생각이 생긴다"고 했다. 머릿속에 막연한 생각밖에 없어도 일단 말을 시작하면, 시작한 문장을 끝내야 한다는 압박이 생각을 끝까지 밀어 준다고 그는 썼다. 그는 풀리지 않던 문제를 수학을 전혀 모르는 누이에게 이야기하다가 풀었던 일을 예로 든다. 듣는 사람이 내용을 몰라도 상관없었다. 프로그래머들이 책상 위 고무 오리에게 코드를 한 줄씩 설명하다 버그를 찾는다는 '러버덕 디버깅'과 같은 이야기다.

이 효과는 실험으로도 확인됐다. 학습 연구에서는 배운 내용을 스스로 설명해 보게 하면 이해가 깊어진다는 결과가 1990년대부터 거듭 나왔다. 여러 연구를 모아 보면 효과는 크지 않지만, 글로 설명할 때보다 말로 설명할 때 더 컸다. 분자생물학 연구실의 정기 회의를 녹음해 분석한 케빈 던바의 연구에서는, 새 개념과 유추가 한 사람의 머리보다 동료들이 주고받는 대화 속에서 만들어지고 고쳐졌다.

그런데 대화에는 함정이 있다. 1987년 독일의 미하엘 딜과 볼프강 슈트뢰베는 집단 브레인스토밍이 같은 수의 사람이 따로 생각할 때보다 아이디어를 적게 낸다는 것을 보였다. 가장 큰 원인은 '발언 차단'이었다. 남이 말하는 동안 내 차례를 기다리다가 떠오른 생각을 잊거나 접어 버린다. 대화는 아이디어를 낳지만, 대화의 흐름이 그 아이디어를 덮어쓴다.

왜 그렇게 금방 사라지나

1959년 미국 인디애나대의 로이드 피터슨과 마거릿 피터슨은 간단한 실험을 했다. 자음 세 개를 보여 준 뒤 숫자를 3씩 거꾸로 세게 해서 속으로 되뇌지 못하게 했다. 3초 뒤에는 80% 정도를 기억했는데, 18초 뒤에는 10% 남짓만 남았다. 나중에 다른 연구자들이 이 망각의 상당 부분이 시간 자체보다 앞서 본 글자들이 끼어들어 생긴다는 것을 보였다. 기억은 시간이 흘러서보다 다른 것이 덮어써서 사라진다.

샤워를 마치고 수건으로 머리를 말리고, 휴대폰을 들어 메시지를 확인하는 사이에 아까 그 생각이 사라지는 이유가 이것이다. 대화 중의 아이디어가 다음 사람의 말에 묻히는 것도 같은 원리다. 꿈도 그렇다. 꿈을 잘 기억하는 사람들은 밤중에 잠깐씩 더 오래 깨어 있었다는 연구가 있다. 깨어 있는 그 몇 분 동안 꿈이 기억에 새겨진다는 해석이다. 폴 매카트니가 꿈에서 들은 멜로디로 깨어나자마자 피아노 앞으로 간 것도, 잊기 전에 붙잡으려는 행동이었다.

헬름홀츠의 말대로 아이디어가 '노력 없이 영감처럼' 온다면, 그만큼 머리에 깊이 새겨지지도 않는다. 애써 외운 것이 아니니까. 노트 문장의 "기억력을 믿지 마라"는 겸손한 척하는 말로 들리지만, 실험 결과와 그대로 맞는다.

기록한 사람들

그래서 기록하는 사람들이 있었다. 에디슨의 연구소가 남긴 실험 노트는 3,000권이 넘는다. 레오나르도 다빈치의 노트는 지금 남은 것만 7,000장 정도다. 다윈은 1837년 공책에 생명의 나무를 처음 그리면서 그 위에 "I think"라고 적었다. 베토벤은 작업용 스케치북과 별도로 산책할 때 들고 다니는 주머니 스케치북을 썼다. 지금 남은 것만 서른 권이 넘는다.

1837년 다윈의 공책. 처음 그린 생명의 나무 위에 'I think'라고 적었다

*그림: Charles Darwin, 변이 노트 B 36쪽(1837), 퍼블릭 도메인, 위키미디어 커먼즈*

음성으로 기록한 유명한 사례도 있다. 롤링 스톤스의 키스 리처즈는 1965년 어느 밤 잠결에 떠오른 기타 리프를 머리맡 카세트 녹음기에 녹음했다. 아침에 테이프를 돌려 보니 2분쯤 기타 소리가 나오고, 그 뒤로 40분 남짓 코 고는 소리가 이어졌다고 자서전에 적었다. 그 2분이 〈(I Can't Get No) Satisfaction〉의 리프가 됐다.

반례도 있다. 수학자 앙리 푸앵카레는 1908년 강연에서, 지질 답사 중 승합마차 발판에 발을 올리는 순간 오래 붙들고 있던 함수 문제의 답이 떠올랐다고 말했다. 그는 그 자리에서 확인하지 않았다. 자리에 앉자마자 하던 대화를 이어갔기 때문이다. 그런데도 완전한 확신이 있었고, 집에 돌아와 차분히 검증했다. 수년을 붙들고 있던 문제의 답이 확신의 형태로 오면 잊히지 않는 모양이다. 다만 우리 대부분은 푸앵카레가 아니고, 우리에게 오는 아이디어 대부분은 그렇게 굵직하지 않다.

가장 싸게 남기는 법

기록에는 한 가지 법칙이 있다. 번거로우면 안 한다. 2024년 영국 UCL의 길버트 연구진은 사람들이 나중에 할 일을 위해 알림을 맞춰 둘지 정하는 실험을 했다. 알림을 맞추는 데 손이 많이 갈수록 사람들은 알림을 덜 맞췄다. 그러니 노트 문장의 "가능한 빨리"는 "가장 손쉽게"와 같은 말이다.

말로 남기는 게 가장 손쉽다. 2016년 스탠퍼드대 연구진이 휴대폰에서 짧은 메시지를 입력하는 속도를 비교했더니, 영어는 말로 입력하는 쪽이 자판으로 치는 쪽보다 세 배 빨랐다. 오타도 적었다. 손이 젖어 있어도, 운전대를 쥐고 있어도, 대화 중이어도 말은 할 수 있다.

말로 남기는 것에는 덤도 있다. 같은 단어라도 소리 내어 읽은 단어가 속으로 읽은 단어보다 잘 기억된다. 심리학에서는 이걸 '산출 효과'라고 부른다. 2018년 캐나다 워털루대 연구진은 한 걸음 더 나가서, 녹음된 자기 목소리를 다시 들으면 남의 목소리로 들을 때보다 잘 기억한다는 것도 보였다. 아이디어를 음성 메모로 말해 두면 두 번 저장되는 셈이다. 한 번은 녹음기에, 한 번은 머리에.

적어 두는 일에는 또 다른 효과가 있다. 하나를 저장하고 나면 다음 것을 더 잘 기억한다는 실험이 있다. 잊어도 된다는 안심이 머리에 다음 생각이 들어올 자리를 비워 준다.

내가 녹음기를 하루 종일 차고 다닌 건 그래서였다. 문제는 그다음이었다.

녹음기를 차고 다니던 시절

녹음기는 아이디어를 하나도 놓치지 않았다. 대신 아이디어를 꺼내 쓰는 데 녹음한 시간만큼이 들었다. 하루를 녹음하면 하루치를 다시 들어야 한다. 대부분은 걷는 소리, 키보드 소리, 아무 말도 없는 시간이다. 그 사이에 섞인 쓸 만한 말을 찾으려면 녹음을 일일이 듣고 확인해서 옮겨 적어야 했다. 녹음기는 기억을 대신해 줬지만, 꺼내 쓰는 일까지 대신해 주지는 않았다.

요즘은 다르다. 녹음 파일을 전사 엔진에 넣으면 몇 분 만에 시각이 붙은 글로 바뀐다. 글이 되면 검색이 되고, 훑어볼 수 있고, AI에게 "이 중에 아이디어처럼 들리는 것만 골라 줘"라고 맡길 수 있다. 녹음 자체는 그대로다. 달라진 건 그다음 단계다.

이 노트북에서 직접 돌려 봤다

말로만 하면 감이 덜 와서 이 글을 쓰는 노트북에서 직접 돌려 봤다. 인텔 i7-10700에 그래픽카드 RTX 3070(메모리 8GB)이 달린, 몇 년 된 데스크톱급 노트북이다. 남의 대화가 담긴 녹음은 쓸 수 없어서, 저작권이 끝난 현진건의 단편 「피아노」를 자원봉사자가 읽어 공개한 6분 43초짜리 낭독 파일(LibriVox)을 썼다. 위키문헌의 원문과 글자 단위로 대조해 틀린 비율(문자 오류율)을 쟀다.

설정걸린 시간실시간 대비문자 오류율
large-v3-turbo · 그래픽카드 · 무음 제거30.5초13.2배 빠름7.0%
large-v3-turbo · CPU만3분 44초1.8배 빠름6.8%
large-v3 · 그래픽카드(8비트 압축)2분 24초2.8배 빠름16.1%
small · CPU만2분 21초2.8배 빠름약 15%

가장 좋은 설정은 6분 43초를 30초에 받아 적었다. 한 시간짜리 녹음이면 5분이 안 걸리는 속도다. 그래픽카드 없이 CPU로만 돌려도 녹음 시간의 절반쯤이면 끝난다. 결과는 이렇게 나온다.

[  26.26->  32.56]  궐은 가정의 단란에 흠신 심신을 잠기게 되었다.
[  33.64->  36.62]  보기만 해도 지긋지긋한 형식상의 아내가
[  36.62->  41.10]  궐이 일본 어느 대학을 졸업하자마자 불의에 죽고 말았다.

원문은 "흠씬"인데 "흠신"이 됐다. 1920년대 소설의 낯선 어휘치고는 잘 들었다. 작은 모델(small)은 같은 대목을 "걸은 가정의 단단해 심신 심신을"로 받아 적었고, 작가 이름도 "현진권"이 됐다. 모델 크기의 차이가 이런 데서 난다.

이상한 일도 두 번 생겼다. 큰 모델(large-v3)은 379초 근처에서 이렇게 멈췄다.

[ 379.38-> 379.92]  그럼 남편은...
[ 379.92-> 379.98]  남편은...
[ 379.98-> 380.08]  남편은...
   (같은 줄이 열다섯 번 넘게 이어진다)
[ 381.18-> 382.30]  웃음을 웃고는

낭독자는 "남편은"을 한 번 읽었다. 그리고 turbo 모델은 녹음이 402.7초에서 끝나는데 마지막 줄을 [401.94->431.92] 자세히로 적었다. 있지도 않은 30초 동안 아무도 하지 않은 말을 들은 것이다. 이걸 '환각'이라고 부른다. 왜 이런 일이 생기는지는 엔진의 구조를 보면 알 수 있다.

전사 엔진은 어떻게 듣나

지금 쓰이는 공개 전사 엔진 대부분은 OpenAI가 2022년 9월에 공개한 Whisper에서 출발했거나 그와 비교된다. 논문 제목은 「대규모 약한 지도 학습을 통한 강건한 음성 인식」이다. 인터넷에서 모은 오디오와 그에 딸린 자막 68만 시간으로 학습했다. 사람이 하나하나 다듬은 정답이 아니라 인터넷에 이미 있던 자막을 그대로 썼다는 뜻에서 '약한 지도'다. 그 가운데 한국어 받아쓰기 자료는 7,993시간이었다.

Whisper가 소리를 글로 바꾸는 과정. 소리를 30초씩 잘라 시간과 주파수의 그림(log-Mel 스펙트로그램)으로 바꾸면, 인코더가 그 그림을 읽고 디코더가 언어 표시, 작업 표시, 시각 표시와 함께 글자 조각을 하나씩 이어 쓴다

과정은 이렇다.

  1. 소리를 그림으로 바꾼다. 녹음을 1초에 1만 6천 번 찍은 값으로 고른 뒤 30초씩 자른다. 30초 조각마다 시간에 따라 어느 높이의 소리가 얼마나 센지를 그린 그림(log-Mel 스펙트로그램)을 만든다. 사람 귀가 낮은 소리의 차이에 더 민감한 것을 흉내 내서, 낮은 음역은 촘촘하게 높은 음역은 성기게 나눈다.
  2. 인코더가 그림을 읽는다. 챗GPT와 같은 계열의 트랜스포머 신경망이 이 그림을 숫자 덩어리로 요약한다.
  3. 디코더가 글을 이어 쓴다. 또 하나의 트랜스포머가 그 요약을 보면서 글자 조각(토큰)을 하나씩 써 나간다. 맨 앞에는 "받아쓰기 시작, 한국어, 받아쓰기(번역 아님)" 같은 특수 표시가 붙고, 문장 사이사이에는 0.02초 단위의 시각 표시가 끼어든다. 앞에서 본 [26.26->32.56]이 그 시각 표시에서 나온다. 무슨 언어인지 모를 때는 첫 칸에 어떤 언어 표시가 올 확률이 가장 높은지로 알아맞힌다.
  4. 여러 후보 중에서 고른다. 한 글자씩 가장 그럴듯한 것만 고르지 않고, 다섯 갈래 정도의 후보 문장을 함께 이어 가다가 전체적으로 가장 그럴듯한 것을 고른다(빔 서치). 같은 말이 되풀이되는 낌새가 보이면 조금 더 무작위로 다시 써 본다.

환각은 3번에서 생긴다. 디코더는 결국 다음 글자를 맞히는 언어 모델이다. 소리가 없거나 잡음뿐인 구간에서도 '다음에 올 법한 말'을 써 버린다. 앞에서 쓴 말에 이끌려 같은 말을 되풀이하기도 한다. 2024년 코넬대 연구진은 2023년 무렵 Whisper 서비스로 받아 적은 녹음의 약 1%에 실제로 하지 않은 말이 들어 있었다고 보고했다. 말 사이에 쉬는 시간이 긴 사람의 녹음에서 더 잦았다. OpenAI도 모델 설명서에서 이 문제를 직접 경고한다.

대책은 단순하다. 받아 적기 전에 사람 목소리가 없는 구간을 먼저 잘라 낸다. 이 일을 하는 작은 모델을 VAD(음성 구간 검출)라고 하는데, 공개된 Silero VAD는 CPU 하나로 30밀리초짜리 소리 조각을 1밀리초도 안 걸려 판정한다. 하루 종일 녹음한 파일은 대부분이 침묵이라 VAD를 거치면 시간도 줄고 환각도 준다. 그래도 위의 실험처럼 끝자락 같은 데서는 가끔 새어 나온다. 그래서 전사 결과는 원본 녹음과 시각으로 이어 둬야 한다. 미심쩍은 줄은 그 시각으로 가서 직접 들어 보면 된다.

어떤 엔진이 있나

Whisper는 크기별로 여러 모델이 있다. 2024년 10월에는 큰 모델의 디코더를 32층에서 4층으로 줄인 large-v3-turbo가 나왔다. 정확도는 큰 모델에 가까우면서 훨씬 빠르다. 위 실험에서도 turbo가 가장 나았다. 원조 Whisper 저장소의 표를 옮기면 이렇다(영어, 고성능 GPU 기준 상대 속도).

모델크기(매개변수)필요한 그래픽 메모리상대 속도
tiny3,900만약 1GB약 10배
small2억 4,400만약 2GB약 4배
medium7억 6,900만약 5GB약 2배
large15억 5,000만약 10GB1배
turbo8억 900만약 6GB약 8배

Whisper 말고도 공개된 모델이 많다. 한국어를 쓰려면 지원 여부부터 봐야 한다. 2025년에 화제가 된 공개 모델 상당수가 한국어를 지원하지 않는다. 엔비디아의 Parakeet과 Canary, 프랑스 Kyutai의 실시간 모델, IBM Granite Speech, 마이크로소프트 Phi-4 멀티모달, 미스트랄의 첫 Voxtral이 그렇다. 2026년 10월 초 기준으로 한국어를 지원하는 공개 모델은 이 정도다.

모델만든 곳공개특징
Whisper large-v3 / turboOpenAI2023·2024가장 널리 쓰이는 기준. 파생 도구가 가장 많다
Qwen3-ASR알리바바2026년 1월30개 언어. 영어 공개 순위표에서 공개 모델 1위
SenseVoice / Fun-ASR알리바바2024~2025감정이나 웃음, 박수 같은 소리 표시도 함께 낸다
Voxtral Realtime미스트랄2026년 2월13개 언어 실시간 받아쓰기
Moonshine tiny-koMoonshine AI2025년 9월2,700만 매개변수의 한국어 전용 초소형 모델
Omnilingual ASR메타2025년 11월1,600개 넘는 언어

허깅페이스의 공개 전사 순위표(Open ASR Leaderboard)가 자주 인용되지만 영어 기준이다. 다국어 부문에도 한국어는 없다. 한국어 성능은 각 모델 설명서의 숫자나 직접 돌려 본 결과로 판단해야 한다. 한국 기업 쪽은 네이버 클로바 스피치, 리턴제로 같은 곳이 좋은 한국어 엔진을 갖고 있지만 서비스와 API로만 제공하고 모델 자체는 공개하지 않는다.

설치해서 써 보기

내 컴퓨터에서 돌리는 방법은 크게 넷이다. 어느 것이든 녹음 파일을 읽으려면 ffmpeg라는 변환 도구가 먼저 깔려 있어야 한다(맥은 brew install ffmpeg, 우분투는 sudo apt install ffmpeg).

가장 간단한 길, 원조 Whisper. 파이썬이 있으면 한 줄로 설치하고 한 줄로 돌린다. 처음 실행할 때 모델 파일을 내려받는다.

pip install -U openai-whisper
whisper memo.m4a --model turbo --language Korean

빠른 길, faster-whisper. 같은 Whisper 모델을 CTranslate2라는 추론 엔진으로 다시 짠 것이다. 정확도는 같고 최대 네 배 빠르며 메모리를 덜 쓴다. 위 실험에 쓴 것이 이것이다.

from faster_whisper import WhisperModel

model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")
# 그래픽카드가 없으면 device="cpu", compute_type="int8"
segments, info = model.transcribe("memo.wav", language="ko", vad_filter=True)
for s in segments:
    print(f"[{s.start:.2f}->{s.end:.2f}] {s.text}")

vad_filter=True가 앞에서 말한 무음 자르기다. 엔비디아 그래픽카드를 쓰려면 CUDA 12용 라이브러리(cuBLAS, cuDNN 9)가 필요하다. 하나 주의할 점이 있다. 2026년 10월 현재 그냥 설치하면 함께 깔리는 오디오 라이브러리(PyAV 19) 때문에 파일을 여는 순간 오류가 난다. 나는 ffmpeg로 먼저 16kHz 모노 wav로 바꾼 뒤 소리 데이터를 직접 넘기는 식으로 피했다.

맥이라면, whisper.cpp나 mlx-whisper. whisper.cpp는 Whisper를 C/C++로 다시 짠 것이다. 애플 실리콘의 그래픽 기능(Metal)을 그대로 쓰고, 무음 자르기도 들어 있다.

git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
sh ./models/download-ggml-model.sh large-v3-turbo
cmake -B build && cmake --build build -j --config Release
./build/bin/whisper-cli -m models/ggml-large-v3-turbo.bin -l ko -f memo.wav

애플이 만든 기계학습 도구 MLX 위에서 도는 mlx-whisper는 pip install mlx-whisper 한 줄이면 된다. 이 둘은 이번에 맥에서 직접 재 보지 못해서 속도 숫자는 적지 않는다.

단어마다 시각이 필요하면, WhisperX. faster-whisper 위에 단어 단위 시각 맞추기와 화자 나누기(누가 언제 말했나)를 얹었다. 화자 나누기는 pyannote라는 별도 모델을 쓰는데, 저장소 스스로 "완벽과는 거리가 멀다"고 적어 두었다.

내 컴퓨터에서 돌리기 싫으면 API에 맡겨도 된다. OpenAI의 받아쓰기 API는 2026년 10월 정가로 1분에 0.003~0.006달러다. 한 시간에 많아야 0.36달러 정도다. 녹음이 남의 서버로 간다는 점만 감수하면 된다.

하루치 녹음을 아이디어 목록으로

하루 종일 녹음하던 시절의 일을 지금 다시 짠다면 이렇게 하겠다.

  1. 저녁에 녹음 파일을 컴퓨터로 옮긴다.
  2. ffmpeg로 16kHz 모노 wav로 바꾼다. ffmpeg -i day.m4a -ar 16000 -ac 1 day.wav
  3. VAD를 켜고 faster-whisper(맥이면 whisper.cpp)로 받아 적는다. 위 실험 속도라면 하루 여덟 시간 녹음이 40분 안쪽이고, 침묵을 잘라 내니 실제로는 훨씬 짧다.
  4. 시각이 붙은 글을 AI에게 넘겨 "아이디어, 할 일, 나중에 찾아볼 것"을 골라 날짜별 노트로 만든다. 각 항목에 시각을 달아 두면 의심스러운 줄은 원본에서 바로 찾아 들을 수 있다.

예전에 여덟 시간 걸리던 일이 저녁 먹는 사이에 끝난다. 녹음기를 차고 다니던 내가 정말 원했던 건 이거였다.

받아쓰기에서 갈라져 나온 것들

전사 엔진이 싸고 좋아지면서 그 위에 여러 갈래의 앱과 기기가 생겼다.

  • 휴대폰에 이미 들어 있다. 갤럭시 S24 이후의 녹음 앱은 한국어를 포함한 여러 언어를 받아 적고 화자를 나눠 요약까지 한다. 구글 픽셀의 녹음 앱도 한국어를 지원하는데, 기기 안에서 바로가 아니라 클라우드로 다시 받아 적는 방식이다.
  • 회의록 앱. 네이버 클로바노트는 2020년 베타로 시작한 한국어 회의록 앱이다. 미국의 Otter.ai는 영어권에서 많이 쓰지만 한국어를 지원하지 않는다. 화상회의에 따로 녹음 봇을 들이지 않고 내 컴퓨터 소리를 받아 적는 Granola 같은 앱도 있다.
  • 내 컴퓨터에서만 도는 앱. 맥의 MacWhisper와 Aiko, 맥·윈도·리눅스에서 도는 오픈소스 Buzz는 Whisper를 앱 안에서 돌린다. 녹음이 밖으로 나가지 않는다.
  • 자판 대신 말로 치기. Superwhisper, Wispr Flow 같은 앱은 아무 입력창에서나 말하면 받아 적고 말투까지 다듬어 넣어 준다. 앞에서 본 '말이 자판보다 세 배 빠르다'를 그대로 상품으로 만든 것이다.
  • 목에 거는 녹음기. 내가 하던 일을 그대로 기기로 만든 쪽이다. Plaud의 NotePin은 목걸이나 핀으로 차는 녹음기이고, 전사와 요약은 앱이 한다. 하루 종일 듣는 AI 펜던트를 내세운 회사들도 있었다. Limitless는 2025년 12월 메타에 인수된 뒤 기기 판매를 멈췄고 한국을 포함한 일부 나라에서 서비스를 접었다. 손목밴드형인 Bee는 2025년 7월 아마존이 인수하기로 했다. 대화 상대가 되어 준다는 Friend 펜던트는 뉴욕 지하철 광고가 낙서로 뒤덮이며 '항상 듣는 기계'에 대한 반감의 상징이 됐다.

마지막 갈래가 남긴 질문이 있다. 하루 종일 듣는 기계는 내 말만 듣지 않는다. 한국의 통신비밀보호법은 공개되지 않은 타인 간의 대화를 녹음하지 못하게 하고, 어기면 1년 이상 10년 이하의 징역과 자격정지를 함께 받는다. 내가 끼어 있는 대화를 내가 녹음하는 것은 이 법의 '타인 간의 대화'가 아니라는 것이 대법원 판례다. 문제는 하루 종일 켜 둔 녹음기다. 내가 자리를 뜬 뒤 남들끼리 나누는 대화까지 담기면 그건 타인 간의 대화가 된다. 하루 종일 녹음할 생각이라면 자리를 뜰 때 녹음을 멈추는 습관이 필요하고, 아이디어를 옮겨 적은 뒤에는 남의 목소리가 담긴 원본을 오래 쥐고 있지 않는 편이 낫다.

기억력을 믿지 말고, 녹음기를 믿지도 말고

노트 문장으로 돌아가 보자. 아이디어는 딴짓할 때 온다. 정확히는 책상 앞에서 충분히 씨름한 다음, 샤워실과 산책길과 잠들기 직전과 대화 속에서 온다. 그리고 다음 생각이 들어오는 순간 사라진다. 그러니 기억력을 믿지 말고 가능한 빨리, 가능한 손쉽게 남겨야 한다.

말로 남기는 것이 가장 손쉽다는 건 예전에도 알았다. 키스 리처즈의 카세트테이프가 그 증거다. 달라진 건 말로 남긴 것을 다시 꺼내는 비용이다. 예전에는 녹음한 시간만큼 다시 들어야 했다. 지금은 몇 분이면 글이 되고, 글은 검색되고, AI가 추려 준다. 다만 그 글에는 가끔 아무도 하지 않은 말이 섞여 있다. 그래서 원본 녹음을 시각과 함께 남겨 두고, 중요한 줄은 직접 들어 확인한다. 기억력을 믿지 말라는 말은 이제 받아쓰기 기계에도 똑같이 해당한다.

『오늘의 한 페이지』는 그렇게 노트 속 한 줄에서 출발해 오늘의 생각 한 장에 가닿는다.

출처

아이디어가 오는 곳

  • Helmholtz, H. v. (1891). 70세 생일 연설 「Erinnerungen」, Vorträge und Reden (1903) 수록. archive.org
  • Sio, U. N., & Ormerod, T. C. (2009). Does incubation enhance problem solving? A meta-analytic review. Psychological Bulletin, 135(1), 94–120. doi:10.1037/a0014212
  • Gable, S. L., Hopper, E. A., & Schooler, J. W. (2019). When the muses strike: Creative ideas of physicists and writers routinely occur during mind wandering. Psychological Science, 30(3), 396–404. doi:10.1177/0956797618820626
  • Irving, Z. C. 외 (2024, 온라인 2022). The shower effect: Mind wandering facilitates creative incubation during moderately engaging activities. Psychology of Aesthetics, Creativity, and the Arts, 18(6), 1096–1107. doi:10.1037/aca0000516
  • Burdett, B. R. D., Charlton, S. G., & Starkey, N. J. (2016). Not all minds wander equally. Accident Analysis & Prevention, 95, 1–7. doi:10.1016/j.aap.2016.06.012
  • Yanko, M. R., & Spalek, T. M. (2014). Driving with the wandering mind. Human Factors, 56(2), 260–269. doi:10.1177/0018720813495280
  • Lacaux, C. 외 (2021). Sleep onset is a creative sweet spot. Science Advances, 7(50), eabj5866. doi:10.1126/sciadv.abj5866
  • Haar Horowitz, A. 외 (2023). Targeted dream incubation at sleep onset increases post-sleep creative performance. Scientific Reports, 13, 7319. doi:10.1038/s41598-023-31361-w
  • Wagner, U., Gais, S., Haider, H., Verleger, R., & Born, J. (2004). Sleep inspires insight. Nature, 427, 352–355. doi:10.1038/nature02223
  • Dalí, S. (1948). 50 Secrets of Magic Craftsmanship. (열쇠를 쥔 잠)
  • 케쿨레의 꿈 논쟁: Rocke, A. J. (2010). Image and Reality: Kekulé, Kopp, and the Scientific Imagination. University of Chicago Press.

말하며 생각하기

  • Kleist, H. v. 「Über die allmähliche Verfertigung der Gedanken beim Reden」(1805년경 집필). Projekt Gutenberg
  • Chi, M. T. H. 외 (1994). Eliciting self-explanations improves understanding. Cognitive Science, 18(3), 439–477.
  • Lachner, A., Jacob, L., & Hoogerheide, V. (2021). Learning by writing explanations: Is explaining to a fictitious student more effective than self-explaining? Learning and Instruction, 74, 101438. doi:10.1016/j.learninstruc.2020.101438
  • Dunbar, K. (1997). How scientists think: On-line creativity and conceptual change in science. In Creative Thought. APA.
  • Diehl, M., & Stroebe, W. (1987). Productivity loss in brainstorming groups. Journal of Personality and Social Psychology, 53(3), 497–509. doi:10.1037/0022-3514.53.3.497

잊는 것과 남기는 것

  • Peterson, L. R., & Peterson, M. J. (1959). Short-term retention of individual verbal items. Journal of Experimental Psychology, 58(3), 193–198. doi:10.1037/h0049234
  • Keppel, G., & Underwood, B. J. (1962). Proactive inhibition in short-term retention of single items. Journal of Verbal Learning and Verbal Behavior, 1, 153–161.
  • Vallat, R. 외 (2017). Increased evoked potentials to arousing auditory stimuli during sleep: Implication for the understanding of dream recall. Frontiers in Human Neuroscience, 11, 132. doi:10.3389/fnhum.2017.00132
  • Chiu, G., & Gilbert, S. J. (2024). Influence of the physical effort of reminder-setting on strategic offloading of delayed intentions. Quarterly Journal of Experimental Psychology, 77(6), 1295–1311. doi:10.1177/17470218231199977
  • Ruan, S. 외 (2018). Comparing speech and keyboard text entry for short messages in two languages on touchscreen phones. Proc. ACM IMWUT, 1(4). doi:10.1145/3161187
  • MacLeod, C. M. 외 (2010). The production effect: Delineation of a phenomenon. JEP: Learning, Memory, and Cognition, 36(3), 671–685. doi:10.1037/a0018785
  • Forrin, N. D., & MacLeod, C. M. (2018). This time it's personal: The memory benefit of hearing oneself. Memory, 26(4), 574–579. doi:10.1080/09658211.2017.1383434
  • Storm, B. C., & Stone, S. M. (2015). Saving-enhanced memory. Psychological Science, 26(2), 182–188. doi:10.1177/0956797614559285
  • 에디슨 노트: Thomas A. Edison Papers, Rutgers · 레오나르도 노트: University of Rochester · 다윈 노트: Darwin Online
  • Richards, K. (2010). Life. Little, Brown. · Poincaré, H. (1908). 「L'invention mathématique」. Wikisource

전사 엔진

이 연재를 처음부터 보시려면 오늘의 한 페이지 로 가시오.

한마디 0

아직 한마디도 없소. 먼저 보태시오.

한마디 보태려면 들어오시오.