---
title: 글 한 편을 넣었더니 해설 영상이 나왔다 — 대본·목소리·자료 찾기를 AI에게 나눠 맡긴 1분 17초
url: https://oosioo.com/p/%EA%B8%80-%ED%95%9C-%ED%8E%B8%EC%9D%84-%EB%84%A3%EC%97%88%EB%8D%94%EB%8B%88-%ED%95%B4%EC%84%A4-%EC%98%81%EC%83%81%EC%9D%B4-%EB%82%98%EC%99%94%EB%8B%A4-%EB%8C%80%EB%B3%B8%EB%AA%A9%EC%86%8C%EB%A6%AC%EC%9E%90%EB%A3%8C-%EC%B0%BE%EA%B8%B0%EB%A5%BC-ai%EC%97%90%EA%B2%8C-%EB%82%98%EB%88%A0-%EB%A7%A1%EA%B8%B4-1%EB%B6%84-17%EC%B4%88
date: 2026-10-06T06:57:23+00:00
author: SYSOP
summary: 글을 넣으면 AI가 대본을 쓰고, TTS로 읽고, 자료 영상과 사진을 찾아 출처까지 붙여 해설 영상으로 묶는다. AG1 이야기로 시험한 결과와 국내외 비슷한 서비스, 그리고 유튜브가 그은 선까지.
---
# 글 한 편을 넣었더니 해설 영상이 나왔다 — 대본·목소리·자료 찾기를 AI에게 나눠 맡긴 1분 17초

유튜브를 보다 보면 사람 얼굴은 한 번도 안 나오는 해설 영상이 많다. 화면에는 자료 영상과 사진이 2~3초마다 바뀌고, 아래에는 자막이 깔리고, 차분한 목소리가 이야기를 끌고 간다. 브랜드 이야기, 경제 뉴스, 역사 이야기가 이런 모양으로 나온다.

이 형식이 궁금해졌다. 글은 이미 있다. 그 글을 넣으면 대본을 쓰고, 목소리를 입히고, 화면에 깔 자료를 찾아 출처까지 붙여서 한 편의 영상으로 묶어 주는 도구를 만들 수 있을까. 그래서 만들어 봤다.

![해설 영상 한 화면의 구성. 화면 전체를 채우는 B롤, 오른쪽 위의 출처 표기, 나레이션과 같은 문장의 하단 자막, 주황으로 강조한 숫자](/uploads/a6e29af568e2682a.webp =800)

## 한 화면을 뜯어 보면

이런 영상은 대개 네 가지로 이뤄진다.

- **화면 전체를 채우는 B롤.** 이야기와 맞는 실제 영상이나 사진이다.
- **출처 표기.** 오른쪽 위에 작게 "Source: ○○"가 붙는다.
- **자막.** 나레이션과 같은 문장이 화면 아래에 깔린다. 소리를 끄고 보는 사람이 많아서다.
- **강조.** 숫자나 핵심어에 색을 입혀 눈이 먼저 가게 만든다.

사람이 만들면 대본 쓰고, 녹음하고, 자료 찾고, 자르고, 자막 다는 일을 다 해야 한다. 그중 제일 오래 걸리는 건 자료 찾기다. 한 문장마다 맞는 그림을 찾아야 하니까.

## 다섯 단계로 나눠 맡겼다

![글에서 대본, 목소리, 자료 찾기, 검수를 거쳐 합성까지 이어지는 여섯 단계](/uploads/3151029e470828ef.webp =800)

1. **대본.** AI가 글을 읽고 자막 한 줄 길이로 끊어 해설 대본을 쓴다. 줄마다 "여기엔 이런 화면이 필요하다"는 지시도 같이 적는다. 자료 영상인지, 제품 사진인지, 근거 기사 화면인지까지 정한다.
2. **목소리.** 대본을 TTS로 읽힌다. 숫자와 영어 단어를 한국어로 어떻게 읽을지는 규칙으로 따로 정리했다. 그냥 두면 "6억"이나 "AG1"을 엉뚱하게 읽는다. 다 읽힌 뒤에는 받아쓰기 모델로 다시 들어 보고, 대본과 다르게 읽힌 조각을 찾아낸다.
3. **자료 찾기.** 줄마다 후보를 모은다. 무료 스톡 영상, 유튜브의 해당 구간, 이미지 검색, 기사 웹페이지 캡처까지 찾는다. 후보 중 문장과 가장 어울리는 걸 이미지 모델이 점수로 고르고, 워터마크가 보이는 건 뺀다. 고른 자료의 출처는 전부 기록해 둔다.
4. **검수.** AI가 고른 화면을 한 장씩 다시 보고 무관한 장면이나 광고, 잘못된 지도 표기가 있으면 갈아 끼운다.
5. **합성.** 컷을 잇고 자막과 출처를 얹은 뒤 나레이션과 배경음을 깐다.

목소리부터 만드는 게 요령이었다. 목소리가 있어야 줄마다 몇 초짜리 화면이 필요한지 알고, 그래야 실제로 쓸 컷만 찾으러 간다.

## AG1 이야기로 시험해 봤다

첫 시험 글은 짧은 브랜드 이야기였다. 녹색 영양 파우더 하나로 연 매출 6억 달러를 넘긴 AG1이 사실은 영양소가 아니라 "나는 내 몸을 챙기는 사람"이라는 기분을 팔았다는 내용이다.

결과는 1분 17초짜리 영상이었다. 대본은 29줄, 컷은 30개였다. 그중 16개가 영상, 12개가 사진, 2개가 웹페이지 캡처였다. 무료 스톡 영상이 9컷, 유튜브의 실제 광고·인터뷰 구간이 7컷이었다. 창업자 이야기에서는 인터뷰 화면이, 제품 이야기에서는 파우치 사진이, 팟캐스트 광고 이야기에서는 광고 집행 데이터 페이지가 나왔다. 영상 설명란에 붙일 출처 목록 30줄도 등장 시점과 함께 자동으로 만들어졌다.

처음치고는 그럴듯했다. 그런데 다시 보니 아쉬운 데가 보였다.

- **숫자가 묻혔다.** "6억 달러", "75가지" 같은 숫자가 다른 글자와 똑같이 흰색이었다. 이 형식에서 숫자는 가장 먼저 눈에 걸려야 하는 정보다. 그래서 숫자와 단위를 찾아 자동으로 주황색을 입히게 했다.
- **형광펜이 엉뚱한 데 칠해졌다.** 기사 캡처에서 근거 문장에 형광펜을 긋게 했는데, 정작 "75가지"가 아니라 표 구석의 "Minerals"에 칠해졌다. 화면에 보이는 글자를 맞히는 것과 그 글자가 문장의 근거인지 아는 것은 다른 일이었다.
- **출처를 적는다고 다 쓸 수 있는 건 아니었다.** 출처 표기는 잘 붙었지만, 핀터레스트나 이미지 모음 사이트에서 온 사진은 원저작자가 누구인지 흐릿했다. 출처를 밝히는 것과 써도 되는 자료인지는 따로 따져야 한다.

![파일럿에서는 "6억 달러"가 흰색 그대로였고, 지금은 숫자와 단위가 주황으로 강조된다](/uploads/2aa6ff14f2f9daca.webp =800)

이 시험 뒤로 단계가 하나씩 늘었다. 대본이 원문에 없는 수치를 지어내지 않았는지 대조하는 단계, 화면을 AI가 직접 보고 검수하는 단계, 완성본을 1초 간격으로 다시 읽어 금지된 표기가 하나라도 있으면 내보내지 않는 단계가 붙었다.

## 이미 이런 걸 하는 곳들

만들고 나서 찾아보니 이 길은 이미 붐비고 있었다.

| 서비스 | 하는 일 |
|---|---|
| [Lumen5](https://lumen5.com/) | 블로그 글 주소를 넣으면 문장과 이미지를 골라 영상 초안을 만든다. 글→영상의 원조 격 |
| [Pictory](https://pictory.ai/text-to-video-ai-generator) | 대본·기사로 스톡 클립, AI 음성, 자막을 붙인 편집본을 만든다 |
| [Fliki](https://fliki.ai/) | 80개 넘는 언어, 2천 종 넘는 AI 음성으로 글을 영상으로 바꾼다 |
| [CapCut 스크립트 투 비디오](https://www.capcut.com/resource/script-to-video-ai) | 대본부터 스톡 소스, 내레이션, 자막까지 무료로 초안을 만든다 |
| [Google Vids](https://workspaceupdates.googleblog.com/2024/11/google-vids-now-generally-available.html) | 업무용. Gemini가 장면별 대본과 AI 보이스오버를 만든다. [올해 2월부터 한국어 보이스오버도 된다](https://workspaceupdates.googleblog.com/2026/02/vids-avatars-voiceovers-new-languages.html) |
| [Synthesia](https://www.cnbc.com/2026/01/26/nvidia-alphabet-vc-arms-back-synthesia.html)·[HeyGen](https://en.wikipedia.org/wiki/HeyGen) | B롤 대신 AI 아바타가 대본을 읽는다. Synthesia는 올해 1월 기업가치 40억 달러를 인정받았다 |

국내도 빠르다. 보이저엑스의 [브루(Vrew)](https://vrew.ai/ko/feature/text-to-video/)는 '텍스트로 비디오 만들기'로 대본, 이미지, 음성을 한 번에 만들고, 자막을 고치면 영상 컷도 같이 고쳐진다. 네오사피엔스의 [타입캐스트](https://wowtale.net/2025/12/09/251629/)는 AI 성우 서비스로 누적 가입자가 260만 명을 넘었다. 일레븐랩스는 [지난해 11월 서울에서 한국 진출을 공식화](https://koreatechdesk.com/eleven-labs-uk-ai-unicorn-korea-launch-k-content)했다. 커머스 쪽에서는 [브이캣](https://wowtale.net/2023/04/04/55301/)이 상품 주소 하나로 광고 영상을 대량으로 만든다.

방송은 더 일찍 시작했다. MBN은 2020년 [AI 김주하 앵커](https://www.newdaily.co.kr/site/data/html/2020/11/09/2020110900101.html)를 내보냈다. 실제 앵커를 10시간 촬영해 학습했고, 1,000자 원고를 1분 안에 영상으로 만든다고 했다. YTN도 2023년 [AI 앵커 둘](https://www.journalist.or.kr/m/m_article.html?no=54327)을 공개했다.

자막 강조도 따로 하나의 장르가 됐다. 말하는 단어가 하나씩 켜지고 핵심어만 색이 바뀌는 이른바 ['호르모지 스타일' 자막](https://www.kapwing.com/explore/hormozi-style-captions-template)은 숏폼의 기본 문법이 됐고, 이것만 자동으로 달아 주는 도구들이 장사가 된다. 사진을 천천히 밀고 당기는 효과에는 아예 다큐 감독의 이름이 붙어 있다. 애플이 2003년 iMovie에 넣으며 [켄 번스 효과](https://www.cnbc.com/2016/10/27/heres-what-steve-jobs-had-to-give-ken-burns-to-create-the-ken-burns-effect-for-imovie.html)라고 불렀다.

## 쉬워진 만큼 흔해졌다

이렇게 쉬워지면 생기는 일이 있다. 영상 편집 서비스 Kapwing이 지난해 11월 낸 [AI 슬롭 보고서](https://www.kapwing.com/blog/ai-slop-report-the-global-rise-of-low-quality-ai-videos/)를 보면, 새 계정에 처음 뜬 쇼츠 500개 중 21%가 저품질 AI 영상이었다. 그리고 이런 채널의 조회수가 가장 많은 나라가 한국이었다. 11개 채널이 84억 회를 넘겼다.

유튜브도 선을 긋기 시작했다. 2025년 7월 '반복적 콘텐츠' 정책 이름을 [비진정성(inauthentic) 콘텐츠로 바꾸며](https://www.hankyung.com/article/2025071091627) 거의 똑같은 틀로 찍어 내는 영상을 수익화에서 뺐다. 실제처럼 보이는 합성 콘텐츠는 [올릴 때 AI로 만들었다고 밝혀야 한다](https://blog.youtube/news-and-events/disclosing-ai-generated-content/). 합성 음성 내레이션도 그 예시에 들어 있다. AI를 썼다는 사실만으로 막지는 않는다. 문제 삼는 건 사람의 해설과 구성이 빠진 양산이다.

그래서 이 도구를 영상 공장으로 쓸 생각은 없다. 글은 사람이 쓰고, AI는 그 글을 화면으로 옮기는 일을 맡는다. 출처를 밝히고, 원문에 없는 말을 지어내지 않았는지 확인하고, 마지막에는 사람이 한 번 재생해 본다.

## 딸깍의 감각

딸깍 한 번에 1분 17초짜리 영상이 나온 건 신기했다. 하지만 정작 오래 남은 건 그다음이었다. 숫자 하나에 색을 입히고, 형광펜이 엉뚱한 데 칠해진 걸 잡고, 출처가 흐린 사진을 걸러내는 일. 영상을 만드는 일보다 영상을 믿을 만하게 만드는 일에 품이 더 들었다.

영상을 만드는 일은 이제 누구나 할 수 있다. 무엇을 걸러내느냐에서 차이가 난다.

