
Nova
당신 기록을 이미 읽은 함선 AI
보이스 카테고리
흥미로운 로봇 목소리는 지직거리는 쪽이 아니에요. 거의 사람인데 딱 한 군데가 어긋난 쪽이에요. 완벽하게 고른 간격, 숨소리의 부재, 엉뚱한 자리의 쉼 같은. 그건 연기 선택이고, 연출할 수 있는 종류의 것이에요.

Nova
당신 기록을 이미 읽은 함선 AI

Halcyon
불안해질 만큼 차분한

Noor
안내방송급의 또렷함

Vex
합리적인 어조를 뒤집어쓴 무언가
공개용 데모 오디오를 만드는 동안 샘플은 임시 파일이에요. 모든 보이스는 요금제와 상관없이 다 쓸 수 있어요. 라이브러리는 유료 장벽이 아니에요.
첫째는 복고 컴퓨터예요. 강하게 가공되고, 음절마다 박자가 같고, 대놓고 기계적이죠. 인물이라기보다 향수의 신호이고, 연기가 아니라 효과로 만들어져요. 둘째는 요즘의 비서예요. 듣기 좋고 고르고 살짝 따뜻하며, 좋은 상업용 음성 합성과 구별되지 않아요. 적절하게도, 실제로 그거예요. 셋째는 안드로이드예요. 음색은 완전히 사람이고 행동이 미묘하게 사람이 아니에요.
셋 중 진짜 캐스팅 결정인 건 셋째뿐이고, 시간을 들일 가치가 있는 것도 그거예요. 드라마 장면을 짊어질 수 있는 유일한 쪽이니까요. 나머지 둘은 무대 장식이고, 무대 장식은 싸요.
픽션에서 기계의 말은 거의 전적으로 단어 선택과 구조로 신호돼요. 영어라면 축약형을 안 쓰는 게 첫 번째 수단인데, 한국어에는 축약형이 그 자리에 없어요. 대신 세 가지가 있어요. 첫째, 조사를 전부 붙이기. 구어 한국어는 “물 마실래?”처럼 조사를 빼는데, 기계는 “물을 드시겠습니까”라고 말해요. 둘째, 합쇼체로 끝까지 가기. 해요체는 사람의 온도가 있고 합쇼체는 시스템의 온도예요. 셋째, 문장을 절대 흐리지 않기. 사람은 “그건 좀…”에서 멈추지만 기계는 문장을 끝까지 맺어요.
여기에 수치의 정밀함을 더하세요. 사람이라면 “몇 분 뒤”라고 할 자리에서 “4분 10초 후”라고 말하는 것. 그리고 두 번째 도구는 응답 불일치예요. 사람 인물이 감정적인 말을 하면 기계는 정보로 답해요. 그 주고받기 한 번이 어떤 음향 처리보다 빠르게 비인간성을 확립하고, 번역과 압축과 나쁜 스피커를 다 통과해서 살아남아요.
구워 넣은 효과 하나하나가 다시 들여다볼 수 없는 결정이에요. 모니터에서 완벽했던 링 모듈레이션이 휴대폰에서는 알아들을 수 없게 되고, 조용한 장면에서 통하던 이중화된 목소리가 시끄러운 장면에서는 음악과 싸워요. 그리고 나중에 단어 하나를 고쳐야 하면, 다시 렌더링한 결과가 가공된 원본과 안 맞아요.
깨끗하게 생성해서 편집기에서 처리하는 건 몇 분이 더 들고 그 모든 결정을 열린 상태로 남겨 둬요. Pro의 스템 내보내기가 있는 이유의 상당 부분이 이거예요.
합성 음성으로 합성 음성을 연기하게 하는 데는 진심으로 웃긴 구석이 있고, 소리 내어 말할 가치가 있어요. 요즘 비서 목소리를 여기서 쉽게 만들 수 있는 이유는 그게 똑같은 기술을 손대지 않은 상태로 쓴 거라서예요. 섬뜩한 안드로이드가 더 어려워요. 믿을 만할 만큼 사람스러우면서 틀렸다고 느껴질 만큼 통제되어야 하니까요.
실제로는 복고와 비서 음역은 거의 공짜에 가깝고, 안드로이드가 당신의 연출 시간이 가야 할 자리라는 뜻이에요. 대부분의 사람이 시간을 쓰는 곳과 정반대죠.
SF 바깥에서 감정이 평평한 목소리의 가장 생산적인 용도는 코미디예요. 끝없이 상냥한 자동 시스템이 황당한 걸 설명하는 것, 작품 안 안내방송이 파국적인 소식을 출발 안내판의 어조로 전하는 것, 의견을 가진 내비게이션 음성 같은 것들이요. 전부 통하는 이유는 내용이 고조되는 동안 음역이 완전히 고정되어 있기 때문이에요.
글쓰기 규칙은 기계가 그 황당함을 절대 인정하면 안 된다는 거예요. 무슨 일이 벌어지는지에 대해 논평하는 순간 유머 감각을 가진 인물이 되고, 개그는 평범한 웃긴 목소리로 주저앉아요. 전달은 중립으로, 어휘는 절차적으로 두고, 장면의 나머지 전부가 대신 반응하게 하세요.
1960년대 컴퓨터, 요즘 스마트 비서, 섬뜩한 안드로이드는 각각 다른 소리예요. 첫째는 가공된 소리, 둘째는 평평하고 듣기 좋은 소리, 셋째는 사람인데 뭔가 빠진 소리예요.
감정 변주가 원래 적은 보이스에서 출발하세요. 따뜻한 보이스에 필터를 걸면 보통은 나쁜 스피커로 듣는 따뜻한 보이스가 될 뿐이에요.
한국어 구어는 조사를 자주 빼요. “밥 먹었어?”처럼요. 기계 인물에게는 “식사를 하셨습니까”처럼 조사를 전부 붙이고 문장을 끝까지 맺게 하세요. 어떤 후처리보다 즉각적으로 비인간처럼 들려요.
기계 목소리의 불편함은 감정이 필요한 상황에서의 감정적 평평함에서 나와요. 연출하고 싶은 충동을 참으세요.
깨끗하게 내보내고 필터나 이중화, 링 모듈레이션은 편집기에서 거세요. 깨끗한 테이크는 언제든 망가뜨릴 수 있지만, 망가진 테이크는 되돌릴 수 없어요.
렌더러에서는 안 되고, 일부러 그래요. 그 소리는 링 모듈레이션과 보코딩, 비트 감축 같은 사후 처리 효과예요. 연기는 깨끗하게 생성하고 효과는 편집기에서 거세요. 알아듣기 힘들다는 게 드러났을 때 되돌릴 수 있는 곳이 거기예요.
가공된 목소리는 대놓고 기계라서 듣는 사람이 긴장을 풀어요. 거의 사람인데 감정이 비어 있는 목소리는 불쾌한 골짜기에 앉아 있고, 불편함은 청취자가 그걸 분류하지 못하는 데서 나와요.
아주 정확하고 완결된 문장으로 쓰고, 감정은 중립으로 두고, 감정적인 순간에 절차적인 정보로 답하게 하세요. 내용과 전달 사이의 불일치가 전부를 해요.
한 번의 렌더링 안에서는 안 돼요. 대사를 깨끗하게 생성하고 뒤쪽 대사에 점점 강해지는 열화를 편집기에서 거세요. 후반 작업으로 하면 붕괴 속도도 조절할 수 있는데, 그건 보통 첫 판에 틀리는 값이에요.
아주 많아요. 안내방송, 전화 자동응답, 게임 안 시스템 보이스, 풍자적인 사내 공지가 전부 같은 음역을 쓰고, 끝없이 상냥한 자동 안내 목소리의 코미디 가치는 거의 고갈되지 않아요.
돼요. 다만 접근성이라면 가장 평평한 보이스보다 가장 또렷한 보이스가 좋고, 빠른 속도에서도 확인해 보세요. 스크린 리더 사용자 상당수가 실제 속도보다 훨씬 빠르게 들어요.
장면을 붙여 넣고, CastDub가 인물마다 보이스를 붙이게 하고, 완성된 오디오 드라마로 내보내세요.
무료로 만들어 보기카드 등록 없이. 무료 요금제는 한 번만 주어지는 크레딧이에요.