AI 70+ 연구원
미래를 준비하자! 설 땅이 없다
어느 모델이 내 목소리를 더 자연스럽게 만들어 줄까?
Voicebox에는 Qwen3-TTS 0.6B와 1.7B 모델이 있다.
이름만 보고 판단하지 않고,
실제로 같은 문장을 여러 번 생성해 직접 들어보기로 했다.
같은 조건으로 비교했다
두 모델을 공정하게 비교하기 위해 조건은 모두 같게 했다.
목소리 프로필 : 같은 원본 사용
언어 : Korean
문장 : 동일한 문장 사용
효과 : No effects
반복 횟수 : 각 모델 여러 번 생성
가장 내 목소리에 가깝고 자연스러운 결과에는
★ 표시를 해 두었다.
먼저 0.6B를 테스트했다
같은 문장을 여러 번 생성해 들어보니,
목소리 자체는 분명히 내 목소리와 비슷했다.
하지만 매번 억양과 소리 높낮이가 조금씩 달랐다.
0.6B에서 느낀 점
① 내 목소리와 비슷하게 들린다.
② 같은 문장인데도 억양이 조금씩 달라진다.
③ 음성의 높낮이도 매번 미세하게 차이가 난다.
④ 긴 문장에서는 뒤로 갈수록 톤이 낮아지는 경우가 있었다.
⑤ 숫자나 연도 발음에서 문제가 나타나기도 했다.
같은 문장을 반복 생성하고 가장 좋은 결과에 ★ 표시를 했다.
같은 조건으로 1.7B도 테스트했다
1.7B 역시 같은 문장과 같은 설정으로 여러 번 생성했다.
여기에서도 결과마다 아주 미세한 차이는 있었다.
그러나 전체적으로는 0.6B보다
내 목소리와 더 자연스럽게 닮아 있고,
한국어 발음도 안정적이라는 느낌을 받았다.
1.7B에서 느낀 점
① 내 목소리와 더 자연스럽게 비슷하다.
② 같은 문장을 반복해도 차이는 매우 미세했다.
③ 숫자와 연도 발음이 0.6B보다 안정적이었다.
④ 문장 끝으로 갈수록 톤이 낮아지는 현상은 여전히 있었다.
⑤ 생성 시간은 0.6B와 큰 차이가 없었다.
1.7B 역시 반복 생성 후 가장 자연스러운 음성에 ★ 표시를 했다.
생성 시간은 예상과 달랐다
0.6B는 작은 모델이고 1.7B는 더 큰 모델이기 때문에
처음에는 0.6B가 훨씬 빠를 것으로 예상했다.
그러나 실제 테스트에서는
두 모델의 생성 시간 차이가 거의 느껴지지 않았다.
또한 같은 작업을 반복할수록 생성 속도는 점점 빨라졌다.
내가 사용하는 Windows PC에 NVIDIA 그래픽카드가 있다는 점도
이 부분에서 도움이 된 것으로 보인다.
현재까지는 1.7B가 더 좋았다
0.6B
목소리 복제는 가능하지만,
숫자 발음과 자연스러움에서 아쉬움이 있었다.
1.7B
내 목소리와 더 자연스럽게 닮았고,
한국어 발음도 비교적 안정적이었다.
생성 시간
실제 사용에서는 두 모델의 차이가 거의 느껴지지 않았다.
따라서 현재 단계에서는
1.7B를 중심으로 다음 테스트를 계속 진행하기로 했다.
이번 테스트에서 발견한 중요한 점
같은 문장과 같은 목소리를 사용해도
AI가 생성하는 억양과 높낮이는 매번 완전히 같지 않았다.
그래서 실제 나레이션을 만들 때는
한 번만 생성하고 끝내기보다
2~3번 생성해서 가장 자연스러운 결과를 고르는 방식이
더 좋겠다는 생각이 들었다.
실제 역사 나레이션에서 자주 사용하는 숫자와 고유명사를
Voicebox가 어떻게 읽는지 확인해 보았다.