내 목소리를 Gemini로 복제하려면? 참고 녹음과 동의 녹음을 따로 준비하는 법

내 목소리 녹음 하나만 올리면 복제가 될까요? Gemini API의 음성 복제에는 같은 성인이 직접 녹음한 참고 음성과 동의 음성, 두 개가 필요합니다. 참고 음성은 깨끗하고 자연스러운 말소리로 10~30초를 준비하고, 동의 음성은 공식 문구를 정확히 읽어 별도로 녹음하세요. 처음이라면 Google AI Studio의 Voice Replication 기능에서 녹음하거나 파일을 올리는 방식으로 접근할 수 있습니다.

두 녹음은 맡은 역할이 다릅니다

이 글은 제공된 Google의 Voice replication 가이드와 Gemini API 변경 기록을 바탕으로 정리했습니다. 가이드는 짧은 음성 샘플에서 화자의 목소리 특성을 복제하는 기능을 설명합니다. 변경 기록의 2026년 9월 22일 항목에도 동의 확인을 거치는 음성 복제가 명시되어 있습니다.

구분 준비할 내용 문서상 조건
참고 음성 복제할 본인의 자연스러운 말소리 10~30초의 깨끗한 녹음. API 항목명은 source_audio
동의 음성 같은 사람이 필수 동의 문구를 읽은 말소리 지원 언어의 정확한 문구를 명확히 낭독. API 항목명은 consent_audio

두 파일 모두 같은 성인의 실제 녹음이어야 한다는 점은 필수 조건입니다. 한쪽을 다른 사람이 읽거나 합성 음성으로 만들면 이 조건에 맞지 않습니다.

녹음 형식은 24kHz·모노·16비트 PCM WAV가 권장됩니다. 모노는 소리가 한 채널에 담긴다는 뜻입니다. 문서가 이 형식을 권장한다고 해서 다른 형식은 모두 불가능하다고 단정할 수는 없습니다. 또한 10~30초는 참고 음성에 명시된 길이이며, 제공 자료에는 동의 음성의 별도 초 단위 제한이 없습니다.

제공된 가이드의 지원 동의 문구 표에는 한국어 ko-KR가 포함되어 있습니다. 아래 문장이 공식 문서에 적힌 한국어 문구입니다.

나는 이 음성의 소유자이며 구글이 이 음성을 사용하여 음성 합성 모델을 생성할 것을 허용합니다.

가이드는 지원 언어 중 하나의 문구를 정확히 그대로 읽도록 요구합니다. 따라서 뜻이 같더라도 “제 목소리를 써도 됩니다”처럼 줄이거나, 영어 문구를 임의로 번역해 대신 읽지 마세요. 참고 음성을 녹음한 본인이 위 문장을 또렷하게 읽으면 됩니다.

안내 음성을 만들고 싶다면 이렇게 준비하세요

자신의 목소리로 짧은 안내 음성을 만들려는 상황을 가정해 보겠습니다. 아래는 따라 해볼 준비 예시이며 실제 생성이나 동의 확인을 수행한 결과는 아닙니다.

  1. 조용한 장소를 정합니다. 배경 음악을 끄고 다른 사람의 말소리와 방 안의 울림이 적은 곳을 고르세요. 이는 가이드의 녹음 권장 사항입니다.
  2. 참고 음성을 녹음합니다. 평소 말투로 익숙한 내용을 설명한 뒤 길이가 10~30초인지 확인하세요.
  3. 같은 마이크와 장소에서 동의 음성을 따로 녹음합니다. 앞의 한국어 공식 문구를 그대로 읽으세요. 가이드는 화자 확인이 안정적으로 이뤄지도록 두 녹음의 환경을 맞추라고 권장합니다.
  4. 두 파일을 구분해 저장합니다. 예를 들어 참고 파일은 reference_speaker.wav, 동의 파일은 speaker_consent.wav로 이름 붙일 수 있습니다. 파일명 자체는 필수 조건이 아닙니다.
  5. 공식 가이드의 AI Studio 진입 링크를 이용합니다. 문서에 따르면 Voice Replication 화면에서 참고·동의 음성을 브라우저로 녹음하거나 업로드하고, 동의를 확인하며 복제 음성을 미리 들어볼 수 있습니다.

참고 음성에 읽어볼 내용

다음은 편집상 제안하는 연습 문장입니다. 공식 필수 대본은 아니며, 읽는 속도에 따라 길이가 달라지므로 녹음 후 시간을 확인해야 합니다.

안녕하세요. 오늘은 제가 평소에 하루를 준비하는 방법을 이야기하겠습니다. 먼저 해야 할 일을 적고, 약속 시간을 확인합니다. 일이 끝나면 내일 필요한 물건을 정리합니다. 바쁜 날에도 잠깐 쉬면서 다음 일정을 차분하게 살펴보려고 합니다.

문장이 10초보다 짧게 끝났다면 자연스러운 설명을 더하고, 30초를 넘었다면 내용을 줄여 다시 녹음하는 방법을 권합니다. 이 조정 방법은 문서의 길이 조건을 적용한 편집상 제안입니다.

조건이 맞지 않을 때 먼저 점검할 곳

다음 표는 공식 요건을 바탕으로 만든 사전 점검표입니다. 특정 오류 코드의 확정 원인이나 해결을 보장하는 표는 아닙니다.

준비 상황 문서와 대조할 부분 다음 행동
참고 음성이 5초뿐입니다 참고 음성은 10~30초 자연스러운 말소리를 더 길게 다시 녹음합니다
동의 문장을 짧게 바꿨습니다 정확한 필수 문구 낭독 공식 한국어 문구를 그대로 읽어 다시 녹음합니다
동의 녹음은 가족이 대신했습니다 같은 성인 화자의 실제 녹음 두 개 참고 음성을 녹음한 본인이 직접 읽습니다
두 녹음의 장소와 마이크가 다릅니다 동일한 녹음 환경 권장 같은 마이크와 장소에서 두 녹음을 준비합니다
음악이나 다른 사람의 말이 섞였습니다 배경 소음과 겹치는 목소리 최소화 권장 조용한 환경에서 다시 녹음합니다

체크리스트

  • 참고 음성과 동의 음성이 각각 준비되어 있는가?
  • 두 녹음 모두 같은 성인이 직접 말한 실제 음성인가?
  • 참고 음성이 10~30초이며 자연스럽고 깨끗하게 들리는가?
  • 동의 음성에 공식 한국어 문구를 빠짐없이 그대로 읽었는가?
  • 같은 마이크와 같은 장소에서 녹음했는가?
  • 배경 음악, 다른 사람의 말소리, 심한 울림을 줄였는가?
  • 권장 형식인 24kHz·모노·16비트 PCM WAV로 준비했는가?
  • 파일을 직접 들어 보고 참고용과 동의용을 구분했는가?

한계와 주의

이 설명의 대상은 Gemini API와 Google AI Studio의 음성 복제 기능입니다. 일반 Gemini 채팅 앱이나 Windows 앱에 같은 메뉴가 있다는 근거로 해석하면 안 됩니다. 제공 자료만으로는 계정별 이용 가능 여부, 비용, 실제 화면의 버튼 위치를 확인할 수 없습니다.

녹음 조건을 맞췄다고 동의 확인의 성공이나 원래 목소리와의 유사도가 보장되는 것도 아닙니다. 이 글에는 직접 실행한 결과나 품질 비교가 없습니다. 한국어 동의 문구가 지원된다는 사실만으로 모든 한국어 합성 결과의 품질을 판단할 수도 없습니다.

API로 만들 때는 저장 방식도 확인하세요. 가이드에 따르면 기본값인 store=True는 검증된 음성 프로필을 프로젝트에 저장하고 재사용할 voice_id를 반환합니다. store=False는 음성 프로필을 서버에 지속 저장하지 않고, 사용자가 관리하는 암호화된 voice_key를 반환하는 방식입니다. 이를 모든 요청 데이터나 로그가 전혀 저장되지 않는다는 의미로 확대해서는 안 됩니다.

자료 확인일은 2026년 10월 3일입니다. 음성 복제 가이드의 최종 수정 표시는 2026년 9월 24일이며, 관련 출시 기록은 9월 22일 항목에 있습니다. 확인일에 새로 발표된 기능이라는 뜻은 아닙니다.

자주 묻는 질문

한국어로 동의 녹음을 해도 되나요?

네. 제공된 공식 가이드에는 한국어 ko-KR와 필수 동의 문구가 명시되어 있습니다. 이 글에 인용한 문장을 정확히 읽으세요.

참고 녹음 하나만 제출해도 되나요?

아니요. 가이드는 복제 요청마다 같은 성인의 참고 음성과 동의 음성 두 개를 요구합니다.

동의 음성도 반드시 10~30초여야 하나요?

제공 자료의 10~30초 조건은 참고 음성에 해당합니다. 동의 음성에는 별도 길이 제한이 제시되지 않았으며, 정확한 동의 문구를 명확히 읽도록 안내합니다.

다른 사람이 동의 문장을 대신 읽어도 되나요?

안 됩니다. 참고 음성과 동의 음성은 같은 성인 화자의 실제 녹음이어야 합니다.

코드를 몰라도 음성을 준비하고 미리 들어볼 수 있나요?

문서에 따르면 Google AI Studio의 Voice Replication 기능에서 브라우저 녹음·업로드, 동의 확인, 음성 미리 듣기가 가능합니다. 다만 제공 자료로 개인 계정의 접근 가능 여부까지 확인할 수는 없습니다.

출처

댓글 남기기