처리중입니다. 잠시만 기다려주세요.
TTJ 코딩클래스
정규반 단과 자료실 테크 뉴스 코딩 퀴즈
테크 뉴스
Hacker News 2026.07.21 49

우리가 매일 듣는 구글의 그 목소리, 누가 어떻게 만드는 걸까

Hacker News 원문 보기
우리가 매일 듣는 구글의 그 목소리, 누가 어떻게 만드는 걸까

기계가 말을 거는 시대, 그 목소리의 정체

내비게이션이 "300미터 앞에서 우회전하세요" 하고 알려줄 때, 스마트 스피커한테 날씨를 물어봤을 때 돌아오는 그 또렷하고 자연스러운 목소리… 하루에도 몇 번씩 듣잖아요. 근데 그 목소리가 어디서 왔는지 궁금해본 적 있으세요?

이번 뉴요커 에세이는 바로 그 "구글의 목소리" 뒤에 있는 사람과 기술 이야기를 다뤄요. 우리가 무심코 듣는 기계 음성이 사실은 진짜 사람의 목소리에서 출발했고, 지금은 완전히 다른 방식으로 진화하고 있다는 거죠. 목소리라는 게 그냥 소리가 아니라, 한 사람의 정체성이기도 하니까 생각할 거리가 꽤 많은 주제예요.

예전엔 사람이 수천 문장을 녹음했어요

초창기 음성 합성(TTS, Text-to-Speech: 글자를 소리로 바꿔주는 기술) 방식은 좀 무식하다 싶을 만큼 노동집약적이었거든요. 성우 한 명을 스튜디오에 앉혀 놓고 수천, 수만 개의 문장과 단어 조각을 몇 주에서 몇 달 동안 녹음해요. 그리고 컴퓨터는 사용자가 요청한 문장을 만들 때 이 녹음된 조각들을 잘라서 이어 붙이죠. 이걸 "연결 합성(concatenative synthesis)"이라고 불러요. 마치 잡지에서 글자를 오려 붙여 편지를 만드는 것처럼요.

문제는 이렇게 만들면 어색하다는 거예요. 조각과 조각 사이 연결 부분에서 톤이 뚝뚝 끊기고 억양이 부자연스럽죠. 애플 시리 초기 목소리 주인공으로 알려진 성우 수전 베넷(Susan Bennett) 사례를 보면, 정작 본인은 자기가 녹음한 게 시리가 될 줄도 몰랐다고 할 정도예요. 사람의 목소리를 빌렸지만 그 사람의 감정이나 자연스러움은 다 사라진 채 부품처럼 쓰인 셈이죠.

지금은 AI가 목소리를 "생성"해요

여기서 판을 바꾼 게 구글이었어요. 2016년 구글 딥마인드가 발표한 "웨이브넷(WaveNet)"이 대표적인데요. 이게 뭐냐면, 녹음 조각을 이어 붙이는 게 아니라 소리의 파형(waveform) 자체를 인공지능이 처음부터 하나하나 만들어내는 방식이에요. 사람이 말할 때 성대가 떨리며 만드는 미세한 음파를 신경망이 학습해서 그대로 흉내 내는 거죠.

그 뒤로 타코트론(Tacotron) 같은 모델이 나오면서, 이제는 글자만 넣으면 억양, 호흡, 강세까지 사람처럼 붙은 음성이 뚝딱 나와요. 예전처럼 성우가 수만 문장을 녹음할 필요도 없이, 몇 분에서 몇 시간짜리 샘플만 있으면 그 사람 목소리를 거의 복제할 수 있는 수준까지 왔고요. 우리가 요즘 "어? 이거 기계 목소리 맞아?" 싶을 만큼 자연스러운 음성을 듣게 된 배경이에요.

업계 흐름 속에서 보면

이 분야는 지금 경쟁이 정말 치열해요. 아마존은 "폴리(Polly)", 마이크로소프트는 애저 음성 서비스, 그리고 일레븐랩스(ElevenLabs) 같은 스타트업은 감정 표현과 목소리 복제에 특화되면서 오디오북, 게임 더빙, 영상 내레이션 시장을 흔들고 있죠. 예전엔 성우를 고용해야만 가능했던 일을 이제 API 호출 몇 번으로 해결할 수 있게 된 거예요.

동시에 이 에세이가 던지는 질문도 무거워요. 사람의 목소리를 빌려 만든 기계 음성이 점점 그 사람을 대체하면, 원래 목소리의 주인은 어떻게 되는 걸까요? 목소리도 저작권이나 초상권처럼 보호받아야 하는 자산 아닐까요? 최근 성우들이 자기 목소리가 무단으로 AI 학습에 쓰였다며 문제를 제기하는 흐름과도 맞닿아 있어요.

한국 개발자에게

당장 서비스에 음성을 넣고 싶다면 진입 장벽이 정말 낮아졌어요. 구글 Cloud TTS, 네이버 클로바, 아마존 폴리 같은 API를 쓰면 몇 줄의 코드로 자연스러운 한국어 음성을 만들 수 있거든요. 접근성(시각 장애인용 화면 낭독), 챗봇, 교육 콘텐츠 같은 데 바로 적용할 수 있죠.

다만 목소리 복제 기술을 다룰 땐 윤리와 법적 문제를 꼭 함께 고민해야 해요. "이 목소리를 쓸 권리가 나에게 있는가"를 항상 확인하는 습관이요. 기계가 사람처럼 말하게 만드는 기술은 결국 "사람다움이란 무엇인가"라는 질문으로 돌아오는 것 같아요. 여러분은 사람과 구분 안 되는 AI 목소리를 서비스에 쓴다면, 사용자에게 "이건 AI 음성입니다"라고 꼭 밝혀야 한다고 생각하세요?


🔗 출처: Hacker News

이 뉴스가 유용했나요?

이 기술을 직접 배워보세요

AI 도구, 직접 활용해보세요

AI 시대, 코딩으로 수익을 만드는 방법을 배울 수 있습니다.

AI 활용 강의 보기

"비전공 직장인인데 반년 만에 수익 파이프라인을 여러 개 만들었습니다"

실제 수강생 후기
  • 비전공자도 6개월이면 첫 수익
  • 20년 경력 개발자 직강
  • 자동화 프로그램 + 소스코드 제공

매일 AI·개발 뉴스를 받아보세요

주요 테크 뉴스를 매일 아침 이메일로 전해드립니다.

스팸 없이, 언제든 구독 취소 가능합니다.