페이지 콘텐츠로 건너뛰기
문서
Make Agent Fast 문서

음성 및 실시간 통화

텍스트, 음성 메시지, 실시간 통화, 언어 동작, 동의 기반 음성 복제를 설정합니다.

이 페이지 한눈에

텍스트, 음성 메시지, 실시간 통화, 언어 동작, 동의 기반 음성 복제를 설정합니다.

음성 파이프라인음성 입력, 에이전트 추론, 음성 출력
방문자마이크STT음성→텍스트에이전트추론TTS텍스트→음성
기본 음성음성 메시지복제실시간 통화

세 가지 상호작용 모드 이해하기#

모드방문자 경험권한 및 사용량
텍스트 채팅메시지를 입력하고 텍스트 수신항상 활성화, 일반 AI 크레딧 사용
음성 메시지녹음 후 전사/에이전트/TTS를 기다려 답변 수신모든 요금제 포함, 전사/모델/음성 작업에 크레딧 사용
실시간 음성 통화낮은 지연으로 음성 대화Operate 월 30분, Scale 월 90분, Launch 미지원. 설정한 통화 한도만큼 크레딧도 선결제

텍스트는 끌 수 없습니다. 음성 메시지와 실시간 토글은 방문자가 사용할 추가 화면을 제어합니다. 실시간 토글을 저장해도 워크스페이스 요금제 권한이나 누락된 제공자 설정을 우회하지 않습니다.

상호작용 동작 설정하기#

  1. 사이트의 에이전트 페이지에서 음성을 찾습니다.
  2. 텍스트 채팅은 켠 상태로 두고 음성 메시지 및/또는 실시간 음성을 선택합니다.
  3. 에이전트에 여러 언어가 있으면 선택적으로 실시간 언어 미러링을 켭니다.
  4. 통화당 자동 제한을 설정합니다.
  5. 기본 음성 또는 권한이 있는 복제 음성을 선택합니다.
  6. 저장하고 활성화한 각 모드를 따로 테스트합니다.

통화 제한은 30초부터 20분까지 30초 단위이며 기본값은 3분입니다. 개별 통화를 끝내고 월 허용량을 보호하지만 요금제의 남은 실시간 시간을 늘리지는 않습니다.

언어와 음성 선택하기#

에이전트에는 영어, 한국어, 우즈베크어, 러시아어를 설정할 수 있습니다. 첫 언어가 기본 언어입니다. 단일 언어 에이전트는 항상 그 언어로 답합니다. 다국어 텍스트 에이전트는 방문자가 설정된 언어 중 하나를 사용하면 그 언어를 따릅니다.

실시간 통화의 언어 미러링은 두 개 이상 언어에서만 표시되는 명시적 옵션입니다. 꺼져 있으면 실시간 통화는 기본 언어를 사용합니다. 우즈베크어 음성은 제공자 음성 지원이 덜 완전해 현재 최선 노력 방식이므로 출시 전 실제 제공자와 대상 사용자로 테스트하세요.

기본 음성에는 영어 우선, 다국어, 한국어 네이티브 옵션이 있습니다. 언어 레이블은 조정된 전달 특성이지 절대 보장이 아닙니다. 대시보드 미리 듣기 컨트롤이 있으면 선택 음성을 들어 보고 실제 방문자 흐름에서 이름, 약어, 통화, 전화번호, 전문 용어를 항상 테스트합니다.

제공자 키 및 폴백#

음성에는 모델 키 외의 설정이 필요합니다.

  • 음성-텍스트 전사는 Deepgram 또는 OpenAI 같은 설정된 전사 제공자를 사용합니다.
  • 음성 메시지와 커넥터 오디오 답변에는 ElevenLabs 또는 OpenAI 같은 TTS 제공자가 필요합니다.
  • 실시간 통화에는 설정된 실시간 제공자와 요금제 허용량이 필요합니다.
  • 음성 복제에는 ElevenLabs 복제 가용성과 Operate/Scale 권한이 필요합니다.

설정 → AI 제공자 키에서 키를 설정하고 제공자 키를 따르세요. 텍스트 채팅 성공은 모델 경로만 증명하며 전사, 음성 합성, 미디어 업로드, 실시간 세션 생성을 증명하지 않습니다.

음성 메시지 테스트하기#

소유자 미리보기만 사용하지 말고 실제 임베드에서 테스트하세요. (남은 호스팅 데모가 있으면 그것도 됩니다.) 마이크 접근을 허용하고 짧은 질문을 녹음한 뒤 전사 의미와 음성/텍스트 응답을 확인합니다. 다음도 테스트하세요.

  • 조용하고 시끄러운 환경;
  • 필요한 경우 모바일 Safari와 Chrome;
  • 25MB 공개 오디오 제한에 가까운 긴 질문;
  • 마이크 권한 거부;
  • 지원하지 않거나 품질이 낮은 오디오;
  • 설정된 각 언어.

임베드 사이트에서는 상위 CSP와 Permissions Policy가 마이크를 허용해야 합니다. 보안 및 CSP를 참고하세요.

플랫폼 vs 게시된 사이트의 실시간 통화#

실시간 통화는 같은 통화 컨트롤을 두 스킨에서 사용합니다.

화면위치모습활성화로 치나
플랫폼 테스터검토의 에이전트와 대화해 보세요, 에이전트의 테스터플랫폼 대시보드 크롬아니요 — 소유자 테스트는 활성화되지 않음
게시된 사이트와 임베드남은 호스팅 데모 페이지 위젯(있는 경우)과 embed.js iframe테넌트/위젯 Look예 — 방문자 통화는 실제 대화

Look 미리보기의 실시간 통화는 방문자 모습이며 플랫폼 테스터가 아닙니다. 출시 전 실제 임베드에서 테스트하세요. 대시보드 테스트 성공만으로는 위젯 스킨, 임베드 마이크 권한, 활성화를 증명하지 않습니다.

Look의 사이트 설정 사용은 호스트 페이지와 임베드에서 방문자의 라이트/다크 모드를 따릅니다. 라이트 또는 다크를 고정하면 채팅과 실시간 통화가 고정됩니다. Look을 참고하세요.

실시간 통화 테스트하기#

요금제에 사용하지 않은 실시간 시간이 있고 사이트에 접근할 수 있으며 실시간 제공자 키가 검증되는지 확인합니다. 짧은 통화로 시작해 에이전트를 중간에 끊어 보고, 미러링이 켜졌을 때만 언어를 전환하며, 설정된 통화 제한이 테스트 세션 하나를 끝내도록 확인합니다. 대시보드 테스터만이 아니라 실제 임베드에서도 한 통화를 반복하세요.

실시간 시간은 일반 크레딧과 별도의 월 권한입니다. 실시간 토큰이 발급되면 서버가 승인한 최대 시간만큼 크레딧이 청구되고 그 시간이 월 실시간 허용량에서도 보류됩니다. 미디어는 브라우저와 제공업체 사이에서 직접 흐르므로 클라이언트가 보고한 더 짧은 통화 시간을 검증할 수 없고, 토큰 전달 후 사용하지 않은 시간은 부분 환불되지 않습니다. 서버 측 토큰 발급 실패는 청구를 해제하지만 중단된 세션은 승인된 한도만큼 청구됩니다. 테스트를 정상 종료하고 설정한 통화 한도로 사용량을 예측하세요. 크레딧 및 사용량도 참고하세요.

책임감 있게 음성 복제하기#

Launch에서는 음성 복제를 사용할 수 없습니다. Operate는 복제 1개, Scale은 공정 사용 범위에서 여러 개를 허용합니다. 이미 복제된 사이트를 다시 복제하면 추가 슬롯을 쓰지 않고 해당 사이트 복제를 교체합니다.

본인 음성 또는 명시적이고 문서화된 허가를 받은 음성만 사용하세요. 복제 폼은 동의를 요구하며 사이트 범위 챌린지 문구 입력을 요구할 수 있습니다. 더 강한 동의 게이트가 활성화된 경우 성공한 복제는 감사 가능한 동의 기록을 생성합니다.

최소 1개, 최대 10개 오디오 샘플을 업로드합니다. 파일당 최대 10MB, 합계 최대 50MB입니다. 한 명의 화자, 일정한 거리, 최소 배경 소음, 대표적인 발음이 있는 깨끗한 무가공 녹음을 사용하세요. 여러 화자나 과도하게 처리된 음악을 섞지 마세요.

복제는 크레딧을 예약한 뒤 정산합니다. 제공자 호출이 실패하면 예약을 환불하고 성공하면 복제 음성이 에이전트의 선택 음성이 됩니다.

고지 및 안전#

관련 법률, 제공자 정책, 사용자 기대가 요구하면 AI 및 합성/복제 음성과 상호작용한다는 사실을 통화자에게 알리세요. 허가 없이 사람을 복제/모방하거나 기만적인 신원 주장에 사용하거나 불필요한 녹음을 수집하지 마세요. 녹음, 전사, 동의 기록, 외부 제공자 데이터의 보존/삭제 방법을 정의합니다.

문제 해결#

증상확인 사항
텍스트는 되지만 음성 컨트롤 실패전사/TTS/실시간 제공자 키, 기능 토글, 요금제, 크레딧, 브라우저 권한
녹음 시작 불가HTTPS, 마이크 권한, 입력 장치, 임베드 Permissions Policy, 브라우저 지원
전사가 부정확오디오 품질, 선택 언어 집합, 억양/용어, 전사 제공자 지원
음성 답변이 이상함선택 음성, 원본 텍스트, 문장 부호, 언어 레이블, 제공자 가용성
실시간 통화가 즉시 종료남은 시간, 통화당 제한, 제공자 키, 네트워크, 동시 세션 상태
복제 거부요금제 슬롯, 동의 문구, 1–10개 지원 오디오, 파일당/합계 제한, ElevenLabs 키

음성을 별도의 출시 화면으로 취급하세요. 텍스트 승인 테스트만으로는 충분하지 않습니다.

복제 음성 우선 사용과 대체 음성#

자동 음성은 Speko를 통해 영어, 한국어, 우즈베크어, 러시아어에 맞는 제공자를 선택해요. 제공자에 따라 기본 음성이 달라질 수 있으며 직접 제공자를 선택하는 설정은 유지돼요. 녹음된 음성 메시지의 전사도 기본적으로 Speko를 사용해요.

저장된 복제 음성은 해당 음성을 소유한 플랫폼 키로 ElevenLabs를 사용해요. 플랫폼의 복제 라우팅이 활성화되면 Speko를 거쳐 ElevenLabs v3를 사용하며 설정 중에는 직접 연결을 유지해요. 실패하면 Speko에 기본 음성을 별도로 요청해요. Speko 자체를 사용할 수 없으면 사용 가능한 직접 제공자로 대체해요. 실패한 요청의 예약 크레딧은 다음 시도 전에 반환하며 저장된 복제 음성 선택은 바꾸지 않아요. 개인 ElevenLabs 키는 필수가 아니에요.

실시간 통화는 OpenAI Realtime 또는 Gemini Live의 음성을 직접 스트리밍해요. 입력 음성은 채팅 표시를 위해 별도로 전사되므로 입력 전사나 완성된 텍스트 답변을 기다린 뒤 재생하지 않아요. 음성 메시지에 복제 음성이나 Speko를 선택했더라도 통화에서는 실시간 제공자의 기본 음성을 사용해요. 복제 음성은 음성 메시지에서 계속 사용할 수 있어요. 지식 검색, 언어 규칙, 끼어들기, 통화 시간 한도와 선결제 비용은 유지되며 통화 답변에 별도 TTS 요청을 보내지 않아요.