Grok Voice Think Fast 2.0: xAI의 더 빠르고 정확한 음성 에이전트 모델

Grok Voice Think Fast 2.0: xAI의 더 빠르고 정확한 음성 에이전트 모델 Grok Voice Think Fast 2.0 가이드: 벤치마크, 가격, 정확성 및 마이그레이션 xAI의 Grok Voice Think Fast 2.0은 음성 추론, 전사 정확성, 에이전트 성능 및 지연 시간을 개선했습니다. 벤치마크, 가격, Starlink 결과 및 8월 5일 마이그레이션 세부 사항을 확인하세요. Grok Voice Think Fast 2.0, xAI 음성 에이전트, Grok Voice API, 음성-음성 AI, 음성 에이전트 모델, Grok Voice 가격, AI 음성 벤치마크, 전사

发布于 2026年7月30日generalGEO 评分: 03 次阅读
Grok Voice Think Fast 2.0: xAI의 더 빠르고 정확한 음성 에이전트 모델

Grok Voice Think Fast 2.0: xAI의 더 빠르고 정확한 음성 에이전트 모델

서론

xAI가 실시간 음성 에이전트 개발을 위한 차세대 음성-음성 모델인 Grok Voice Think Fast 2.0을 출시했습니다.

이 새 버전은 프로덕션 수준의 음성 시스템에서 가장 중요한 네 가지 측면인 지능 수준, 전사 정확도, 대화 행동 및 안정적인 도구 호출에 중점을 둡니다. xAI는 대부분의 경우 기존 애플리케이션이 프롬프트를 다시 작성하지 않고도 새 모델로 마이그레이션할 수 있다고 밝혔습니다.

Think Fast 2.0의 가격은 오디오 1분당 0.08달러입니다. 개발자는 버전 번호가 포함된 모델 이름 grok-voice-think-fast-2.0을 사용할 수 있으며, grok-voice-latest 별칭은 2026년 8월 5일에 1.0 버전에서 2.0 버전으로 전환될 예정입니다.

이 모델은 고객 지원, 영업, 전화 자동화 및 다단계 업무 워크플로우와 같은 실제 음성 에이전트 워크로드를 위해 설계되었습니다. 이러한 시나리오에서 에이전트는 음성을 이해하고 추론하며 도구를 호출하고 자연스러운 대화 흐름을 유지하기 위해 빠르게 응답해야 합니다.

Grok Voice Think Fast 2.0, 주요 음성 벤치마크 전반에서 향상

xAI는 Artificial Analysis의 벤치마크 결과를 발표하여 Think Fast 2.0을 이전 모델, OpenAI의 GPT-Realtime-2.1 및 Google의 Gemini 3.1 Flash와 비교했습니다.

SpaceX AI가 발표한 Grok Voice Think Fast 2.0 관련 트윗 스크린샷 이미지. 내용은 이 모델이 개선된 지능, 전사 정확도 및 대화 능력을 갖춘 차세대 음성 모델임을 보여줍니다. 표는 Grok Voice Think Fast 2.0, Think Fast 1.0, GPT-Realtime-2.1 (High) 및 Gemini 3.1 Flash (High)의 여러 측면(예: AA 음성 품질 지수, 음성 추론, 대화 역학, 에이전트 성능 및 속도)을 비교하며, Grok Voice Think Fast 2.0이 AA 음성 품질 지수 82.9%, 속도 0.70초 등 여러 지표에서 두드러진 성과를 보임을 나타냅니다. 이 이미지는 문서에서 Grok Voice Think Fast 2.0의 성능 비교를 소개하는 내용과 일치합니다.

보고된 결과는 다음과 같습니다:

벤치마크 Grok Voice Think Fast 2.0 Think Fast 1.0 GPT-Realtime-2.1 High Gemini 3.1 Flash High
AA 음성-음성 품질 지수 82.9% 75.7% 79.1% 69.5%
Big Bench 오디오 97.2% 97.1% 96.0% 96.6%
전이중 테스트 95.1% 77.8% 95.7% 74.3%
τ-음성 테스트 56.5% 52.1% 45.7% 37.7%
첫 오디오 응답 시간 0.70초 1.25초 2.98초

Think Fast 1.0과 비교하여 전체 AI 분석 음성-음성 품질 지수는 75.7%에서 82.9%로 향상되었습니다.

가장 두드러진 실제 변화는 대화 역학, 에이전트 성능 및 응답 지연 시간에서 나타납니다.

음성 추론

Big Bench 오디오 테스트에서 Think Fast 2.0은 97.2% 점수를 기록하여 이전 모델의 97.1%보다 약간 높았습니다.

이는 이번 출시가 원시 음성 추론 능력의 비약적인 향상을 주된 목표로 하지 않았음을 시사합니다. 대신 개선의 대부분은 실시간 대화에서 모델이 보이는 행동에 있습니다.

대화 역학

Think Fast 2.0은 전이중 테스트에서 **95.1%**를 달성했으며, Think Fast 1.0은 77.8%였습니다.

전이중 테스트는 말할 타이밍 파악, 멈춤 처리, 방해에 대응, 피드백 신호 인식 및 자연스러운 발언 전환 유지와 같은 행동을 평가합니다.

GPT-Realtime-2.1 High는 개별 테스트에서 95.7%로 약간 더 높은 점수를 받았으므로, xAI 모델이 모든 범주에서 선두는 아닙니다.

에이전트 성능

음성 에이전트가 실제 작업을 완료할 수 있는지 여부를 더 중점적으로 평가하는 τ-음성 테스트에서 Think Fast 2.0은 56.5% 점수를 기록했습니다.

이 점수는 Think Fast 1.0의 52.1%, GPT-Realtime-2.1 High의 45.7% 및 Gemini 3.1 Flash High의 37.7%보다 높습니다.

이 지표는 고객 서비스 및 영업 에이전트에게 특히 중요합니다. 우수한 대화 오디오만으로는 충분하지 않으며, 시스템이 지침을 올바르게 따르고 도구를 사용하며 정보를 수집하고 작업 흐름을 완료해야 하기 때문입니다.

더 빠른 첫 오디오 응답

xAI는 첫 오디오 응답 시간이 0.70초로 Think Fast 1.0의 1.25초보다 낮아졌다고 보고했습니다.

더 낮은 지연 시간은 사용자가 말을 마친 후 AI가 응답을 시작하기까지 발생하는 어색한 침묵을 줄여줍니다.

AI 분석은 현재 Think Fast 2.0을 측정된 응답이 빠른 음성-음성 시스템 중 하나로 분류하지만, 전체 순위에서 가장 빠른 모델은 아닙니다.

24개 언어에 걸친 전사 정확도 향상

xAI는 또한 24개 언어를 아우르는 수천 개의 짧은 음성 샘플을 사용하여 Think Fast 2.0을 테스트했습니다.

회사에 따르면, 평가에서 새 모델의 전사 정확도는 Deepgram Nova 3 및 ElevenLabs Scribe v2보다 약 1.5~2.0배, Grok Voice Think Fast 1.0보다 약 1.4배 높았습니다.

xAI

또한 일부 소음이 심하거나 전화 압축 환경에서는 격차가 약 10배까지 벌어질 수 있다고 밝혔습니다.

이 데이터는 xAI 자체의 전사 평가에서 비롯된 것이지, 인공지능 분석의 벤치마크 테이블이 아닙니다. 이 구분이 중요한 이유는 벤치마크 비교와 전사 실험이 서로 다른 지표를 측정하고, 또 다른 평가 설정에서 비롯되기 때문입니다.

잡음이 있는 오디오에 대한 강조는 프로덕션 환경의 음성 에이전트에게 큰 의미를 갖습니다. 실제 통화에는 이동통신망 압축, 저품질 마이크, 도로나 사무실 소음, 억양, 빠른 말투, 끼어들기, 불완전한 문장, 이름, 주소, 계정 세부 정보 등이 포함되는 경우가 많습니다.

모델이 말하면서 추론하기

Grok Voice Think Fast의 다소 독특한 설계 선택 중 하나는 병렬 추론입니다.

xAI

이 모델은 오디오를 생성하기 전에 모든 추론을 완료하는 대신, 말하면서 계속 추론할 수 있습니다. 이 설계는 지능과 지연 시간 간의 트레이드오프를 줄이는 것을 목표로 합니다.

Think Fast 2.0은 이전 버전보다 더 적은 수의 추론 토큰을 사용합니다. xAI가 보고한 추론 토큰 중앙값 상대 사용량은 다음과 같습니다.

모델 응답당 상대적 추론 토큰 수
Grok Voice Think Fast 2.0 0.4×
Grok Voice Think Fast 1.0 1.0×

회사 측은 이로 인해 도구 호출 속도가 빨라져, 일반적으로 음성 비서가 첫 마디를 마치기 전에 도구가 이미 실행을 완료할 수 있다고 밝혔습니다.

예를 들어, 고객 서비스 비서가 "확인해 드리겠습니다..."라고 말을 꺼내는 동시에 백그라운드에서 계정 조회 도구를 호출할 수 있습니다. 음성 안내가 끝날 무렵에는 도구 결과가 이미 준비되어 응답의 다음 부분에 사용될 수 있습니다.

강화 학습으로 대화를 더 간결하게

xAI는 Think Fast 2.0이 방대한 강화 학습 훈련을 통해 실제 대화에서 실제 업무 상담원처럼 행동하도록 만들어졌다고 말합니다.

이 모델은 더 짧은 문장을 사용하고, 한 번에 한 가지 질문만 하며, 불필요한 군더더기 말을 피하고, 대화에 집중하며, 복잡한 절차를 안내할 때 불필요한 복잡성을 드러내지 않도록 장려됩니다.

사소한 변경처럼 들릴 수 있지만, 음성 인터페이스는 긴 답변에 대한 허용도가 문자 채팅보다 훨씬 낮습니다. 긴 답변은 화면에서는 괜찮을 수 있지만, 통화 중에 듣는 것은 답답할 수 있습니다.

도구 사용은 음성 API의 핵심 부분

현재 xAI의 음성-음성 API는 음성 세션 내에서 직접 여러 도구 유형을 지원합니다.

  • file_search
  • web_search
  • x_search
  • 원격 MCP 도구
  • 사용자 정의 함수

이를 통해 음성 비서가 단순한 질의응답을 넘어설 수 있습니다.

애플리케이션이 부여한 권한에 따라, 음성 비서는 발신자의 요청을 이해하고, 승인된 문서를 검색하고, 계정 정보를 조회하고, 비즈니스 API를 호출하고, 허용된 작업을 실행하고, 결과를 음성으로 설명할 수 있습니다.

프로덕션 환경의 경우, 애플리케이션은 여전히 엄격한 권한 경계를 설정해야 합니다. 모델이 민감한 도구를 호출할 수 있다고 해서 직접 액세스 권한을 부여해서는 안 됩니다.

Starlink, Think Fast 2.0 A/B 테스트 중

Grok Voice는 이미 Starlink의 전화 기반 영업 및 고객 서비스 워크플로우에 사용되고 있습니다.

xAI는 +1 888 GO STARLINK를 통해 Starlink 전화 회선에서 Think Fast 2.0에 대한 A/B 테스트를 진행했다고 밝혔습니다.

회사 측은 판매 전환율과 고객 서비스 문제 해결률이 모두 크게 향상되었다고 보고했습니다.

xAI는 발표 공지에서 Think Fast 2.0 A/B 테스트의 구체적인 개선율을 공개하지 않았습니다.

이는 초기 Think Fast 1.0 배포에 대한 이전 공개 데이터와 혼동해서는 안 됩니다. xAI는 당시 20%의 판매 전환율과 70%의 자동 고객 서비스 문제 해결률을 보고했습니다. 2.0 버전 공지에서는 새 버전이 Starlink의 기존 결과를 개선했다고만 밝혔습니다.

가격: 분당 0.08달러

xAI 공식 가격 페이지에 명시된 내용:

음성 모델 오디오 가격
grok-voice-think-fast-1.0 0.05달러/분
grok-voice-think-fast-2.0 0.08달러/분

따라서 Think Fast 2.0의 오디오 비용은 시간당 4.80달러입니다.

공개된 API 요금입니다.

음성-음성 API의 텍스트 입력은 별도로 청구되며, 0.004달러 단위로 계산됩니다.

추가적인 서버 측 도구도 별도 비용이 발생할 수 있습니다. 예를 들어, xAI는 현재 웹 검색, X 검색 및 코드 실행을 도구 호출 1,000회당 5달러로 책정하고 있습니다.

따라서 개발자는 전체 워크플로우를 기반으로 총 비용을 계산해야 하며, 오디오 요금만 단순 곱셈해서는 안 됩니다.

grok-voice-latest, 2026년 8월 5일에 2.0 버전으로 전환

이미 Grok 음성 API를 사용 중인 개발자는 모델 별칭에 주의해야 합니다.

현재 문서 설명:

grok-voice-latest

는 다음을 가리킵니다.

grok-voice-think-fast-1.0

2026년 8월 5일까지입니다.

2026년 8월 5일, 해당 별칭은 자동으로 다음으로 전환됩니다.

grok-voice-think-fast-2.0

grok-voice-latest를 사용하는 애플리케이션은 별도의 변경 없이 업그레이드됩니다.

그러나 안정적인 동작이 필요한 팀은 명시적으로 버전을 고정해야 합니다.

1.0 버전에 머무르려면:

grok-voice-think-fast-1.0

새 모델을 즉시 채택하려면:

grok-voice-think-fast-2.0

규제 워크플로우, 고정 평가 기준 또는 변경 관리 요구 사항이 있는 프로덕션 시스템의 경우 버전 고정이 특히 중요합니다.

기존 프롬프트는 일반적으로 변경 불필요

xAI는 Think Fast 2.0이 프롬프트 수정 없이 대부분의 기존 애플리케이션을 개선하도록 설계되었다고 밝혔습니다.

이로 인해 마이그레이션은 비교적 간단하지만, 프로덕션 팀은 여전히 회귀 테스트를 실행해야 합니다.

음성 모델 업그레이드는 응답 길이, 타이밍, 발언 순서, 도구 호출 빈도, 명확화 질문, 에스컬레이션 메커니즘, 전사, 발음 및 구조화된 데이터 수집에 영향을 미칠 수 있습니다.

합리적인 마이그레이션 절차는 다음과 같습니다.

  1. 기존 1.0 모델을 고정합니다.
  2. 2.0에 대해 동일한 테스트 대화를 실행합니다.
  3. 작업 성공률과 도구 사용 상황을 비교합니다.
  4. 잡음 및 전화 음질 오디오를 테스트합니다.
  5. 인터럽트 처리를 확인합니다.
  6. 지연 시간을 검토합니다.
  7. 완료된 작업당 비용을 측정합니다.
  8. 프로덕션 트래픽을 단계적으로 마이그레이션합니다.

최소 Grok 음성 연결

원본 AIBase 보고서에는 코드가 포함되지 않았지만, xAI 공식 문서는 음성-음성 API에 연결하는 간단한 WebSocket 예제를 제공합니다.

WebSocket URL을 통해 모델을 선택합니다.

MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"

그런 다음 세션에서 음성, 지침 및 발언 감지를 정의할 수 있습니다.

session_config = {
    "type": "session.update",
    "session": {
        "voice": "eve",
        "instructions": "당신은 간결한 고객 지원 도우미입니다.",
        "turn_detection": {
            "type": "server_vad"
        }
    }
}

브라우저 또는 모바일 클라이언트의 경우, xAI는 장기 유효 API 키를 클라이언트에 노출하는 대신 임시 토큰 사용을 권장합니다. 서버 측 애플리케이션은 인증 헤더의 API 키를 통해 인증할 수 있습니다.

지원되는 오디오 형식

음성-음성 API는 현재 다음을 지원합니다.

형식 일반적인 용도
PCM 일반 고품질 오디오
G.711 μ-law / audio/pcmu 전화 오디오
G.711 A-law / audio/pcma 전화 시스템
Opus 압축 실시간 오디오

PCM은 8

kHz에서 48kHz에 이르는 다양한 샘플링 레이트를 지원합니다.

일반적인 음성 애플리케이션의 경우, 공식 문서에서는 기본적으로 24kHz PCM을 권장합니다. 네이티브 G.711 지원은 일부 전화 시스템에서 추가 트랜스코딩 필요성을 줄여주므로 유용합니다.

Think Fast 2.0에 가장 적합한 사용 사례

이번 릴리스는 단순한 오프라인 전사보다는 실시간 상담원 워크플로에 초점을 맞추고 있습니다.

고객 지원

이 모델은 고객 질문을 듣고, 승인된 정보를 검색하며, 계정 도구를 사용하고, 다단계 문제 해결을 수행할 수 있습니다.

전화 판매

음성 상담원이 질문에 답변하고, 잠재 고객을 식별하며, 판매 도구를 사용하고, 발신자를 구매 과정으로 안내할 수 있습니다.

예약 및 좌석 예약 상담원

시스템은 예약 API를 호출하는 동시에 날짜, 시간, 이름 및 선호도 정보를 수집할 수 있습니다.

기업 내부 비서

직원이 음성을 통해 기업 시스템과 상호작용하는 동안 모델이 내부 도구를 호출하거나 승인된 지식 베이스를 검색할 수 있습니다.

다국어 음성 서비스

xAI의 Grok Voice 플랫폼은 25개 이상의 언어를 지원하여 글로벌 지원 업무에 적합합니다.

개발자가 직접 테스트해야 할 사항

벤치마크 데이터는 유용하지만, 특정 애플리케이션에 모델이 적합한지 판단할 수는 없습니다.

프로덕션 배포 전에 실제 발신자의 억양, 전화 코덱, 배경 소음, 제품명, 고객 이름, 주소, 긴 계정 번호, 인터럽트, 침묵, 사용자 마음 변경, 도구 오류, 잘못된 도구 결과, 수동 전환 조건, 보안 또는 규정 준수 규칙을 테스트하십시오.

응답이 정확할 때만 0.70초의 첫 음성 시간이 가치 있습니다. 마찬가지로, 높은 벤치마크 점수가 상담원이 회사의 특정 환불 정책을 따르거나 흔하지 않은 고객 이름을 정확히 입력할 것이라고 보장하지는 않습니다.

자주 묻는 질문

Grok Voice Think Fast 2.0이란 무엇인가요?

Grok Voice Think Fast 2.0은 xAI가 출시한 차세대 음성-음성 모델로, 실시간 음성 상담원을 위해 설계되었습니다. 네이티브 오디오 상호작용, 추론, 대화 전환, 전사 및 도구 사용 기능을 통합하고 있습니다.

Grok Voice Think Fast 2.0의 가격은 어떻게 되나요?

xAI는 이 모델을 오디오 1분당 0.08달러, 즉 시간당 4.80달러로 책정했습니다. 도구 호출 및 기타 일부 API 기능에는 추가 요금이 발생할 수 있습니다.

Think Fast 2.0이 Think Fast 1.0보다 더 빠른가요?

네. xAI와 Artificial Analysis에 따르면 첫 음성 시간이 1.25초에서 0.70초로 줄었습니다.

GPT-Realtime-2.1보다 더 우수한가요?

Artificial Analysis 음성-음성 품질 종합 지수 및 τ-음성 에이전트 벤치마크에서 Think Fast 2.0이 공개된 비교에서 더 높은 점수를 기록했습니다. GPT-Realtime-2.1 High는 전이중 벤치마크에서 여전히 약간 우위를 보이므로, Think Fast 2.0이 모든 개별 지표에서 앞서는 것은 아닙니다.

2.0 버전을 위해 프롬프트를 다시 작성해야 하나요?

xAI는 대부분의 애플리케이션에서 프롬프트 변경 없이 성능 향상을 얻을 수 있다고 밝혔습니다. 그러나 타이밍, 도구 사용, 전환 방식 및 응답 스타일이 모델 버전에 따라 달라질 수 있으므로 프로덕션 팀은 여전히 회귀 테스트를 실행해야 합니다.

grok-voice-latest는 언제 Think Fast 2.0으로 전환되나요?

xAI는 2026년 8월 5일에 해당 별칭이 자동으로 전환된다고 밝혔습니다.

1.0 버전을 계속 사용해야 하는 개발자는 grok-voice-think-fast-1.0을 고정해야 합니다.

Grok Voice Think Fast 2.0이 도구를 호출할 수 있나요?

네. 현재 음성-음성 API는 사용자 정의 함수, 파일 검색, 웹 검색, X 검색 및 원격 MCP 도구를 지원합니다.

Think Fast 2.0은 고객 지원에만 사용되나요?

아니요. 고객 지원과 판매는 대표적인 사용 사례이지만, 이 모델은 예약 서비스, 기업 비서 및 인터랙티브 애플리케이션과 같은 다른 실시간 음성 상담원 워크플로에도 사용할 수 있습니다.

관련 도구

관련 링크

요약

Grok Voice Think Fast 2.0은 프로덕션급 에이전트에서 가장 중요한 영역인 에이전트 작업 완료도, 대화 역동성, 전사 정확도 및 지연 시간 측면에서 xAI의 실시간 음성 기술 스택을 향상시켰습니다.

이 모델은 Artificial Analysis 음성-음성 품질 지수에서 82.9%, τ-voice 점수 56.5%, 첫 오디오 응답 시간 0.70초를 기록했습니다. xAI는 또한 이 모델이 24개 언어에 대한 전사 성능이 개선되었고, 추론 효율성이 높아져 음성 응답 내에서 도구 호출을 더 일찍 실행할 수 있다고 보고했습니다.

개발자는 현재 이 모델을 오디오 1분당 0.08달러의 가격으로 사용할 수 있습니다. 기존

사용자는 grok-voice-latest가 2026년 8월 5일에 Think Fast 1.0에서 Think Fast 2.0으로 자동 전환될 예정임에 유의해야 합니다.

이번 업그레이드는 단순히 더 똑똑한 음성 모델이 아니라, 더 낮은 지연 시간으로 듣고, 추론하고, 대화하고, 도구를 호출할 수 있는 더 프로덕션 중심의 에이전트입니다.