simoori.AI·IT 소식에서 신호만 골라 훑는 곳
피드로

알리바바, ‘큐원-오디오-3.1’ 공개...최대 95% 가격 파괴

AI타임스 · 24일 오후 · 분야 AI 모델 · 분야 음성 · 사건종류 출시

signal 포인트

출처가 준 요약

알리바바가 고비용 구조에 머물러 있던 글로벌 오디오 API 시장의 판도를 흔들고, 중국 내 B2B 음성 에이전트 주도권을 확보하기 위한 본격적인 가격 경쟁에 나섰다. 오픈AI와 바이트댄스 등에 맞서 파격적인 단가 인하로 개발자 생태계를 조준하겠다는 전략이다.알리바바는 23일(현지시간) 음성인식(ASR)과 음성합성(TTS), 실시간 대화 기능을 강화하고 오디오 이해 및 디퓨전 기반 생성 모델을 새롭게 추가한 ‘큐원-오디오-3.1(Qwen-Audio-3.1)’ 시리즈 5종을 공개했다.이번 모델을 AI 안경과 데스크톱 로봇 '에바', 오

출처가 제공한 소개글입니다. 자세한 내용은 원문을 읽어주세요.

원문 보기 (한국어)

아래는 출처에서 가져온 원문입니다.

(사진=알리바바)

(사진=알리바바)

알리바바가 고비용 구조에 머물러 있던 글로벌 오디오 API 시장의 판도를 흔들고, 중국 내 B2B 음성 에이전트 주도권을 확보하기 위한 본격적인 가격 경쟁에 나섰다. 오픈AI와 바이트댄스 등에 맞서 파격적인 단가 인하로 개발자 생태계를 조준하겠다는 전략이다.

알리바바는 23일(현지시간) 음성인식(ASR)과 음성합성(TTS), 실시간 대화 기능을 강화하고 오디오 이해 및 디퓨전 기반 생성 모델을 새롭게 추가한 ‘큐원-오디오-3.1(Qwen-Audio-3.1)’ 시리즈 5종을 공개했다.

이번 모델을 AI 안경과 데스크톱 로봇 '에바', 오피스·코딩 에이전트 서비스인 '큐원 워크'와 '쿼더' 등 자사 하드웨어 및 에코시스템 전반과 연동해 온디바이스 시장으로 적용 범위를 넓힐 방침이다.

이번 신제품은 단순 성우 목소리 합성에 그치던 기존 모델과 달리 효과음과 배경음까지 한 번에 합성하는 오디오 종합 생성 영역을 개척한 것이 특징이다. 텍스트-음성 변환을 넘어 '오디오 종합 이해와 생성' 능력을 내세웠다.

우선, ‘ASR-넥스트’는 단순히 소리를 글자로 옮기는 데 그치지 않고, 복수 화자의 발화 타임스탬프 구분, 감정 상태, 주변 환경음, 기계음까지 통합 분석한다. 특정 소리의 발생 시점을 정확히 찾아내거나 오디오 콘텐츠 내용에 대한 질문에 답하는 기능도 갖췄다.

‘TTS-넥스트’는 단순 성우 목소리 출력을 넘어 대화, 효과음, 배경음이 한데 어우러진 완성형 음향 환경을 단 한 번의 프로세스로 연출하는 단계까지 확장했다. 언어 모델과 디퓨전 방식을 결합해 화자의 목소리는 물론 효과음과 배경음까지 한 번에 생성한다. 오디오북, 팟캐스트, 게임, 영상 등 대화와 음향 효과가 결합된 콘텐츠 제작에 최적화됐다.

기존 모델들의 스펙도 대폭 강화됐다. ‘큐원-오디오-3.1-ASR’은 30개 언어와 16개 중국어 방언을 지원하며, 음성 내 불필요한 추임새나 중복 표현을 자동으로 제거해 깔끔한 문장으로 정리한다. 저지연 스트리밍 환경에서 첫 문자 응답 시간은 160밀리초(ms)를 달성했다.

‘큐원-오디오-3.1-TTS’는 16개 언어 및 20개 중국 지역 방언을 지원하며, 한 목소리 톤을 타 언어에서도 유지하는 크로스랭귀지 합성을 제공한다. 자연어 지시로 감정, 속도, 말투 조절이 가능하며 웃음, 호흡, 기침 등 86개 세부 태그 표현을 지원해 아티피셜 애널리시스 TTS 리더보드 1위에 올랐다.

아티피셜 애널리시스 TTS 리더보드 (사진=아티피셜 애널리시스)

아티피셜 애널리시스 TTS 리더보드 (사진=아티피셜 애널리시스)

실시간 음성 대화 모델인 ‘큐원-오디오-3.1-리얼타임’은 전화 통화와 같은 전이중(full-duplex) 대화를 지원해 사용자 개입(끼어들기)에 실시간 반응한다. 다자간 대화 시 맥락에 맞춰 응답 타이밍을 판단하고, 사용자 감정 상태에 맞춰 말하는 속도를 조절하는 기능과 외부 도구(API) 호출 능력까지 탑재했다.

알리바바는 대대적인 성능 향상과 더불어 TTS 가격은 70%, 리얼타임은 85%, ASR은 최대 95% 인하했다. 이로 인해 큐원-오디오-3.1-ASR의 입력 단가는 100만 토큰당 0.8위안(약 150원) 수준까지 떨어졌다.

이는 기존 글로벌 주요 음성 API 서비스 단가 대비 몇분의 1에 불과한 가격대로, 개발자와 기업들의 초기 도입 및 운용 비용 부담을 대폭 낮출 전망이다.

박찬 기자 cpark@aitimes.com

원문의 저작권은 출처에 있습니다.출처에서 원문 보기 새 창에서 열림