오디오-음성 기능 센터

텍스트 음성 변환 API : 음성, 제어 및 오디오 출력

엔드포인트, 음성 제어, 요금 단위, 출력 워크플로 및 실행 가능한 음성 요청을 기준으로 TTS 을 비교하십시오.

계약

입력, 출력 및 수명 주기.

입력값

텍스트와 내장 음성 또는 명시적으로 지원되는 음성 디자인/복제 제어 기능이 포함되어 있습니다.

출력

모델에서 지원하는 형식의 음성 오디오 또는 채팅 응답의 오디오 필드.

엔드포인트

POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode

생명주기

동기식입니다. 바이너리 오디오 응답을 저장하거나 채팅 모드에서 반환된 오디오 필드를 디코딩합니다.

지원되는 작업

작업당 하나의 정의만 허용됩니다.

텍스트 음성 변환, 음성 복제, 음성 디자인

한계: 음성 식별, 복제 동의, 언어 지원, 스트리밍, 문자 제한 및 출력 형식은 모델별로 다릅니다.

일치하는 카탈로그

명시적인 메타데이터를 포함하는 8 .

알려지지 않은 기능은 모델명으로 추측하지 않고 생략합니다. 가격 예시는 동기화된 공개 데이터를 사용하며, 실시간 Dash 가격 정보가 가장 중요합니다.

mimo-v2.5-tts

Xiaomi 내장 음성, 자연어 스타일의 지시, 감정, 속도, 어조, 방언 및 문자 제어 MiMo-V2.5-TTS 을 갖춘 표현력 풍부한 다국어 음성 합성 기능.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/chat/completions

비용 예시: 1 10k 문자 × $0 = $0 .

stepaudio-2.5-tts

StepAudio 인라인 자연어 지시, 표현력 있는 전달, 내장 음성 및 OpenAI-compatible 출력 2.5 갖춘 TTS 기반 음성 합성.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.85k 문자 × $0.85 = $0.85 .

glm-tts

GLM-TTS 상황 인식 음성 합성, 표현력 있는 전달, 스트리밍 출력, 빠른 초기 오디오 재생, 음성, 속도 및 볼륨 제어 기능을 제공합니다.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.307692k 문자 × $0.307692 = $0.307692 .

qwen3-tts-flash

Qwen3-TTS-Flash 저지연 다국어 음성 합성, 혼합 언어 입력, 내장 음성, 자동 언어 매칭 및 문자 기반 청구 기능을 제공합니다.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.123077k 문자 × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax Speech 2.8 HD — 자연스러운 감정 전달, 언어 향상, 음성 제어 및 프로덕션 오디오 형식을 지원하는 고음질 음성 합성 기능입니다.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.538462k 문자 × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax 2.8 — 자연스러운 출력, 감정 제어, 언어 향상 및 일반적인 프로덕션 오디오 형식을 지원하는 속도 중심의 음성 합성 기능입니다.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.307692k 문자 × $0.307692 = $0.307692 .

step-tts-2

단계 TTS 2 — 공식 음성 및 복제 음성을 사용한 표현력 있는 음성 합성, 속도 및 음량 조절, 발음 매핑, 다양한 출력 형식 지원.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.4k 문자 × $0.4 = $0.4 .

step-tts-mini

Step TTS — 중국어, 영어, 일본어, 광둥어, 쓰촨어에 대한 비용 효율적이고 표현력 있는 음성 합성 솔루션으로, 공식 음성 및 복제 음성을 제공합니다.

작업: 비디오(음성 포함), 텍스트 음성 변환

엔드포인트: POST /v1/audio/speech

비용 예시: 1 10.15k 문자 × $0.15 = $0.15 .

등록 전에 미리 실행해 보거나 예상 비용을 계산해 보세요.

비용 API 계산하세요 · curl, Python 또는 JavaScript를 생성합니다. · Seedance 레시피 2 설치하세요

출처 및 방법: 공개 모델 가격 데이터 세트업데이트됨 2026-08-08 . 제한 사항은 위에 명시되어 있으며, 제3자 주장은 해당 주장을 인용한 모델 페이지 옆에 그대로 남아 있습니다.