입력값
텍스트와 내장 음성 또는 명시적으로 지원되는 음성 디자인/복제 제어 기능이 포함되어 있습니다.
오디오-음성 기능 센터
엔드포인트, 음성 제어, 요금 단위, 출력 워크플로 및 실행 가능한 음성 요청을 기준으로 TTS 을 비교하십시오.
계약
텍스트와 내장 음성 또는 명시적으로 지원되는 음성 디자인/복제 제어 기능이 포함되어 있습니다.
모델에서 지원하는 형식의 음성 오디오 또는 채팅 응답의 오디오 필드.
POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode
동기식입니다. 바이너리 오디오 응답을 저장하거나 채팅 모드에서 반환된 오디오 필드를 디코딩합니다.
지원되는 작업
텍스트 음성 변환, 음성 복제
한계: 음성 식별, 복제 동의, 언어 지원, 스트리밍, 문자 제한 및 출력 형식은 모델별로 다릅니다.
일치하는 카탈로그
알려지지 않은 기능은 모델명으로 추측하지 않고 생략합니다. 가격 예시는 동기화된 공개 데이터를 사용하며, 실시간 Dash 가격 정보가 가장 중요합니다.
Xiaomi 내장 음성, 자연어 스타일의 지시, 감정, 속도, 어조, 방언 및 문자 제어 MiMo-V2.5-TTS 을 갖춘 표현력 풍부한 다국어 음성 합성 기능.
작업: 텍스트 음성 변환
엔드포인트: POST /v1/chat/completions
비용 예시: 1 10k 문자 × $0 = $0.
StepAudio 인라인 자연어 지시, 표현력 있는 전달, 내장 음성 및 OpenAI-compatible 출력 2.5 갖춘 TTS 기반 음성 합성.
작업: 텍스트 음성 변환, 음성 복제
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.85k 문자 × $0.85 = $0.85.
GLM-TTS 상황 인식 음성 합성, 표현력 있는 전달, 스트리밍 출력, 빠른 초기 오디오 재생, 음성, 속도 및 볼륨 제어 기능을 제공합니다.
작업: 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.15k 문자 × $0.35 = $0.35.
Qwen3-TTS-Flash 저지연 다국어 음성 합성, 혼합 언어 입력, 내장 음성, 자동 언어 매칭 및 문자 기반 청구 기능을 제공합니다.
작업: 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.4k 문자 × $0.11 = $0.11.
MiniMax Speech 2.8 HD — 자연스러운 감정 전달, 언어 향상, 음성 제어 및 프로덕션 오디오 형식을 지원하는 고음질 음성 합성 기능입니다.
작업: 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.123077k 문자 × $1 = $1.
MiniMax 2.8 — 자연스러운 출력, 감정 제어, 언어 향상 및 일반적인 프로덕션 오디오 형식을 지원하는 속도 중심의 음성 합성 기능입니다.
작업: 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.307692k 문자 × $0.6 = $0.6.
단계 TTS 2 — 공식 음성 및 복제 음성을 사용한 표현력 있는 음성 합성, 속도 및 음량 조절, 발음 매핑, 다양한 출력 형식 지원.
작업: 텍스트 음성 변환, 음성 복제
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.538462k 문자 × $0.414815 = $0.414815.
API 비용 계산 · curl, Python 또는 JavaScript 요청 생성
출처 및 방법: 공개 모델 가격 데이터 세트, 2026-09-28 업데이트. 제한 사항은 위에 적었으며, 제3자 주장은 이를 인용하는 모델 페이지 옆에 그대로 둡니다.