Entradas
Texto, além de uma voz integrada ou controles de design/clonagem de voz explicitamente suportados.
centro de capacidade de áudio e fala
Compare TTS modelos por ponto de extremidade, controles de voz, unidade de faturamento, fluxo de trabalho de saída e uma solicitação de fala executável.
Contrato
Texto, além de uma voz integrada ou controles de design/clonagem de voz explicitamente suportados.
Áudio de voz em um formato compatível com o modelo ou um campo de áudio na resposta do chat.
POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode
Síncrono. Salve a resposta de áudio binária ou decodifique o campo de áudio retornado pelo modo de bate-papo.
Tarefas suportadas
conversão de texto em fala, clonagem de voz, design de voz
Limite: Identificações de voz, consentimento para clonagem, cobertura de idiomas, streaming, limites de caracteres e formatos de saída são específicos de cada modelo.
Catálogo correspondente
Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.
Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/chat/completions
Exemplo de custo: 1 10k caracteres × $0 = $0 .
StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.85k caracteres × $0.85 = $0.85 .
GLM-TTS síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .
Qwen3-TTS-Flash Síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.123077k caracteres × $0.123077 = $0.123077 .
MiniMax Speech 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.538462k caracteres × $0.538462 = $0.538462 .
MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .
Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.4k caracteres × $0.4 = $0.4 .
Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.
Tarefas: vídeo com áudio, texto para fala
Ponto final: POST /v1/audio/speech
Exemplo de custo: 1 10.15k caracteres × $0.15 = $0.15 .
Calcular o custo API · Gere um script curl, em Python ou JavaScript. · Instale a receita do Agente Seedance 2
Fonte e método: conjunto de dados de precificação de modelos públicos, atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.