centro de capacidade de áudio e fala

Texto para fala API : vozes, controle e saída de áudio

Compare TTS modelos por ponto de extremidade, controles de voz, unidade de faturamento, fluxo de trabalho de saída e uma solicitação de fala executável.

Contrato

Entradas, saídas e ciclo de vida.

Entradas

Texto, além de uma voz integrada ou controles de design/clonagem de voz explicitamente suportados.

Saídas

Áudio de voz em um formato compatível com o modelo ou um campo de áudio na resposta do chat.

Ponto final

POST /v1/audio/speech or POST /v1/chat/completions, according to api_mode

Vida útil

Síncrono. Salve a resposta de áudio binária ou decodifique o campo de áudio retornado pelo modo de bate-papo.

Tarefas suportadas

Uma definição por tarefa.

conversão de texto em fala, clonagem de voz, design de voz

Limite: Identificações de voz, consentimento para clonagem, cobertura de idiomas, streaming, limites de caracteres e formatos de saída são específicos de cada modelo.

Catálogo correspondente

8 com metadados explícitos.

Funcionalidades desconhecidas são omitidas, nunca inferidas a partir do nome do modelo. Os exemplos de preços utilizam os dados públicos sincronizados; o Dash Pricing em tempo real continua sendo a fonte oficial.

mimo-v2.5-tts

Xiaomi MiMo-V2.5-TTS — síntese de fala multilíngue expressiva com vozes integradas, instruções de estilo de linguagem natural, controle de emoção, ritmo, tom, dialeto e caracteres.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/chat/completions

Exemplo de custo: 1 10k caracteres × $0 = $0 .

stepaudio-2.5-tts

StepAudio 2.5 TTS — síntese de fala contextual com direção de linguagem natural embutida, entrega expressiva, vozes integradas e saída de OpenAI-compatible .

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.85k caracteres × $0.85 = $0.85 .

glm-tts

GLM-TTS síntese de fala sensível ao contexto com entrega expressiva, saída em fluxo contínuo, áudio inicial rápido e controles de voz, velocidade e volume.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .

qwen3-tts-flash

Qwen3-TTS-Flash Síntese de fala multilíngue de baixa latência com entrada em idiomas mistos, vozes integradas, correspondência automática de idiomas e cobrança baseada em caracteres.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.123077k caracteres × $0.123077 = $0.123077 .

speech-2.8-hd

MiniMax Speech 2.8 HD — síntese de fala de alta fidelidade com entrega emocional natural, aprimoramento de linguagem, controles de voz e formatos de áudio de produção.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.538462k caracteres × $0.538462 = $0.538462 .

speech-2.8-turbo

MiniMax Fala 2.8 Turbo — síntese de fala focada na velocidade com saída natural, controles de emoção, aprimoramento de linguagem e formatos de áudio de produção comuns.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.307692k caracteres × $0.307692 = $0.307692 .

step-tts-2

Etapa TTS 2 — síntese de fala expressiva com vozes oficiais e clonadas, controle de velocidade e volume, mapeamento de pronúncia e múltiplos formatos de saída.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.4k caracteres × $0.4 = $0.4 .

step-tts-mini

Step TTS — síntese de fala expressiva e econômica para chinês, inglês, japonês, cantonês e sichuanês, com vozes oficiais e clonadas.

Tarefas: vídeo com áudio, texto para fala

Ponto final: POST /v1/audio/speech

Exemplo de custo: 1 10.15k caracteres × $0.15 = $0.15 .

Faça um orçamento ou uma estimativa antes de se inscrever.

Calcular o custo API · Gere um script curl, em Python ou JavaScript. · Instale a receita do Agente Seedance 2

Fonte e método: conjunto de dados de precificação de modelos públicos, atualizado 2026-08-08 . As limitações estão indicadas acima; as reivindicações de terceiros permanecem junto às páginas do modelo que as citam.