입력값
이해/전사를 위한 오디오 또는 합성을 위한 텍스트는 선택한 모델의 정확한 api_mode 값을 사용합니다.
오디오-음성 기능 센터
모든 음성 모델을 서로 바꿔 쓸 수 있는 것으로 취급하지 말고, 검증된 오디오 이해, ASR 및 TTS 엔드포인트 모드를 사용하십시오.
계약
이해/전사를 위한 오디오 또는 합성을 위한 텍스트는 선택한 모델의 정확한 api_mode 값을 사용합니다.
텍스트 분석/전사본 또는 생성된 오디오입니다. 카탈로그 메타데이터에 명시되지 않는 한 직접적인 음성 대 음성 변환 결과는 포함되지 않습니다.
Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech
나열된 오디오 엔드포인트는 동기식입니다. 음성 대 음성 워크플로는 전사 또는 오디오 이해를 별도 TTS 요청에 연결합니다.
지원되는 작업
오디오 이해
한계: TTS 또는 ASR 표시는 직접적인 오디오 이해, 음성 복제, 화자 분리 또는 음성 간 변환 지원을 증명하는 것이 아닙니다.
일치하는 카탈로그
알려지지 않은 기능은 모델명으로 추측하지 않고 생략합니다. 가격 예시는 동기화된 공개 데이터를 사용하며, 실시간 Dash 가격 정보가 가장 중요합니다.
StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 라인에서 정확도 우선 옵션이며 stepaudio-2.5-asr는 속도·비용 우선 옵션입니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.35 = $0.35 .
StepFun step-asr — 중국어, 영어, 중국어 방언을 아우르는 범용 음성 인식. 전사, 회의록, 통화 품질 검토, 음성 검색에 사용합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.15 = $0.15 .
StepFun step-asr-1.1 — step-asr 라인의 범용 인식 모델을 갱신한 버전으로, 중국어, 영어, 중국어 방언을 지원합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.35 = $0.35 .
Xiaomi MiMo-V2.5-ASR — 중국어, 영어, 코드 스위칭, 지역 방언, 잡음이 섞인 녹음, 원거리 오디오, 다중 화자 및 가사에 대한 음성 인식 기능을 제공합니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/chat/completions
비용 예시: 1 오디오 시간 × $0.074 = $0.074 .
Xiaomi 내장 음성, 자연어 스타일의 지시, 감정, 속도, 어조, 방언 및 문자 제어 MiMo-V2.5-TTS 을 갖춘 표현력 풍부한 다국어 음성 합성 기능.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/chat/completions
비용 예시: 1 10k 문자 × $0 = $0 .
StepAudio 인라인 자연어 지시, 표현력 있는 전달, 내장 음성 및 OpenAI-compatible 출력 2.5 갖춘 TTS 기반 음성 합성.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.85k 문자 × $0.85 = $0.85 .
GLM-TTS 상황 인식 음성 합성, 표현력 있는 전달, 스트리밍 출력, 빠른 초기 오디오 재생, 음성, 속도 및 볼륨 제어 기능을 제공합니다.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.307692k 문자 × $0.307692 = $0.307692 .
Qwen3-ASR-Flash — 언어 힌트, 역텍스트 정규화, 감정 인식 및 OpenAI-compatible 오디오 입력을 지원하는 다국어 파일 전사 기능입니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.123539 = $0.123539 .
Qwen3-TTS-Flash 저지연 다국어 음성 합성, 혼합 언어 입력, 내장 음성, 자동 언어 매칭 및 문자 기반 청구 기능을 제공합니다.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.123077k 문자 × $0.123077 = $0.123077 .
MiniMax Speech 2.8 HD — 자연스러운 감정 전달, 언어 향상, 음성 제어 및 프로덕션 오디오 형식을 지원하는 고음질 음성 합성 기능입니다.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.538462k 문자 × $0.538462 = $0.538462 .
MiniMax 2.8 — 자연스러운 출력, 감정 제어, 언어 향상 및 일반적인 프로덕션 오디오 형식을 지원하는 속도 중심의 음성 합성 기능입니다.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.307692k 문자 × $0.307692 = $0.307692 .
단계 TTS 2 — 공식 음성 및 복제 음성을 사용한 표현력 있는 음성 합성, 속도 및 음량 조절, 발음 매핑, 다양한 출력 형식 지원.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.4k 문자 × $0.4 = $0.4 .
Step TTS — 중국어, 영어, 일본어, 광둥어, 쓰촨어에 대한 비용 효율적이고 표현력 있는 음성 합성 솔루션으로, 공식 음성 및 복제 음성을 제공합니다.
작업: 비디오(음성 포함), 텍스트 음성 변환
엔드포인트: POST /v1/audio/speech
비용 예시: 1 10.15k 문자 × $0.15 = $0.15 .
StepAudio 2.5 ASR — 빠른 중국어-영어 인식, ITN 정규화, 자막, 회의 및 음성 에이전트를 위한 4B MTP 스트리밍 전사 모델.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.022 = $0.022 .
비용 API 계산하세요 · curl, Python 또는 JavaScript를 생성합니다. · Seedance 레시피 2 설치하세요
출처 및 방법: 공개 모델 가격 데이터 세트업데이트됨 2026-08-08 . 제한 사항은 위에 명시되어 있으며, 제3자 주장은 해당 주장을 인용한 모델 페이지 옆에 그대로 남아 있습니다.