입력값
모델의 api_mode 에 따라 오디오 파일 또는 베이스; 64 input_audio 페이로드.
오디오-음성 기능 센터
정확한 엔드포인트 모드, 오디오 시간당 가격, 입력, 전사본 출력 및 제한 사항을 기준으로 전사 모델과 ASR 모델을 비교하십시오.
계약
모델의 api_mode 에 따라 오디오 파일 또는 베이스; 64 input_audio 페이로드.
녹취록 텍스트 또는 구조화된 녹취록 응답.
POST /v1/audio/transcriptions or POST /v1/chat/completions with input_audio, according to api_mode
나열된 공개 엔드포인트 모드에 대해 동기식으로 작동합니다. 기록을 저장하고 거부된 파일 형식을 명시적으로 처리합니다.
지원되는 작업
전사
한계: 파일 크기, 재생 시간, 화자 구분, 타임스탬프, 방언 지원 범위 및 허용되는 형식은 모델에 명시적으로 나열되지 않는 한 알 수 없습니다.
일치하는 카탈로그
알려지지 않은 기능은 모델명으로 추측하지 않고 생략합니다. 가격 예시는 동기화된 공개 데이터를 사용하며, 실시간 Dash 가격 정보가 가장 중요합니다.
StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 라인에서 정확도 우선 옵션이며 stepaudio-2.5-asr는 속도·비용 우선 옵션입니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.35 = $0.35 .
StepFun step-asr — 중국어, 영어, 중국어 방언을 아우르는 범용 음성 인식. 전사, 회의록, 통화 품질 검토, 음성 검색에 사용합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.15 = $0.15 .
StepFun step-asr-1.1 — step-asr 라인의 범용 인식 모델을 갱신한 버전으로, 중국어, 영어, 중국어 방언을 지원합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.35 = $0.35 .
Xiaomi MiMo-V2.5-ASR — 중국어, 영어, 코드 스위칭, 지역 방언, 잡음이 섞인 녹음, 원거리 오디오, 다중 화자 및 가사에 대한 음성 인식 기능을 제공합니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/chat/completions
비용 예시: 1 오디오 시간 × $0.074 = $0.074 .
Qwen3-ASR-Flash — 언어 힌트, 역텍스트 정규화, 감정 인식 및 OpenAI-compatible 오디오 입력을 지원하는 다국어 파일 전사 기능입니다.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.123539 = $0.123539 .
StepAudio 2.5 ASR — 빠른 중국어-영어 인식, ITN 정규화, 자막, 회의 및 음성 에이전트를 위한 4B MTP 스트리밍 전사 모델.
작업: 음성 포함 비디오, 텍스트 변환
엔드포인트: POST /v1/audio/transcriptions
비용 예시: 1 오디오 시간 × $0.022 = $0.022 .
비용 API 계산하세요 · curl, Python 또는 JavaScript를 생성합니다. · Seedance 레시피 2 설치하세요
출처 및 방법: 공개 모델 가격 데이터 세트업데이트됨 2026-08-08 . 제한 사항은 위에 명시되어 있으며, 제3자 주장은 해당 주장을 인용한 모델 페이지 옆에 그대로 남아 있습니다.