<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ko/audio-api/index.html -->

# 오디오 API : 이해 및 음성 간 변환 구성 요소

> 모든 음성 모델을 서로 바꿔 쓸 수 있는 것으로 취급하지 말고, 검증된 오디오 이해, ASR 및 TTS 엔드포인트 모드를 사용하십시오.

- Canonical page: https://chinaapi.ai/ko/audio-api/
- Human-readable page: https://chinaapi.ai/ko/audio-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=ko&utm_source=chinaapi&utm_medium=markdown&utm_campaign=audio-api

모든 음성 모델을 서로 바꿔 쓸 수 있는 것으로 취급하지 말고, 검증된 오디오 이해, ASR 및 TTS 엔드포인트 모드를 사용하십시오.

[시도해 보세요 stepaudio-2-asr-pro](https://dash.chinaapi.ai/start?task=video-with-audio&model=stepaudio-2-asr-pro&lang=ko&utm_source=chinaapi&utm_medium=capability&utm_campaign=audio-api)

[요청을 생성하세요](https://chinaapi.ai/tools/api-request-generator/)

## 입력, 출력 및 수명 주기.

### 입력값

이해/전사를 위한 오디오 또는 합성을 위한 텍스트는 선택한 모델의 정확한 api_mode 값을 사용합니다.

### 출력

텍스트 분석/전사본 또는 생성된 오디오입니다. 카탈로그 메타데이터에 명시되지 않는 한 직접적인 음성 대 음성 변환 결과는 포함되지 않습니다.

### 엔드포인트

`Model-specific: /v1/chat/completions, /v1/audio/transcriptions, or /v1/audio/speech`

### 생명주기

나열된 오디오 엔드포인트는 동기식입니다. 음성 대 음성 워크플로는 전사 또는 오디오 이해를 별도 TTS 요청에 연결합니다.

## 작업당 하나의 정의만 허용됩니다.

오디오 이해

**한계:** TTS 또는 ASR 표시는 직접적인 오디오 이해, 음성 복제, 화자 분리 또는 음성 간 변환 지원을 증명하는 것이 아닙니다.

## 명시적인 메타데이터를 포함하는 14 .

알려지지 않은 기능은 모델명으로 추측하지 않고 생략합니다. 가격 예시는 동기화된 공개 데이터를 사용하며, 실시간 Dash 가격 정보가 가장 중요합니다.

### [stepaudio-2-asr-pro](https://chinaapi.ai/ko/models/stepaudio-2-asr-pro/)

StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 라인에서 정확도 우선 옵션이며 stepaudio-2.5-asr는 속도·비용 우선 옵션입니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.

**작업:** 음성 포함 비디오, 텍스트 변환

**엔드포인트:** `POST /v1/audio/transcriptions`

**비용 예시:** 1 오디오 시간 × $0.35 = $0.35 .

### [step-asr](https://chinaapi.ai/ko/models/step-asr/)

StepFun step-asr — 중국어, 영어, 중국어 방언을 아우르는 범용 음성 인식. 전사, 회의록, 통화 품질 검토, 음성 검색에 사용합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.

**작업:** 음성 포함 비디오, 텍스트 변환

**엔드포인트:** `POST /v1/audio/transcriptions`

**비용 예시:** 1 오디오 시간 × $0.15 = $0.15 .

### [step-asr-1.1](https://chinaapi.ai/ko/models/step-asr-1.1/)

StepFun step-asr-1.1 — step-asr 라인의 범용 인식 모델을 갱신한 버전으로, 중국어, 영어, 중국어 방언을 지원합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.

**작업:** 음성 포함 비디오, 텍스트 변환

**엔드포인트:** `POST /v1/audio/transcriptions`

**비용 예시:** 1 오디오 시간 × $0.35 = $0.35 .

### [mimo-v2.5-asr](https://chinaapi.ai/ko/models/mimo-v2.5-asr/)

Xiaomi MiMo-V2.5-ASR — 중국어, 영어, 코드 스위칭, 지역 방언, 잡음이 섞인 녹음, 원거리 오디오, 다중 화자 및 가사에 대한 음성 인식 기능을 제공합니다.

**작업:** 음성 포함 비디오, 텍스트 변환

**엔드포인트:** `POST /v1/chat/completions`

**비용 예시:** 1 오디오 시간 × $0.074 = $0.074 .

### [mimo-v2.5-tts](https://chinaapi.ai/ko/models/mimo-v2.5-tts/)

Xiaomi 내장 음성, 자연어 스타일의 지시, 감정, 속도, 어조, 방언 및 문자 제어 MiMo-V2.5-TTS 을 갖춘 표현력 풍부한 다국어 음성 합성 기능.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/chat/completions`

**비용 예시:** 1 10k 문자 × $0 = $0 .

### [stepaudio-2.5-tts](https://chinaapi.ai/ko/models/stepaudio-2.5-tts/)

StepAudio 인라인 자연어 지시, 표현력 있는 전달, 내장 음성 및 OpenAI-compatible 출력 2.5 갖춘 TTS 기반 음성 합성.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.85k 문자 × $0.85 = $0.85 .

### [glm-tts](https://chinaapi.ai/ko/models/glm-tts/)

GLM-TTS 상황 인식 음성 합성, 표현력 있는 전달, 스트리밍 출력, 빠른 초기 오디오 재생, 음성, 속도 및 볼륨 제어 기능을 제공합니다.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.307692k 문자 × $0.307692 = $0.307692 .

### [qwen3-asr-flash](https://chinaapi.ai/ko/models/qwen3-asr-flash/)

Qwen3-ASR-Flash — 언어 힌트, 역텍스트 정규화, 감정 인식 및 OpenAI-compatible 오디오 입력을 지원하는 다국어 파일 전사 기능입니다.

**작업:** 음성 포함 비디오, 텍스트 변환

**엔드포인트:** `POST /v1/audio/transcriptions`

**비용 예시:** 1 오디오 시간 × $0.123539 = $0.123539 .

### [qwen3-tts-flash](https://chinaapi.ai/ko/models/qwen3-tts-flash/)

Qwen3-TTS-Flash 저지연 다국어 음성 합성, 혼합 언어 입력, 내장 음성, 자동 언어 매칭 및 문자 기반 청구 기능을 제공합니다.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.123077k 문자 × $0.123077 = $0.123077 .

### [speech-2.8-hd](https://chinaapi.ai/ko/models/speech-2.8-hd/)

MiniMax Speech 2.8 HD — 자연스러운 감정 전달, 언어 향상, 음성 제어 및 프로덕션 오디오 형식을 지원하는 고음질 음성 합성 기능입니다.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.538462k 문자 × $0.538462 = $0.538462 .

### [speech-2.8-turbo](https://chinaapi.ai/ko/models/speech-2.8-turbo/)

MiniMax 2.8 — 자연스러운 출력, 감정 제어, 언어 향상 및 일반적인 프로덕션 오디오 형식을 지원하는 속도 중심의 음성 합성 기능입니다.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.307692k 문자 × $0.307692 = $0.307692 .

### [step-tts-2](https://chinaapi.ai/ko/models/step-tts-2/)

단계 TTS 2 — 공식 음성 및 복제 음성을 사용한 표현력 있는 음성 합성, 속도 및 음량 조절, 발음 매핑, 다양한 출력 형식 지원.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.4k 문자 × $0.4 = $0.4 .

### [step-tts-mini](https://chinaapi.ai/ko/models/step-tts-mini/)

Step TTS — 중국어, 영어, 일본어, 광둥어, 쓰촨어에 대한 비용 효율적이고 표현력 있는 음성 합성 솔루션으로, 공식 음성 및 복제 음성을 제공합니다.

**작업:** 비디오(음성 포함), 텍스트 음성 변환

**엔드포인트:** `POST /v1/audio/speech`

**비용 예시:** 1 10.15k 문자 × $0.15 = $0.15 .

### [stepaudio-2.5-asr](https://chinaapi.ai/ko/models/stepaudio-2.5-asr/)

StepAudio 2.5 ASR — 빠른 중국어-영어 인식, ITN 정규화, 자막, 회의 및 음성 에이전트를 위한 4B MTP 스트리밍 전사 모델.

**작업:** 음성 포함 비디오, 텍스트 변환

**엔드포인트:** `POST /v1/audio/transcriptions`

**비용 예시:** 1 오디오 시간 × $0.022 = $0.022 .

## 등록 전에 미리 실행해 보거나 예상 비용을 계산해 보세요.

[비용 API 계산하세요](https://chinaapi.ai/tools/api-cost-calculator/) · [curl, Python 또는 JavaScript를 생성합니다.](https://chinaapi.ai/tools/api-request-generator/) · [Seedance 레시피 2 설치하세요](https://chinaapi.ai/agent-recipes/seedance-2/)

출처 및 방법: [공개 모델 가격 데이터 세트](https://chinaapi.ai/ko/data/model-pricing/)업데이트됨 2026-08-08 . 제한 사항은 위에 명시되어 있으며, 제3자 주장은 해당 주장을 인용한 모델 페이지 옆에 그대로 남아 있습니다.

---

Markdown twin of https://chinaapi.ai/ko/audio-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
