<!-- GENERATED BY scripts/gen_localization_release.py; DO NOT EDIT; source: ko/speech-api/index.html -->

# 중국어 음성 인식(ASR) 및 텍스트 음성 변환(TTS) API.

> ChinaAPI를 통해 14 중국어 음성 API 모델을 사용하여 자동 음성 인식(ASR) 및 텍스트 음성 변환을 구현하세요. 정확한 엔드포인트, 요금 단위, 미국 달러 가격, 기능 및 복사 붙여넣기 요청을 비교해 보세요.

- Canonical page: https://chinaapi.ai/ko/speech-api/
- Human-readable page: https://chinaapi.ai/ko/speech-api/
- Live pricing: https://dash.chinaapi.ai/pricing?lang=ko&utm_source=chinaapi&utm_medium=markdown&utm_campaign=speech-api

하나의 ChinaAPI key 로 이용할 수 있는 음성 인식·음성 합성 모델을 비교하세요. 각 모델은 실제 요청 경로를 그대로 사용합니다. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini 는 /v1/audio/speech 를 사용합니다. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr 는 /v1/audio/transcriptions 를 사용합니다. mimo-v2.5-asr 와 mimo-v2.5-tts 는 모델별 오디오 페이로드와 함께 /v1/chat/completions 를 사용합니다.

[무료로 시작하세요 — $2 크레딧](https://dash.chinaapi.ai/register?lang=ko&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

[실시간 가격 보기](https://dash.chinaapi.ai/pricing?lang=ko&utm_source=chinaapi&utm_medium=speech&utm_campaign=speech-api)

## 하나의 데이터 소스에서 생성된 14 음성 모델.

엔드포인트 모드, 청구 단위, 기능 및 표시 가격은 다음에서 가져옵니다 Model IDs `scripts/models-data.json`오디오 가격은 ChinaAPI 를 통해 정산됩니다. 표시된 미디어 요금에는 제공업체 입력/출력 청구, 결제 처리, 차지백 위험 및 운영을 포함하는 서비스 마진이 포함될 수 있습니다. 모든 마진은 표시된 요금에 포함되어 있으며 별도로 추가되지 않습니다. 프로덕션 배포 전에 실시간 가격을 확인하십시오.

### [stepaudio-2-asr-pro](https://chinaapi.ai/ko/models/stepaudio-2-asr-pro/)

음성 인식(ASR) · StepFun

**엔드포인트:** `게시글 /v1/audio/transcriptions`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 오디오 1시간당 $0.35

Audio Speech-to-Text

### [step-asr](https://chinaapi.ai/ko/models/step-asr/)

음성 인식(ASR) · StepFun

**엔드포인트:** `게시글 /v1/audio/transcriptions`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 오디오 1시간당 $0.15

Audio Speech-to-Text Chinese Dialects

### [step-asr-1.1](https://chinaapi.ai/ko/models/step-asr-1.1/)

음성 인식(ASR) · StepFun

**엔드포인트:** `게시글 /v1/audio/transcriptions`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 오디오 1시간당 $0.35

Audio Speech-to-Text Chinese Dialects

### [mimo-v2.5-asr](https://chinaapi.ai/ko/models/mimo-v2.5-asr/)

음성 인식 ( ASR ) · Xiaomi

**엔드포인트:** `게시글 /v1/chat/completions`

**요청 모드:** input_audio 페이로드를 포함하는 채팅 완료

**청구:** 오디오 1시간당 $0.074

Audio Speech-to-Text Multilingual Chinese Dialects Noise Robustness

### [mimo-v2.5-tts](https://chinaapi.ai/ko/models/mimo-v2.5-tts/)

텍스트 음성 변환 ( TTS ) · Xiaomi

**엔드포인트:** `게시글 /v1/chat/completions`

**요청 모드:** 메시지 자동 완성 기능과 오디오 출력 설정이 포함된 채팅 자동 완성 기능

**청구:** 10k 글자당 $0

기간 한정 무료 업스트림 가격 제공; 실제 서비스 출시 전에 가격을 확인하세요.

Audio Text-to-Speech Multilingual Style Control Built-in Voices

### [stepaudio-2.5-tts](https://chinaapi.ai/ko/models/stepaudio-2.5-tts/)

텍스트 음성 변환(TTS) · StepFun

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.85

Audio Text-to-Speech Contextual TTS Style Control Built-in Voices

### [glm-tts](https://chinaapi.ai/ko/models/glm-tts/)

텍스트 음성 변환(TTS) · Zhipu AI

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.3077

Audio Text-to-Speech Streaming Emotion Voice Control

### [qwen3-asr-flash](https://chinaapi.ai/ko/models/qwen3-asr-flash/)

음성 인식 ( ASR ) · Alibaba

**엔드포인트:** `게시글 /v1/audio/transcriptions`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 오디오 1시간당 $0.1235

Audio Speech-to-Text Multilingual Emotion Recognition ITN

### [qwen3-tts-flash](https://chinaapi.ai/ko/models/qwen3-tts-flash/)

텍스트 음성 변환 ( TTS ) · Alibaba

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.1231

Audio Text-to-Speech Multilingual Built-in Voices Streaming

### [speech-2.8-hd](https://chinaapi.ai/ko/models/speech-2.8-hd/)

텍스트 음성 변환 ( TTS ) · MiniMax

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.5385

Audio Text-to-Speech High Fidelity Emotion Multilingual

### [speech-2.8-turbo](https://chinaapi.ai/ko/models/speech-2.8-turbo/)

텍스트 음성 변환 ( TTS ) · MiniMax

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.3077

Audio Text-to-Speech Low Latency Emotion Multilingual

### [step-tts-2](https://chinaapi.ai/ko/models/step-tts-2/)

텍스트 음성 변환(TTS) · StepFun

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.4

Audio Text-to-Speech Voice Cloning Emotion Pronunciation Control

### [step-tts-mini](https://chinaapi.ai/ko/models/step-tts-mini/)

텍스트 음성 변환(TTS) · StepFun

**엔드포인트:** `게시글 /v1/audio/speech`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 10k 글자당 $0.15

Audio Text-to-Speech Multilingual Voice Cloning Style Control

### [stepaudio-2.5-asr](https://chinaapi.ai/ko/models/stepaudio-2.5-asr/)

음성 인식(ASR) · StepFun

**엔드포인트:** `게시글 /v1/audio/transcriptions`

**요청 모드:** OpenAI-compatible 종료점

**청구:** 오디오 1시간당 $0.022

Audio Speech-to-Text Streaming Chinese and English ITN

## ASR은 음성 이해를, TTS는 음성 출력을 담당합니다.

### 전사 및 음성 이해

[stepaudio-2-asr-pro](https://chinaapi.ai/ko/models/stepaudio-2-asr-pro/): StepFun StepAudio 2 ASR Pro — 32B 파라미터 음성 인식 모델로, StepFun ASR 라인에서 정확도 우선 옵션이며 stepaudio-2.5-asr는 속도·비용 우선 옵션입니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.

### 전사 및 음성 이해

[step-asr](https://chinaapi.ai/ko/models/step-asr/): StepFun step-asr — 중국어, 영어, 중국어 방언을 아우르는 범용 음성 인식. 전사, 회의록, 통화 품질 검토, 음성 검색에 사용합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.

### 전사 및 음성 이해

[step-asr-1.1](https://chinaapi.ai/ko/models/step-asr-1.1/): StepFun step-asr-1.1 — step-asr 라인의 범용 인식 모델을 갱신한 버전으로, 중국어, 영어, 중국어 방언을 지원합니다. ogg, mp3, wav 업로드를 지원하며 전사 출력은 과금되지 않습니다.

### 전사 및 음성 이해

[mimo-v2.5-asr](https://chinaapi.ai/ko/models/mimo-v2.5-asr/): Xiaomi MiMo-V2.5-ASR — 중국어, 영어, 코드 스위칭, 지역 방언, 잡음이 섞인 녹음, 원거리 오디오, 다중 화자 및 가사에 대한 음성 인식 기능을 제공합니다.

### 제어 가능한 음성 출력

[mimo-v2.5-tts](https://chinaapi.ai/ko/models/mimo-v2.5-tts/): Xiaomi MiMo-V2.5-TTS — 내장 음성, 자연어 스타일의 지시, 감정, 속도, 어조, 방언 및 문자 제어 기능을 갖춘 표현력 풍부한 다국어 음성 합성 기능.

### 전용 경로를 통한 음성 출력

[stepaudio-2.5-tts](https://chinaapi.ai/ko/models/stepaudio-2.5-tts/): StepAudio 2.5 TTS — 인라인 자연어 지시, 표현력 있는 전달, 내장 음성 및 OpenAI-compatible 오디오 출력을 갖춘 문맥 기반 음성 합성.

### 전용 경로를 통한 음성 출력

[glm-tts](https://chinaapi.ai/ko/models/glm-tts/): GLM-TTS — 표현력 있는 전달, 스트리밍 출력, 빠른 초기 오디오 재생, 음성, 속도 및 볼륨 제어 기능을 갖춘 상황 인식 음성 합성 기능.

### 전사 및 음성 이해

[qwen3-asr-flash](https://chinaapi.ai/ko/models/qwen3-asr-flash/): Qwen3-ASR-Flash — 언어 힌트, 역텍스트 정규화, 감정 인식 및 OpenAI-compatible 오디오 입력을 지원하는 다국어 파일 전사 기능입니다.

### 전용 경로를 통한 음성 출력

[qwen3-tts-flash](https://chinaapi.ai/ko/models/qwen3-tts-flash/): Qwen3-TTS-Flash — 혼합 언어 입력, 내장 음성, 자동 언어 매칭 및 문자 기반 청구 기능을 갖춘 저지연 다국어 음성 합성.

### 전용 경로를 통한 음성 출력

[speech-2.8-hd](https://chinaapi.ai/ko/models/speech-2.8-hd/): MiniMax Speech 2.8 HD — 자연스러운 감정 전달, 언어 향상, 음성 제어 및 프로덕션 오디오 형식을 지원하는 고음질 음성 합성 기능.

### 전용 경로를 통한 음성 출력

[speech-2.8-turbo](https://chinaapi.ai/ko/models/speech-2.8-turbo/): MiniMax Speech 2.8 Turbo — 자연스러운 출력, 감정 제어, 언어 향상 및 일반적인 프로덕션 오디오 형식을 지원하는 속도 중심의 음성 합성 기능입니다.

### 전용 경로를 통한 음성 출력

[step-tts-2](https://chinaapi.ai/ko/models/step-tts-2/): 단계 TTS 2 — 공식 음성 및 복제 음성을 사용한 표현력 있는 음성 합성, 속도 및 음량 조절, 발음 매핑, 다양한 출력 형식.

### 전용 경로를 통한 음성 출력

[step-tts-mini](https://chinaapi.ai/ko/models/step-tts-mini/)Step TTS — 중국어, 영어, 일본어, 광둥어, 쓰촨어에 대한 비용 효율적이고 표현력 있는 음성 합성 기능으로, 공식 음성 및 복제 음성을 제공합니다.

### 전사 및 음성 이해

[stepaudio-2.5-asr](https://chinaapi.ai/ko/models/stepaudio-2.5-asr/): StepAudio 2.5 ASR — 빠른 중국어-영어 인식, ITN 정규화, 자막, 회의 및 음성 에이전트를 위한 4B MTP 스트리밍 전사 모델.

## OpenAI-compatible 는 하나의 보편적인 오디오 경로를 의미하는 것은 아닙니다.

라우트 이름과 요청 형식은 OpenAI-compatible 패턴을 따르지만, 클라이언트는 각 모델이 요구하는 오디오 필드를 보내야 합니다. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini 는 /v1/audio/speech 를 사용합니다. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr 는 /v1/audio/transcriptions 를 사용합니다. mimo-v2.5-asr 와 mimo-v2.5-tts 는 모델별 오디오 페이로드와 함께 /v1/chat/completions 를 사용합니다.

## 필요한 모델과 운송 방식에 대한 요청서를 복사하세요.

### stepaudio-2-asr-pro

음성 인식( ASR )을 통해 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2-asr-pro" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr

음성 인식( ASR )을 통해 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### step-asr-1.1

음성 인식( ASR )을 통해 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=step-asr-1.1" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### mimo-v2.5-asr

음성 인식( ASR )을 통해 `/v1/chat/completions`

```
AUDIO_BASE64=$(base64 < meeting.wav | tr -d '\n')

curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-asr",
    "messages": [{
      "role": "user",
      "content": [{
        "type": "input_audio",
        "input_audio": {"data": "data:audio/wav;base64,'"$AUDIO_BASE64"'"}
      }]
    }]
  }'
```

### mimo-v2.5-tts

텍스트 음성 변환( TTS )을 통해 `/v1/chat/completions`

```
curl -X POST https://api.chinaapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-tts",
    "messages": [
      {"role": "user", "content": "Natural, clear, and friendly delivery"},
      {"role": "assistant", "content": "Welcome to ChinaAPI. 欢迎使用语音模型。"}
    ],
    "audio": {"format": "wav", "voice": "冰糖"}
  }' > response.json
```

### stepaudio-2.5-tts

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-2.5-tts",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### glm-tts

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-tts",
    "voice": "tongtong",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### qwen3-asr-flash

음성 인식( ASR )을 통해 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=qwen3-asr-flash" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

### qwen3-tts-flash

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "voice": "Cherry",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-hd

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-hd",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### speech-2.8-turbo

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "speech-2.8-turbo",
    "voice": "Chinese (Mandarin)_Warm_Bestie",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-2

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-2",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### step-tts-mini

텍스트 음성 변환( TTS )을 통해 `/v1/audio/speech`

```
curl -X POST https://api.chinaapi.ai/v1/audio/speech \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "step-tts-mini",
    "voice": "cixingnansheng",
    "input": "（轻声）Welcome to ChinaAPI. 今天我们来测试自然语音。",
    "response_format": "mp3"
  }' \
  --output speech.mp3
```

### stepaudio-2.5-asr

음성 인식( ASR )을 통해 `/v1/audio/transcriptions`

```
curl -X POST https://api.chinaapi.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $CHINAAPI_API_KEY" \
  -F "model=stepaudio-2.5-asr" \
  -F "file=@meeting.wav" \
  -F "response_format=json"
```

## 모든 ChinaAPI 음성 모델은 동일한 오디오 엔드포인트를 사용합니까?

No. stepaudio-2.5-tts, glm-tts, qwen3-tts-flash, speech-2.8-hd, speech-2.8-turbo, step-tts-2, step-tts-mini 는 /v1/audio/speech 를 사용합니다. stepaudio-2-asr-pro, step-asr, step-asr-1.1, qwen3-asr-flash, stepaudio-2.5-asr 는 /v1/audio/transcriptions 를 사용합니다. mimo-v2.5-asr 와 mimo-v2.5-tts 는 모델별 오디오 페이로드와 함께 /v1/chat/completions 를 사용합니다.

## 음성 모델은 어떤 방식으로 요금이 청구되나요?

stepaudio-2-asr-pro: 오디오 1시간당 $0.35; step-asr: 오디오 1시간당 $0.15; step-asr-1.1: 오디오 1시간당 $0.35; mimo-v2.5-asr: 오디오 1시간당 $0.074; mimo-v2.5-tts: 10k 문자당 $0; stepaudio-2.5-tts: 10k 문자당 $0.85; glm-tts: 10k 문자당 $0.3077; qwen3-asr-flash: 오디오 1시간당 $0.1235; qwen3-tts-flash: 10k 문자당 $0.1231; speech-2.8-hd: 10k 문자당 $0.5385; speech-2.8-turbo: 10k 문자당 $0.3077; step-tts-2: 10k 문자당 $0.4; step-tts-mini: 10k 문자당 $0.15; stepaudio-2.5-asr: 오디오 1시간당 $0.022. 표시된 미디어 요금에는 공급자 입출력 과금, 결제 처리, 차지백 리스크, 운영을 커버하는 서비스 마진이 포함될 수 있습니다. 마진이 있는 경우 표시 요금에 이미 포함되어 있으며 별도로 추가되지 않습니다. 이 값들은 이 페이지에 복사된 것이 아니라 모델 카탈로그에서 렌더링됩니다.

## 중국 본토 계정 없이도 이 모델들을 사용할 수 있나요?

예. ChinaAPI는 중국 본토 계정이나 전화번호 없이도 접속할 수 있습니다. 키를 등록한 후, 선택한 모델에 표시된 정확한 경로와 페이로드를 사용하십시오.

---

Markdown twin of https://chinaapi.ai/ko/speech-api/ — generated from its canonical HTML by scripts/gen_localization_release.py. Full site reference: https://chinaapi.ai/llms-full.txt
