ChinaAPIインサイト · 中国語LLMルーティング
中国語を選択LLM : 現在のChinaAPIルーティングガイド
現在のChinaAPI推論モデルは、タスクの形状、コンテキストウィンドウ、モダリティ、および使用可能な回答のコストに基づいてルーティングされます。一般的な品質ランキングではありません。
間違ったデフォルト設定は、あらゆるプロンプトに対してフラッグシップモデルを使用することです。ほとんどの運用上の失敗は、もっと早い段階で発生します。例えば、テキストのみのモデルに画像が渡されたり、 256Kモデルに無制限のリポジトリが割り当てられたり、安価な初回パスが5回の再試行に早急に変わったり、ツールループに予算や承認の制限がなかったりといったケースです。
2026-07-20調整済みスナップショットには以下が含まれます 25現在のトークンごとのモデルにタグ付けされています 推論これだけの選択肢があれば、汎用的なリーダーボードよりもルーティングルールの方がはるかに有用です。このガイドでは、タスクの失敗につながる可能性のある制約(モダリティ、コンテキストウィンドウ、ツールの使用、レイテンシ、または受け入れられた回答のコスト)に最初の決定を絞り込みます。
これは現在のカタログ選択ガイドであり、公開品質ベンチマークではありません。以下のmodel IDsは現在ChinaAPIで利用可能ですが、アカウントグループ、残高、レート制限、アップストリームの状態、およびタスク自体がリクエストの成否に影響を与えます。
簡潔に答えると
- テキスト優先のRAG 、抽出、分類、および低コストのコード候補から始めましょう
deepseek-v4-flash。 現在のカタログでは、 1Mウィンドウとツールサポートが100万トークンあたり$0.14 / $0.28で提供されています。画像や動画の入力をテキスト専用ルートに送信しないでください。 - 使用
qwen3.7-plusジョブが1Mウィンドウだけでなくファイルや画像も必要とする場合の、実用的な汎用エージェントのデフォルトとして使用されます。 ツールの使用や視覚的なコンテキストが、すべてのトークンを最小化することよりも重要な場合、これは適切な最初のテストです。 - 長時間作業の場合は、ブランド名の前に操作方法を選択してください。
LongCat-2.0これは1Mのみのツールルートです。kimi-k2.7-code256Kのコードスペシャリスト候補です。MiniMax-M3これは、ファイルとビジョンを含むこのスナップショットの1Mルートです。これらは異なる制約を解決します。 - 予約する
qwen3.7-max、glm-5.2、 またはkimi-k3厳選された高額パスと独立した審査のため。 プレミアムパスは、候補者が確定した後に最も効果を発揮するものであり、一括処理ワークフローの最初の呼び出しとして使うべきではありません。 - 使用
glm-5v-turbo入力に動画が含まれる場合。 現在のカタログでは、画像、動画、ファイル、ツールに対して明示的にタグ付けされた推論ルートのみが対象となります。テキストのみ、または画像のみのルートでは、受信していない情報を復元することはできません。
この姿勢は意図的なものです。 ベンダーの主力ブランド名でルーティングしないでください。許容できない障害モードに基づいてルーティングし、承認された出力データを提供することで、プレミアムなエスカレーションを獲得してください。
現在のカタログで可能になること
| 生産制約 | 始めに | エスカレーションまたは切り替え | これが最初の決定である理由 |
|---|---|---|---|
| 大量テキストのRAG、抽出、分類、またはコード候補 | deepseek-v4-flash | deepseek-v4-pro または、受け入れチェックに失敗した後のタスク固有のモデル | 現在のカタログには、経済的な入出力レートでの1Mコンテキストとツールが掲載されていますが、ビジョン入力は掲載されていません。 |
| ファイルや画像、プランニング、ツール | qwen3.7-plus | MiniMax-M3 選択された1Mモーダル代替手段 | このタスクにはマルチモーダル入力と長いコンテキストウィンドウが必要なので、テキストのみの経済的なルートは見かけ上の節約に過ぎない。 |
| テキストのみの長文ドキュメントと長いツールループ | LongCat-2.0 | deepseek-v4-pro より高コストなテキスト推論パスが正当化される場合 | 1M窓と視界の欠如はどちらも選択の一部です。このルートには画像を添付しないでください。 |
| 256K以内のリポジトリまたは複数ファイルコーディング | kimi-k2.7-code | kimi-k3 または glm-5.2 選択された長文コンテキストまたは最終レビューパス | コーディング専門家候補を作業パスに使用し、生成とクリティカルレビューを分離する |
| ツール呼び出しを行う前に、ビデオ、画像、またはファイルの内容を理解しておく必要があります。 | glm-5v-turbo | MiniMax-M3 または qwen3.7-plus 映像入力が不要な場合 | 現在のカタログでは、ビデオ入力サポートと通常の視覚サポートを明確に区別している。 |
| 影響力の大きい回答、マージ、ポリシー決定、または最終コードレビュー | 試験済みの候補者と2回目の選考 | qwen3.7-max、 glm-5.2、 または kimi-k3 | 独立したレビューは役割であり、プレミアムモデルが普遍的に最良であることの証明ではない。 |
この表は、意図的に順位付けではなく、ルーティングマップとして作成されています。 deepseek-v4-flash 入力がテキストで、候補を安価に生成することが目的の場合、主力製品よりも優れた最初の選択肢となる可能性があります。しかし、処理が画像、動画、またはモデルが検査できないファイルに依存する場合は、最初の選択肢としては不向きです。
価格はルーティングの入力要素であり、決定要因ではない。
現在の表示価格は、トークンの方向性がなぜ重要なのかを示している。 deepseek-v4-flash は、100万トークンあたりの$0.14 / $0.28です。 qwen3.7-plus $0.3077 / $1.2308です。 LongCat-2.0 は$0.3 / $1.2です。 qwen3.7-max $2.5 / $7.5です。
これらの数値は、現在のゲートウェイ調整済み表示率であり、プロジェクトの総コストや品質スコアの予測ではありません。思考トークン、キャッシュミス、ツール呼び出し、再試行、人的修復、および回答を受け入れる確率はすべて結果に影響を与えます。有用な単位は次のとおりです。
usable-answer cost =
(input tokens + output/thinking tokens + tool costs + retries + review time)
/ accepted answers
入力価格が低い場合、モデルがソースモダリティを処理できない場合、または最初の結果がスキーマ、引用、ツール、またはコードレビューのチェックに繰り返し失敗する場合は、損失が発生します。逆に、出力の高いモデルは、選択された最終レビューの1つには適しているかもしれませんが、バッチ内のすべての候補には無駄になる可能性があります。 ライブ価格 ルートを本番環境に導入する前に。
これらのモデルを自分で実行してみてください。 エンドポイントはAPI keyつOpenAI-compatible USD価格表示は透明性に優れています。現在の表示レートについては、ライブ価格ページをご確認ください。
キーを手に入れよう — $2無料クレジット再現可能な2段階ルーティング方法
モデルを選択する前にタスクカードを作成してください。目的は、プロンプトが意図せずコストのかかる無制限のエージェントループに陥るのを防ぐことです。
{
"task_id": "contract-qa-01",
"task_type": "document_question_answering",
"source_modalities": ["pdf", "image"],
"context_band": "1m",
"needs_tools": true,
"needs_video_input": false,
"max_tool_rounds": 6,
"max_attempts": 2,
"acceptance_checks": ["answer cites supplied pages", "JSON validates", "no unsupported claim"],
"candidate_model": "qwen3.7-plus",
"escalation_model": "glm-5.2",
"human_approval_required": true
}
次に、2つの段階を使用します。
- 入力データを実際に読み取り、コンテキスト/ツールの制約を満たすことができる、最もコストの低い方法を選択してください。
- 明示的な受け入れチェック、コスト、および再試行回数の上限を設定した、限定された候補パスを実行します。
- 失敗したケース、または高額なケースのみを、プレミアムルートまたは専門家ルートにエスカレーションしてください。
- 重要な成果物については、外部へのアクション、支払い、展開、またはデータ削除を行う前に、独立したレビュープロセスを実施し、人間の承認を必要とする。
- 承認/拒否結果、課金トークン数、ツールラウンド数、再試行回数、修復時間を保存します。ルートが承認出力データで勝った場合にのみ、そのルートをデフォルトに昇格させます。
内部ルーティングブリーフは、 60-task候補セット RAG 、構造化抽出、コーディング、ツール使用、長文ドキュメント、画像またはビデオの理解、最終レビューにまたがるテスト計画です。これはテスト計画であり、公開ベンチマークではありません。すべての25におけるChinaAPI完了率、レイテンシ分布、ツール成功率、リポジトリレベルのコーディング結果はまだ公開していません。
よくあるルーティングミス
| 間違い | より良いルール |
|---|---|
| すべてのタスクを最も高価なモデルに送信する | 経済的なルートまたは標準的なルートで有能な候補者を生成し、プレミアム支出は特定のケースに限定する。 |
| 画像または動画証拠には、テキストのみの1Mモデルを使用してください。 | トークン価格を比較する前に、必要な入力形式を備えたモデルを選択してください。 |
| 長いコンテキストウィンドウは、正しい検索を保証するものとして扱う。 | チャンキング、情報源の選択、引用、および受容性テストを修正する。文脈の理解力は証拠の質ではない。 |
| エージェントがツールを呼び出すまで、それが成功するまで待つ | タスクカードでツールラウンド、再試行、コスト、承認の制限を設定します。 |
| 印象的な答えでモデルを比較する | 繰り返し固定タスクを実行し、受入率と使用可能な回答のコストを測定する |
このガイドが主張しないこと
本記事では、包括的な品質ランキング、レイテンシーランキング、ベンダーの可用性保証、または安全ポリシーに関する結果を公表するものではありません。モデル構成やゲートウェイの価格は変更される可能性があります。最新の価格情報は、価格ページをご確認ください。また、コード、推論、ツールの使用、マルチモーダル理解など、あらゆるタスクにおいて、あるモデルが他のモデルよりも優れていることを証明する公開ベンチマークもまだありません。
現在のカタログ情報に基づいて、妥当な最初のルートを選択してください。次に、受け入れ可能な出力、失敗の種類、再試行回数、および総コストを測定します。次に役立つアップデートは、固定されたタスクセット、繰り返し実行、明確な方法論、および明確な範囲の結論を含むベンチマークレポートであり、派手なランキングではありません。
ChinaAPIで試してみてください。 この記事で紹介されているすべてのモデルは、単一のエンドポイントの背後で稼働しています。中国本土のアカウントや電話番号は不要で、 $2トライアルで開始できます。
無料で始められます — $2クレジット リアルタイム価格を表示