ChinaAPIインサイト · 中国語LLMルーティング

中国語を選択LLM : 現在のChinaAPIルーティングガイド

現在のChinaAPI推論モデルは、タスクの形状、コンテキストウィンドウ、モダリティ、および使用可能な回答のコストに基づいてルーティングされます。一般的な品質ランキングではありません。

ChinaAPI · 2026-07-20

間違ったデフォルト設定は、あらゆるプロンプトに対してフラッグシップモデルを使用することです。ほとんどの運用上の失敗は、もっと早い段階で発生します。例えば、テキストのみのモデルに画像が渡されたり、 256Kモデルに無制限のリポジトリが割り当てられたり、安価な初回パスが5回の再試行に早急に変わったり、ツールループに予算や承認の制限がなかったりといったケースです。

2026-07-20調整済みスナップショットには以下が含まれます 25現在のトークンごとのモデルにタグ付けされています 推論これだけの選択肢があれば、汎用的なリーダーボードよりもルーティングルールの方がはるかに有用です。このガイドでは、タスクの失敗につながる可能性のある制約(モダリティ、コンテキストウィンドウ、ツールの使用、レイテンシ、または受け入れられた回答のコスト)に最初の決定を絞り込みます。

これは現在のカタログ選択ガイドであり、公開品質ベンチマークではありません。以下のmodel IDsは現在ChinaAPIで利用可能ですが、アカウントグループ、残高、レート制限、アップストリームの状態、およびタスク自体がリクエストの成否に影響を与えます。

簡潔に答えると

この姿勢は意図的なものです。 ベンダーの主力ブランド名でルーティングしないでください。許容できない障害モードに基づいてルーティングし、承認された出力データを提供することで、プレミアムなエスカレーションを獲得してください。

現在のカタログで可能になること

生産制約始めにエスカレーションまたは切り替えこれが最初の決定である理由
大量テキストのRAG、抽出、分類、またはコード候補deepseek-v4-flashdeepseek-v4-pro または、受け入れチェックに失敗した後のタスク固有のモデル現在のカタログには、経済的な入出力レートでの1Mコンテキストとツールが掲載されていますが、ビジョン入力は掲載されていません。
ファイルや画像、プランニング、ツールqwen3.7-plusMiniMax-M3 選択された1Mモーダル代替手段このタスクにはマルチモーダル入力と長いコンテキストウィンドウが必要なので、テキストのみの経済的なルートは見かけ上の節約に過ぎない。
テキストのみの長文ドキュメントと長いツールループLongCat-2.0deepseek-v4-pro より高コストなテキスト推論パスが正当化される場合1M窓と視界の欠如はどちらも選択の一部です。このルートには画像を添付しないでください。
256K以内のリポジトリまたは複数ファイルコーディングkimi-k2.7-codekimi-k3 または glm-5.2 選択された長文コンテキストまたは最終レビューパスコーディング専門家候補を作業パスに使用し、生成とクリティカルレビューを分離する
ツール呼び出しを行う前に、ビデオ、画像、またはファイルの内容を理解しておく必要があります。glm-5v-turboMiniMax-M3 または qwen3.7-plus 映像入力が不要な場合現在のカタログでは、ビデオ入力サポートと通常の視覚サポートを明確に区別している。
影響力の大きい回答、マージ、ポリシー決定、または最終コードレビュー試験済みの候補者と2回目の選考qwen3.7-maxglm-5.2、 または kimi-k3独立したレビューは役割であり、プレミアムモデルが普遍的に最良であることの証明ではない。

この表は、意図的に順位付けではなく、ルーティングマップとして作成されています。 deepseek-v4-flash 入力がテキストで、候補を安価に生成することが目的の場合、主力製品よりも優れた最初の選択肢となる可能性があります。しかし、処理が画像、動画、またはモデルが検査できないファイルに依存する場合は、最初の選択肢としては不向きです。

価格はルーティングの入力要素であり、決定要因ではない。

現在の表示価格は、トークンの方向性がなぜ重要なのかを示している。 deepseek-v4-flash は、100万トークンあたりの$0.14 / $0.28です。 qwen3.7-plus $0.3077 / $1.2308です。 LongCat-2.0 は$0.3 / $1.2です。 qwen3.7-max $2.5 / $7.5です。

これらの数値は、現在のゲートウェイ調整済み表示率であり、プロジェクトの総コストや品質スコアの予測ではありません。思考トークン、キャッシュミス、ツール呼び出し、再試行、人的修復、および回答を受け入れる確率はすべて結果に影響を与えます。有用な単位は次のとおりです。

usable-answer cost =
  (input tokens + output/thinking tokens + tool costs + retries + review time)
  / accepted answers

入力価格が低い場合、モデルがソースモダリティを処理できない場合、または最初の結果がスキーマ、引用、ツール、またはコードレビューのチェックに繰り返し失敗する場合は、損失が発生します。逆に、出力の高いモデルは、選択された最終レビューの1つには適しているかもしれませんが、バッチ内のすべての候補には無駄になる可能性があります。 ライブ価格 ルートを本番環境に導入する前に。

これらのモデルを自分で実行してみてください。 エンドポイントはAPI keyつOpenAI-compatible USD価格表示は透明性に優れています。現在の表示レートについては、ライブ価格ページをご確認ください。

キーを手に入れよう — $2無料クレジット

再現可能な2段階ルーティング方法

モデルを選択する前にタスクカードを作成してください。目的は、プロンプトが意図せずコストのかかる無制限のエージェントループに陥るのを防ぐことです。

{
  "task_id": "contract-qa-01",
  "task_type": "document_question_answering",
  "source_modalities": ["pdf", "image"],
  "context_band": "1m",
  "needs_tools": true,
  "needs_video_input": false,
  "max_tool_rounds": 6,
  "max_attempts": 2,
  "acceptance_checks": ["answer cites supplied pages", "JSON validates", "no unsupported claim"],
  "candidate_model": "qwen3.7-plus",
  "escalation_model": "glm-5.2",
  "human_approval_required": true
}

次に、2つの段階を使用します。

  1. 入力データを実際に読み取り、コンテキスト/ツールの制約を満たすことができる、最もコストの低い方法を選択してください。
  2. 明示的な受け入れチェック、コスト、および再試行回数の上限を設定した、限定された候補パスを実行します。
  3. 失敗したケース、または高額なケースのみを、プレミアムルートまたは専門家ルートにエスカレーションしてください。
  4. 重要な成果物については、外部へのアクション、支払い、展開、またはデータ削除を行う前に、独立したレビュープロセスを実施し、人間の承認を必要とする。
  5. 承認/拒否結果、課金トークン数、ツールラウンド数、再試行回数、修復時間を保存します。ルートが承認出力データで勝った場合にのみ、そのルートをデフォルトに昇格させます。

内部ルーティングブリーフは、 60-task候補セット RAG 、構造化抽出、コーディング、ツール使用、長文ドキュメント、画像またはビデオの理解、最終レビューにまたがるテスト計画です。これはテスト計画であり、公開ベンチマークではありません。すべての25におけるChinaAPI完了率、レイテンシ分布、ツール成功率、リポジトリレベルのコーディング結果はまだ公開していません。

よくあるルーティングミス

間違いより良いルール
すべてのタスクを最も高価なモデルに送信する経済的なルートまたは標準的なルートで有能な候補者を生成し、プレミアム支出は特定のケースに限定する。
画像または動画証拠には、テキストのみの1Mモデルを使用してください。トークン価格を比較する前に、必要な入力形式を備えたモデルを選択してください。
長いコンテキストウィンドウは、正しい検索を保証するものとして扱う。チャンキング、情報源の選択、引用、および受容性テストを修正する。文脈の理解力は証拠の質ではない。
エージェントがツールを呼び出すまで、それが成功するまで待つタスクカードでツールラウンド、再試行、コスト、承認の制限を設定します。
印象的な答えでモデルを比較する繰り返し固定タスクを実行し、受入率と使用可能な回答のコストを測定する

このガイドが主張しないこと

本記事では、包括的な品質ランキング、レイテンシーランキング、ベンダーの可用性保証、または安全ポリシーに関する結果を公表するものではありません。モデル構成やゲートウェイの価格は変更される可能性があります。最新の価格情報は、価格ページをご確認ください。また、コード、推論、ツールの使用、マルチモーダル理解など、あらゆるタスクにおいて、あるモデルが他のモデルよりも優れていることを証明する公開ベンチマークもまだありません。

現在のカタログ情報に基づいて、妥当な最初のルートを選択してください。次に、受け入れ可能な出力、失敗の種類、再試行回数、および総コストを測定します。次に役立つアップデートは、固定されたタスクセット、繰り返し実行、明確な方法論、および明確な範囲の結論を含むベンチマークレポートであり、派手なランキングではありません。

ChinaAPIで試してみてください。 この記事で紹介されているすべてのモデルは、単一のエンドポイントの背後で稼働しています。中国本土のアカウントや電話番号は不要で、 $2トライアルで開始できます。

無料で始められます — $2クレジット リアルタイム価格を表示
Method & data. Written by: ChinaAPI Research. Published 2026-07-20, last updated 2026-07-20. Data source: ChinaAPI gateway-reconciled catalog snapshot and ChinaAPI Research current-catalog routing brief v2.0, both dated 2026-07-20. Token-model rates are synchronized from the gateway and may follow providers' official China list prices where configured. Media rates use the displayed billing unit and may include a service margin covering provider input/output billing, payment processing, chargeback exposure, and operations; any margin is included in the displayed rate and is not added separately. The ライブ価格ページ is authoritative.