提供元組織・国: Qwen(主導)/中国|モデルファミリー: Qwen
| 1. 一言でいうと | 標準的な許諾条件で公開された混合エキスパート版。公開資料に載っている評価指標の表記が 当サイトの登録指標と細かく食い違っており、**そのまま比較できない例**にあたる。 [主張] 確認日: 2026-07-28根拠1根拠2根拠3 |
|---|---|
| 2. 何を判断するための情報か | 配布条件は標準的な許諾で、追加の制限は確認されていない。判断の中心は規模と、 扱えるテキストの長さになる。公称の長さは大きいが、拡張には設定の書き換えが要る点は 先に把握しておくとよい。 [事実] 確認日: 2026-07-28根拠1根拠2根拠3 |
| 3. 向いている用途 | 未確認(当方がまだ確認できていません) |
| 4. 注意点 | 公開資料の指標名を、当サイトや他社の資料に出てくる似た名前の指標と同じものとして 読まないほうがよい。サブセットの絞り込み、年度、タスクの修正の有無で、 同じ名前でも別の測定になる。 次に、拡張時の最大長を常用できる長さと読まないこと。設定の書き換えが前提である。 また、活性化パラメータ数が小さいことを、必要なメモリが小さいことと読み替えないこと。 重み全体は載せる必要がある。 [仮説] 確認日: 2026-07-28根拠1根拠2根拠3 |
| 5. 提供方式 | ウェイト公開[事実]一次リンク |
| 6. 商用利用可否 | (a) 重み配布: 可[主張]一次リンク (b) API利用: Alibaba Cloud Model Studio: 未確認(当方がまだ確認できていません) ※ (a)(b)は別項目です。商用利用可否を1つに合成した表示は行いません。 |
| 7. 最終確認日 | 2026-07-28 |
| 8. 一次ソースへの最短リンク | Qwen公式ブログ・Alibaba Cloud Model Studio / https://qwen.ai/ |
| 事業者 | 種別 | 入力単価 | 出力単価 | 表示形態 | 確認日 |
|---|---|---|---|---|---|
| Alibaba Cloud Model Studio | 開発元直販 | $0.25 / 100万トークン (条件: 地域・トークン長でティアが分かれる(claim_qwen36_api_price参照)。シンガポール(国際): 入力$0.25/100万トークン(0〜256K)・$1(256K〜1M)、出力$1.5(0〜256K)・$4(256K〜1M)。北京・香港・フランクフルト: 入力$0.165(0〜256K)・$0.66(256K〜1M)、出力$0.99(0〜256K)・$3.961(256K〜1M)。90日間100万トークンの無料枠あり。課金はリクエスト単位の入力トークン総数で決まるティア制。ここに収録したprice_input/output_per_million_tokensはシンガポール(国際)0〜256Kレンジの代表値。)[主張] | $1.5 / 100万トークン (条件: 地域・トークン長でティアが分かれる(claim_qwen36_api_price参照)。シンガポール(国際): 入力$0.25/100万トークン(0〜256K)・$1(256K〜1M)、出力$1.5(0〜256K)・$4(256K〜1M)。北京・香港・フランクフルト: 入力$0.165(0〜256K)・$0.66(256K〜1M)、出力$0.99(0〜256K)・$3.961(256K〜1M)。90日間100万トークンの無料枠あり。課金はリクエスト単位の入力トークン総数で決まるティア制。ここに収録したprice_input/output_per_million_tokensはシンガポール(国際)0〜256Kレンジの代表値。)[主張] | ①値保持型 | 2026-07-28 |
登録済みの評価指標7件をすべて行として表示します(結果が確認できない指標も欠損理由を示します)。 数値が載る場合も原則非保持(R1準拠。リーダーボード表示スコアの実数値は転記しません)。 評価指標そのものの読み方はこちら →
| ベンチマーク | 実施主体 | 評価対象 | 表示 | 辞典リンク |
|---|---|---|---|---|
| AIME | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード表・公式ブログの双方にAIME系の評価結果が掲載されている(開発元発表)。上位モデルが飽和しているベンチマークであることがbm_aime自体の特性として登録済み。数値自体は転載せず、掲載の事実と年次条件のみを記録する。[主張](条件: 版=full AIME 2026 (I & II)(開発元脚注記載の原文表現。行ラベルは「AIME26」)) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
| GPQA Diamond | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード表・公式ブログの双方にGPQA系の評価結果が掲載されている(開発元発表)が、対象がGPQA全体かDiamondサブセットかが原文表記からは判別できない。数値自体は転載せず、掲載の事実と条件不明点のみを記録する。[主張](条件: 版=GPQA(原文の行ラベルは「GPQA」のみで「GPQA Diamond」という表記ではない。Diamondサブセット限定か全体セットかは一次ソース上判別不能)) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
| llm-jp-eval | - | - | 未確認(当方がまだ確認できていません) | 読み方を見る |
| LMArena Text | - | - | 未確認(当方がまだ確認できていません) | 読み方を見る |
| METR Time Horizon | - | - | 未確認(当方がまだ確認できていません) | 読み方を見る |
| Nejumiリーダーボード | - | - | 未確認(当方がまだ確認できていません) | 読み方を見る |
| SWE-bench Verified | 開発元 | ◆ エージェント構成 (エージェント名は非開示) | 権利上の理由により当サイトでは保持しない モデルカード表・公式ブログの双方にSWE-bench系の評価結果が掲載されている(開発元発表)が、独立第三者による評価ではなく、開発元が独自に修正した非標準の"refined benchmark"上での結果である。数値自体は転載せず、掲載の事実と条件の違いのみを記録する。[主張](条件: 版=開発元が一部タスクを独自に修正した"refined benchmark"(正式なバージョン名・タスク数の詳細は開示未確認。標準のSWE-bench Verifiedとは別条件)) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
(a) 重み配布ライセンスと (b) API利用条件は別物です。合成した「商用利用可否」は作りません(R3)。
| 正式名 | Apache License, Version 2.0[主張] |
|---|---|
| 商用利用 | 無条件可[主張] |
| 条件要点 | 該当なし(この項目自体が存在しないため) |
| 原文リンク | 原文を確認する一次リンク |
| 原文確認状態 | 未精読 |
| 商用可否の法的評価状態 | 要再確認 |
| 確認日 | 未確認(当方がまだ確認できていません) |
| 事業者 | 商用利用可否 | 確認日 |
|---|---|---|
| Alibaba Cloud Model Studio | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) |
| 形式 | 量子化 | DLサイズ | 必要VRAM(最低) | 対応ランタイム | 配布先 | 公式/非公式 |
|---|---|---|---|---|---|---|
| safetensors | FP8 | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) | Transformers(未検証) | Hugging Face配布先 | 公式 |
| safetensors | 非該当(フル精度FP16/BF16) | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) | Transformers(未検証) | Hugging Face配布先 | 公式 |
コンテキスト長: 262,144 トークン[主張]
入出力: マルチモーダル
| モデル | 関係性 | 比較理由 | 導線 |
|---|---|---|---|
| 未確認(当方がまだ確認できていません) | |||
開発元は、この版を事前学習と後段の学習を経たものとして公開し、 複数の指標で測ったとする評価結果を自ら公表している。一部の指標については、 採点に用いた設定や試行の条件まで注記している。 [主張] 確認日: 2026-07-28根拠1根拠2根拠3
判断に効く順に整理する。(1) **この版は「同名だが条件が違う」が三つ重なっている。** 第一に、公開資料の表の行ラベルは大学院レベルの知識を問う指標の一般名であって、 当サイトが登録している絞り込み済みのサブセットとは表記が一致しない。同じものを 指しているかを公開資料から判別できないため、当方は条件不明として記録している。 第二に、数学の指標は特定の年度の問題に固定されている。別の版が別の年度で測っていれば、 同じ指標名でも比較はできない。第三に、コーディングの指標について、開発元は 一部のタスクを自ら修正した版で測ったと注記している。標準の指標とは別条件である。 (2) 上の三点は、この事業が扱う主題そのものである。**指標名が一致することと、 比べられることは別である。**当サイトは評価結果を指標に直付けせず、実行条件を経由して 記録しているので、条件が違えば比較不可として表示できる。 (3) 扱えるテキストの長さは、標準の状態と拡張時で異なる。拡張は既定ではなく、 利用者が設定を書き換えて有効にする方式である。公称の上限値だけを見て 常用できると考えないほうがよい。 (4) 評価結果の数値は載せていない。掲載されている面に再利用を許す根拠が無いためである。 [仮説] 確認日: 2026-07-28根拠1根拠2根拠3根拠4
全件(0件)は下の層③「更新履歴(フル)」を参照。
| ベンチマーク | 版 | スキャフォールド | 試行回数 | 実施主体 | 評価対象 | 数値or解釈 |
|---|---|---|---|---|---|---|
| AIME | full AIME 2026 (I & II)(開発元脚注記載の原文表現。行ラベルは「AIME26」) | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード表・公式ブログの双方にAIME系の評価結果が掲載されている(開発元発表)。上位モデルが飽和しているベンチマークであることがbm_aime自体の特性として登録済み。数値自体は転載せず、掲載の事実と年次条件のみを記録する。[主張] 一次リンク 確認日: 2026-07-28 |
| GPQA Diamond | GPQA(原文の行ラベルは「GPQA」のみで「GPQA Diamond」という表記ではない。Diamondサブセット限定か全体セットかは一次ソース上判別不能) | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード表・公式ブログの双方にGPQA系の評価結果が掲載されている(開発元発表)が、対象がGPQA全体かDiamondサブセットかが原文表記からは判別できない。数値自体は転載せず、掲載の事実と条件不明点のみを記録する。[主張] 一次リンク 確認日: 2026-07-28 |
| SWE-bench Verified | 開発元が一部タスクを独自に修正した"refined benchmark"(正式なバージョン名・タスク数の詳細は開示未確認。標準のSWE-bench Verifiedとは別条件) | 非開示(開発元の方針として非公開です) | 未確認(当方がまだ確認できていません) | 開発元 | ◆ エージェント構成 (エージェント名は非開示) | 権利上の理由により当サイトでは保持しない モデルカード表・公式ブログの双方にSWE-bench系の評価結果が掲載されている(開発元発表)が、独立第三者による評価ではなく、開発元が独自に修正した非標準の"refined benchmark"上での結果である。数値自体は転載せず、掲載の事実と条件の違いのみを記録する。[主張] 一次リンク 確認日: 2026-07-28 |
| 対象項目 | 変更前 | 変更後 | 検知日 | 確認日 |
|---|---|---|---|---|
| 未確認(当方がまだ確認できていません) | ||||
確認者: sonnet-subagent-3-4-b2
プロセス: 人手確認(human_confirmed)フラグが真である項目: モデル版本体、価格情報。一次資料を人手で突合し、差異があれば確認日の新しい方を採択しています。
version_id: qwen3.6-35b-a3b