提供元組織・国: DeepSeek(主導)/中国|モデルファミリー: DeepSeek
| 1. 一言でいうと | 多数の蒸留派生モデルの教師として使われた MoE の推論特化版。ウェイトは現在も MIT で 公開されているが、開発元の公式 API では既に提供されていない。「入手できる」ことと 「サービスとして使える」ことが分かれている版。 [主張] 確認日: 2026-07-28根拠1根拠2根拠3根拠4 |
|---|---|
| 2. 何を判断するための情報か | この版を検討するとき、先に確かめるべきなのは性能ではなく提供形態である。 ウェイトは MIT で取得でき、モデルカードは他の大規模言語モデルの学習のための蒸留まで 明示的に許している。一方で、開発元の公式 API はこの版を指さなくなっている。 自分で動かすのか、API を呼ぶつもりなのかで、この版が選択肢に入るかどうかが変わる。 [事実] 確認日: 2026-07-28根拠1根拠2根拠3根拠4根拠5 |
| 3. 向いている用途 | 未確認(当方がまだ確認できていません) |
| 4. 注意点 | 「総パラメータ数が大きい」ことと「動かすのに必要な計算資源が大きい」ことは、この版では 同じではない。混合エキスパート構成で、1トークンの生成に使われるのは総数の一部である。 ただし重み全体はメモリに載せる必要があるため、活性化パラメータ数だけを見て必要資源を 見積もるのも誤りになる。 次に、この版を教師として作られた蒸留モデル群は別のモデル版であり、この版そのものでは ない。ライセンスも派生元によって異なる場合がある。 また、公式 API で使えなくなったことは、ライセンスが変わったことを意味しない。 ウェイトの配布条件は MIT のままである。 [仮説] 確認日: 2026-07-28根拠1根拠2根拠3根拠4 |
| 5. 提供方式 | ウェイト公開[事実]一次リンク |
| 6. 商用利用可否 | (a) 重み配布: 可[主張]一次リンク (b) API利用: DeepSeek公式API: 未確認(当方がまだ確認できていません) ※ (a)(b)は別項目です。商用利用可否を1つに合成した表示は行いません。 |
| 7. 最終確認日 | 2026-07-28 |
| 8. 一次ソースへの最短リンク | Hugging Face(中国OW各社org: deepseek-ai/Qwen/zai-org/moonshotai/MiniMaxAI等) / https://huggingface.co |
| 事業者 | 種別 | 入力単価 | 出力単価 | 表示形態 | 確認日 |
|---|---|---|---|---|---|
| DeepSeek公式API | 開発元直販 | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) | 欠損(4区分) | 2026-07-28 |
登録済みの評価指標7件をすべて行として表示します(結果が確認できない指標も欠損理由を示します)。 数値が載る場合も原則非保持(R1準拠。リーダーボード表示スコアの実数値は転記しません)。 評価指標そのものの読み方はこちら →
| ベンチマーク | 実施主体 | 評価対象 | 表示 | 辞典リンク |
|---|---|---|---|---|
| AIME | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード比較表「AIME 2024 (Pass@1)」列に本モデルの自己申告値の掲載を確認した(論文本文にも学習曲線の図として掲載、AIME公式サイトへの脚注リンクあり)。開発元発表(主張)であり、当サイトでは数値そのものは保持せず、掲載の事実・年度・確認日・一次リンクのみを記録する。[主張](条件: 版=AIME 2024 / 試行回数=64) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
| GPQA Diamond | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード比較表「GPQA-Diamond (Pass@1)」列に本モデルの自己申告値の掲載を確認した(論文arXiv:2501.12948にもsimple-evalsフレームワーク使用と明記)。開発元発表(主張)であり、当サイトでは数値そのものは保持せず、掲載の事実・実施条件・確認日・一次リンクのみを記録する。[主張](条件: 版=GPQA Diamond / スキャフォールド=simple-evals / 試行回数=64) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
| llm-jp-eval | - | - | 未確認(当方がまだ確認できていません) | 読み方を見る |
| LMArena Text | ベンチマーク運営元(開発元とは別法人) | ● モデル単体 | 権利上の理由により当サイトでは保持しない ベンチマーク運営元(Arena Intelligence Inc.、開発元DeepSeekとは別法人)が運営するLMArena Textリーダーボードに`deepseek-r1`表記での掲載を直接確認した(3-4調査結果B1 §2-E)。同ページには別チェックポイント`deepseek-r1-0528`も掲載されているが、これは対象19版に含まれない別バージョンのため本レコードには含めていない(版の混同を避けるため)。実行条件はUI上に記載が無く条件不明(run_conditions/deepseek-r1_lmarena_text_cond参照)。数値(Eloレーティング)は当サイトでは転載しない。[事実] 一次リンク 確認日: 2026-07-28 | 読み方を見る |
| METR Time Horizon | 独立第三者 | ◆ エージェント構成 (Triframe(METRによる改変版)) | 権利上の理由により当サイトでは保持しない 独立第三者評価機関METR(非営利研究機関、開発元DeepSeekとは無関係)がDeepSeek-R1を対象にTime Horizon評価を実施し、公式レポートを公開していることを直接確認した(3-4調査結果B1 §2-E、公開日2025-06-27)。実行条件(Triframeスキャフォールドの変種、131タスク×8試行、モデル別トークン予算、o4-miniベースのチーティング検出モニター)は特定できた(run_conditions/deepseek-r1_metr_time_horizon_cond参照)。同ファミリーのDeepSeek-V4-Pro・DeepSeek-R1-Distill-Qwen-7BにはMETRの同種評価が確認できなかった(R1のみ確認)。時間の推定値そのもの(数値)は当サイトでは転載しない。subject_type=エージェント構成の根拠: Triframeはadvisor/actor/raterの3種のLLM呼び出しがbashを実行するループを回すマルチエージェント・スキャフォールドであり、単体モデルの推論ではない(agent_triframe_metr.yaml参照)。[事実](条件: 版=METR汎用自律性タスクセット(131タスク) / スキャフォールド=Triframe / 試行回数=8) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
| Nejumiリーダーボード | - | - | 未確認(当方がまだ確認できていません) | 読み方を見る |
| SWE-bench Verified | 開発元 | 未確認(当方がまだ確認できていません) | 権利上の理由により当サイトでは保持しない モデルカード比較表「SWE Verified (Resolved)」列(Claude-3.5-Sonnet/GPT-4o/o1等との比較表内)に本モデルの自己申告値の掲載を確認した。開発元発表(主張)であり、当サイトでは数値そのものは保持せず、掲載の事実・実施条件・確認日・一次リンクのみを記録する。[主張](条件: 版=SWE-bench Verified / 試行回数=64) 一次リンク 確認日: 2026-07-28 | 読み方を見る |
(a) 重み配布ライセンスと (b) API利用条件は別物です。合成した「商用利用可否」は作りません(R3)。
| 正式名 | MIT License[主張] |
|---|---|
| 商用利用 | 無条件可[主張] |
| 条件要点 | 該当なし(この項目自体が存在しないため) |
| 原文リンク | 原文を確認する一次リンク |
| 原文確認状態 | 未精読 |
| 商用可否の法的評価状態 | 要再確認 |
| 確認日 | 未確認(当方がまだ確認できていません) |
| 事業者 | 商用利用可否 | 確認日 |
|---|---|---|
| DeepSeek公式API | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) |
| 形式 | 量子化 | DLサイズ | 必要VRAM(最低) | 対応ランタイム | 配布先 | 公式/非公式 |
|---|---|---|---|---|---|---|
| safetensors | 非該当(フル精度FP16/BF16) | 未確認(当方がまだ確認できていません) | 未確認(当方がまだ確認できていません) | vLLM(未検証) / SGLang(未検証) | Hugging Face配布先 | 公式 |
コンテキスト長: 未確認(当方がまだ確認できていません)
入出力: テキストのみ
| モデル | 関係性 | 比較理由 | 導線 |
|---|---|---|---|
| 未確認(当方がまだ確認できていません) | |||
開発元は、この版を DeepSeek-V3-Base に対してコールドスタートデータを与えたうえで 強化学習と教師ありファインチューニングを組み合わせて作ったと説明している。 強化学習のみで作った先行版に対し、可読性を改善する目的で工程を加えた、としている。 評価結果についても、複数のベンチマークで測ったとする数値を自ら公表している。 [主張] 確認日: 2026-07-28根拠1根拠2根拠3
判断に効く順に整理する。(1) 提供状態が二層に分かれている。ウェイトの配布は続いている 一方、公式 API の推論用エイリアスは2025年8月に後継系列へ切り替えられ、以後この版を 指していない。現行の価格表にも該当するモデル名が無い。当サイトはモデル版と API 提供を 別の実体として持っているため、この食い違いをそのまま表示している。「提供終了」と一言で 書くと、ウェイトが取得できる事実が消える。 (2) 扱えるテキストの長さについて、一次ソースが二つの値を示している。モデルカードの表と 設定ファイルの値が一致せず、どちらが公称値かを説明する記述が公式資料に見当たらない。 当方はどちらか一方を選ばず、両方を根拠付きで並べている。片方を消すと、食い違いが あるという事実そのものが読者に伝わらなくなる。 (3) 評価結果の数値は載せていない。値が存在しないからではなく、掲載されている面に 再利用を許す根拠が無いためである。開発元の技術レポートは arXiv の既定ライセンスで 公開されており、これは数値の再掲を許すものではない。独立した第三者による評価も 存在するが、その結果が載っているページにもライセンスの表示が無い。したがって当方は 評価条件と出典への経路だけを示し、数値は出典側で確認してもらう形にしている。 (4) ただし評価条件は追える。開発元は生成長の上限、サンプリングの設定、平均を取った 試行回数を明記しており、条件が特定できないまま数値だけが流通している状態ではない。 条件が追えることと、数値を転載してよいことは別である。 [仮説] 確認日: 2026-07-28根拠1根拠2根拠3根拠4
全件(0件)は下の層③「更新履歴(フル)」を参照。
| ベンチマーク | 版 | スキャフォールド | 試行回数 | 実施主体 | 評価対象 | 数値or解釈 |
|---|---|---|---|---|---|---|
| AIME | AIME 2024 | 未確認(当方がまだ確認できていません) | 64 | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード比較表「AIME 2024 (Pass@1)」列に本モデルの自己申告値の掲載を確認した(論文本文にも学習曲線の図として掲載、AIME公式サイトへの脚注リンクあり)。開発元発表(主張)であり、当サイトでは数値そのものは保持せず、掲載の事実・年度・確認日・一次リンクのみを記録する。[主張] 一次リンク 確認日: 2026-07-28 |
| GPQA Diamond | GPQA Diamond | simple-evals | 64 | 開発元 | ● モデル単体 | 権利上の理由により当サイトでは保持しない モデルカード比較表「GPQA-Diamond (Pass@1)」列に本モデルの自己申告値の掲載を確認した(論文arXiv:2501.12948にもsimple-evalsフレームワーク使用と明記)。開発元発表(主張)であり、当サイトでは数値そのものは保持せず、掲載の事実・実施条件・確認日・一次リンクのみを記録する。[主張] 一次リンク 確認日: 2026-07-28 |
| SWE-bench Verified | SWE-bench Verified | 未確認(当方がまだ確認できていません) | 64 | 開発元 | 未確認(当方がまだ確認できていません) | 権利上の理由により当サイトでは保持しない モデルカード比較表「SWE Verified (Resolved)」列(Claude-3.5-Sonnet/GPT-4o/o1等との比較表内)に本モデルの自己申告値の掲載を確認した。開発元発表(主張)であり、当サイトでは数値そのものは保持せず、掲載の事実・実施条件・確認日・一次リンクのみを記録する。[主張] 一次リンク 確認日: 2026-07-28 |
| LMArena Text | 未確認(当方がまだ確認できていません) | 該当なし(この項目自体が存在しないため) | 未確認(当方がまだ確認できていません) | ベンチマーク運営元(開発元とは別法人) | ● モデル単体 | 権利上の理由により当サイトでは保持しない ベンチマーク運営元(Arena Intelligence Inc.、開発元DeepSeekとは別法人)が運営するLMArena Textリーダーボードに`deepseek-r1`表記での掲載を直接確認した(3-4調査結果B1 §2-E)。同ページには別チェックポイント`deepseek-r1-0528`も掲載されているが、これは対象19版に含まれない別バージョンのため本レコードには含めていない(版の混同を避けるため)。実行条件はUI上に記載が無く条件不明(run_conditions/deepseek-r1_lmarena_text_cond参照)。数値(Eloレーティング)は当サイトでは転載しない。[事実] 一次リンク 確認日: 2026-07-28 |
| METR Time Horizon | METR汎用自律性タスクセット(131タスク) | Triframe | 8 | 独立第三者 | ◆ エージェント構成 (Triframe(METRによる改変版)) | 権利上の理由により当サイトでは保持しない 独立第三者評価機関METR(非営利研究機関、開発元DeepSeekとは無関係)がDeepSeek-R1を対象にTime Horizon評価を実施し、公式レポートを公開していることを直接確認した(3-4調査結果B1 §2-E、公開日2025-06-27)。実行条件(Triframeスキャフォールドの変種、131タスク×8試行、モデル別トークン予算、o4-miniベースのチーティング検出モニター)は特定できた(run_conditions/deepseek-r1_metr_time_horizon_cond参照)。同ファミリーのDeepSeek-V4-Pro・DeepSeek-R1-Distill-Qwen-7BにはMETRの同種評価が確認できなかった(R1のみ確認)。時間の推定値そのもの(数値)は当サイトでは転載しない。subject_type=エージェント構成の根拠: Triframeはadvisor/actor/raterの3種のLLM呼び出しがbashを実行するループを回すマルチエージェント・スキャフォールドであり、単体モデルの推論ではない(agent_triframe_metr.yaml参照)。[事実] 一次リンク 確認日: 2026-07-28 |
| 対象項目 | 変更前 | 変更後 | 検知日 | 確認日 |
|---|---|---|---|---|
| 未確認(当方がまだ確認できていません) | ||||
確認者: sonnet-subagent-3-4-B1
プロセス: 人手確認(human_confirmed)フラグが真である項目: モデル版本体、価格情報。一次資料を人手で突合し、差異があれば確認日の新しい方を採択しています。
version_id: deepseek-r1