2026年7月31日、Artificial AnalysisはDeepSeek V4 Flashを50と評価した。April previewから10ポイント上昇し、Gemini 3.6 Flashと同水準である。しかし、別のScale AIとCAISのテストでは、最高のエージェントが獲得したのは利用可能な$143,991のうち$1,810、経済価値のおよそ1.26%だった。
要点
- Artificial Analysisは2026年7月31日、DeepSeek V4 Flashを50と評価した。April previewを10ポイント上回り、Gemini 3.6 Flashと同点、GPT-5.6 Lunaには1ポイント差だった。
- V4 FlashのAA-Omniscience精度は37%のままだった一方、報告されたハルシネーション率は11ポイント低下して84%となった。
- V4 FlashはGDPval-AA v2で1,189から1,559 Eloへ上昇し、370ポイント伸ばした。
- DeepSeekは7月31日、公式V4 Flash APIをパブリックベータで公開した。一方、V4 Proと同社のアプリおよびウェブモデルは変更されなかった。
- DeepSeekはV4 Flashを入力トークン100万あたり$0.14と価格設定した。V4 Proは$1.74である。
V4 Flashは総合スコアを10ポイント伸ばしたが、AA-Omniscience精度は37%のままだった。報告されたハルシネーション率は11ポイント低下し、84%となった。このベンチマークでハルシネーション率の低下だけを見るバイヤーは、精度が横ばいであることを見落とす。
この2つの記録は同じシステムをテストしていない。Remote Labor Indexの結果はV4 Flashの結果ではなく、DeepSeekをGeminiと比較して順位付けることもできない。引用した7月31日の報道も、50を理由にV4 Flashを候補に入れた企業を特定していない。このスコアは試行を後押しするが、採用や本番での信頼性を裏付けるものではない。
このスコアはDeepSeekを最初の関門に通す
Artificial Analysisの7月31日の指数では、V4 FlashはGPT-5.6 Lunaに1ポイント差で続いた。同日Bloombergは、DeepSeekが公式V4 Flash APIをパブリックベータで公開し、エージェント機能の強化とV4 Pro Previewを上回るベンチマーク結果を打ち出したと報じた。
DeepSeekのパブリックベータにより、開発者はこの新しい順位のモデルにアクセスできるようになった。それでも調達チームは、自社文書を読み込ませ、自社ツールを接続し、権限を強制し、許容できるエラー水準を適用しなければならない。
研究所、開発者、バイヤーは同じ数値を異なる判断に使える。DeepSeekは同等性を主張でき、開発者はAPIを並べ替え、調達チームは候補を絞り込める。候補リストができた時点で、このスコアの役目は終わっている。
DeepSeekの向上は精度とハルシネーションを切り分ける
DeepSeekはV4 Flashでpreviewモデルのアーキテクチャと規模を維持した。アップグレードはAPI経由で提供し、V4 Pro、アプリ、ウェブモデルは変更しなかった。バイヤーはテストする正確なエンドポイントとバージョンを記録すべきである。Flash APIの結果はその提供面にのみ当てはまる。
Artificial Analysisは2025年11月、40を超えるトピックにまたがる知識とハルシネーションをテストするためAA-Omniscienceを導入した。精度とハルシネーションを別々に示す項目は、総合スコアでは見えにくい差異を明らかにする。キャリブレーションを主張するには、信頼度、棄権、そして信頼度が正確性に追随する証拠が必要である。
文書検索アシスタントを承認する前に、調達チームは社内ファイルに回答可能な質問と回答不可能な質問を埋め込める。正答、裏付けのない回答、棄権、引用を別々に採点し、高リスクの見逃しは人間のレビューに回すべきである。
V4 Flashは、エージェント型の実世界の業務タスクを評価するGDPval-AA v2でも、1,189から1,559 Eloへ上昇した。この伸びを委任判断に変えるには、バイヤーは代表的な業務をエンドツーエンドで再実行し、受け入れられた出力、人間による修正、危険な行動、完了までの時間を数えるべきである。
購入する各主張にはそれぞれの関門が必要だ
調達チームが一度に購入する主張は複数ある。能力、ワークフロー性能、キャリブレーション、制御、サービス品質、経済性である。各主張にはそれぞれの証拠が必要だ。
| 購入する主張 | バイヤーが求めるべき証拠 | 失敗を問う質問 |
|---|---|---|
| 汎用能力 | 構成要素レベルの結果を伴う総合指数 | 実際に動いた基礎能力はどれか? |
| ワークフロー性能 | 代表的な環境での反復的なエンドツーエンド完了 | タスクの変化やツール利用にも性能は耐えるか? |
| キャリブレーション | 信頼度、エラー、棄権、エスカレーションの率 | 信頼度は正確性に追随するか。必要なときにシステムは停止するか? |
| セキュリティと制御 | 権限テスト、アクションログ、承認境界 | エージェントは認可された範囲を超えられるか? |
| サービス品質 | 想定負荷下でのレイテンシー分布 | デモの外でも応答性は維持されるか? |
| 経済性 | 再試行とレビューを含む、受け入れられた成果あたりの総コスト | 完了した業務にはいくらかかるか? |
| 導入適合性 | 対応プラットフォーム、データ境界、運用サポート | 組織はテストしたシステムを運用・統制できるか? |
エージェント導入ではコネクターと承認の失敗が加わる。一方、価格変動はベンチマーク主導の候補リストを覆しうる。
エージェントはコネクターと承認の失敗を露呈する
エージェントは、モデル、ツール、外部データ、オーケストレーション、権限付きアクションを組み合わせる。モデルは提案する。だが、その提案が何を読み、変更し、支出し、送信できるかを決めるのは周辺システムである。
Scale AIとCAISのRemote Labor Indexは、デザイン、動画編集、ゲーム開発、管理業務を含む、経済的価値のあるフリーランス業務でエージェントをテストした。
この比率が測るのは獲得した経済価値であり、完了したタスクの割合ではない。同指数は、タスクの98.74%が失敗したとは報告しておらず、V4 Flashもテストしていない。いかなる総合モデルスコアも、完了業務の割合へそのまま読み替えるべきではないと警告している。
調達チームは同一タスクを、モデル、コネクター、データソース、オーケストレーション方針、人間による承認経路を通して実行すべきである。曖昧なツールの戻り値、拒否された権限、再試行、エスカレーションを記録し、エージェントが権限範囲を超えずに復旧できるかを確認する必要がある。
レビュー担当者は修正を記録し、監査証跡を残し、重大なアクションを誰が承認できるかを特定すべきである。エージェントが行動できるようになれば、バイヤーはモデル品質とは別に制御を検証しなければならない。
1ポイントの差はコストで逆転しうる
DeepSeekはV4 Flashを入力トークン100万あたり$0.14と価格設定した。V4 Proは$1.74である。それでもバイヤーは、出力トークン、再試行、ツール呼び出し、人間によるレビューを考慮しなければならない。
7月30日、AxiosはOpenAIが提供効率の改善後、GPT-5.6 Lunaの価格を約80%、GPT-5.6 Terraを20%引き下げたと報じた。その翌日、Artificial AnalysisはLunaをV4 Flashより指数で1ポイント上に置いた。Lunaは大幅な価格変更後も、このわずかなリードを維持した。
バイヤーは低い提供コストを、より多くの試行、より大きなコンテキスト、あるいはより広い導入に振り向けられる。対話型チームには、想定負荷下でのレイテンシー測定も必要だ。応答が遅ければ、他の面では経済的なワークフローも止まりうる。
調達チームは、出力トークン、再試行、ツール呼び出し、レビューを含む総支出を、受け入れられた成果で割るべきである。その計算では、バイヤーの予算と応答時間の上限内でより多くの業務を完了できるなら、公開指数で負けるモデルの方が有利になることがある。
よくある質問
DeepSeek V4 Flashはいつパブリックベータを終了するのか?
引用した証拠には、一般提供の日付はない。バイヤーはDeepSeekにリリース予定、サポート条件、ベータ期間中にエンドポイントが変更されうるかを確認する必要がある。
V4 Flashの10ポイントの総合スコア上昇は、どのベンチマーク構成要素によるものか?
本文はその内訳を示していない。AA-Omniscience精度が37%で横ばいであるため、総合スコアの上昇だけで精度向上を立証することはできない。
V4 Flashには公開されたキャリブレーションまたは棄権の結果があるか?
ここでは報告されていない。利用可能な数値は精度とハルシネーションを対象としており、信頼度が正確性に追随するか、モデルが適切に棄権するかは対象外である。
出力トークンとエージェント運用を含むV4 Flashの総コストはいくらか?
引用した$0.14の料金は入力トークン100万分のみを対象とする。出力トークン、再試行、ツール呼び出し、人間によるレビュー、受け入れられた結果あたりのコストについて、完全な数値は示されていない。
本番承認にはどの程度のベンチマークスコアが必要か?
証拠から普遍的な閾値は確立されない。本番の閾値は、バイヤーに必要な精度、リスク制御、レイテンシー、予算、人間によるレビューへの許容度に左右される。
7月31日、50というスコアはV4 Flashを公開指数でGeminiの隣に置いた。異なるシステムを異なるテストで評価したRemote Labor Indexの$1,810という結果は、DeepSeekを格下げするものではない。それは、同指数ができない主張を示している。50はV4 Flashを試行に進められる。そこから先へ進めるのは、受け入れられた業務だけである。