テクノロジー 注目度 58

DeepSeekが画像認識対応のオープンモデル「DeepSeek-V4-Flash-Vision-Exp」を公開:Claude Opus 4.8に匹敵する性能を実証

※本記事の要約および解説はAIが自動生成しており、誤りが含まれる可能性があります。事実確認は元ニュースをご参照ください。

中国のAI企業DeepSeekが、画像認識機能に対応したマルチモーダルモデル「DeepSeek-V4-Flash-Vision-Exp」をオープンモデルとして公開しました。本モデルは、DeepSeek-V4シリーズとして初めて画像入力に対応した実験的なマルチモーダルモデルであり、その性能が注目されています。DeepSeek-V4-Flashのアーキテクチャをベースに、画像処理モジュールを組み込み、事後学習によって画像認識能力を追加したのが特徴です。

この「DeepSeek-V4-Flash-Vision-Exp」は、パラメーター数3050億のマルチモーダルモデルであり、画像認識を含む複合的なタスクにおいて、競合モデルであるClaude Opus 4.8と同等のベンチマークスコアを記録したと発表されています。テキスト処理性能は、同シリーズの「DeepSeek-V4-Flash-0731」と同等以上を維持しつつ、画像処理能力を大幅に向上させた点が技術的な成果です。

本モデルはオープンモデルとしてHugging FaceおよびModelScopeからダウンロード可能であり、ライセンスはMIT Licenseを採用しています。API経由での利用も可能で、サポートされる画像形式はJPEG、PNG、GIF、WebPの4種類です。入力画像の最大解像度は長辺8192ピクセルまで対応しますが、15枚以上の画像を入力する場合は長辺4096ピクセルに制限されます。また、大きな画像はアスペクト比を保ちつつ800×800ピクセル相当にリサイズされ、画像1枚あたりのトークン数は最大384トークン程度に制限されます。

API料金体系はピーク時とオフピーク時で変動し、ピーク時(協定世界時で月~金曜の1時~4時および6時~10時)のDeepSeek-V4-Flash-Vision-Expの料金は、入力が100万トークンあたり0.44ドル(約70.55円)、出力が1.32ドル(約211.65円)と設定されています。オフピーク時はこの料金の半額となります。


背景

近年、AIモデルは単なるテキスト生成に留まらず、画像や音声など複数のデータ形式を同時に処理できる「マルチモーダル化」が主流となっています。DeepSeekの今回のリリースは、このマルチモーダル化の最前線に位置し、オープンソースコミュニティにおける高性能なAIモデルの競争が激化している背景があります。

重要用語解説

  • マルチモーダルモデル: 複数のモダリティ(様式)のデータを同時に理解・処理できるAIモデル。テキストだけでなく、画像や音声など多様な入力に対応します。
  • オープンモデル: モデルの構造や重み(パラメータ)が公開されており、誰でも自由に利用、改変、商用利用できるAIモデルを指します。
  • ベンチマークスコア: モデルの性能を客観的に測定するために、特定の課題やデータセットを用いて算出される指標。モデルの能力を比較する際の基準となります。

今後の影響

本モデルの公開は、オープンソースAI市場における競争を一層激化させ、特に画像認識を含む実用的なタスクでの性能基準を引き上げます。企業は、このオープンモデルを活用することで、高価なAPI利用に依存せず、自社の業務に合わせたAIソリューションを構築しやすくなることが期待されます。