マルチモーダル
テキストに加えて、画像、音声、動画のうち2つ以上を受け取れるモデルです。
- モデル
- 73
- プロバイダー
- 15
価格と仕様の確認日:2026-10-05
- Google
Gemini 3.8 Flash
Gemini FlashLatest Gemini Flash. Reads text, images, audio and video; 1M context.
マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト- 音声・動画
- エージェントタスク
- 長文ドキュメント
- 価格
- $0.75 / $3.75 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemini 3.5 Flash
Gemini FlashNear-Pro coding and reasoning at Flash cost, with parallel tool use.
マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト- コーディング
- 音声・動画
- エージェントタスク
- 価格
- $1.5 / $9 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemini 3.6 Flash
Gemini FlashFlash model for coding and web/app development with fewer stray edits.
マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト- コーディング
- 音声・動画
- 価格
- $0.75 / $3.75 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemini 3.5 Flash Lite
Gemini Flash-LiteCheap Gemini for sub-agents that run focused tasks.
マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト- 低コスト
- 音声・動画
- 高速応答
- 価格
- $0.3 / $2.5 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemini 2.5 Pro
Gemini ProGemini with step-by-step thinking for math, science and code.
マルチモーダルテキスト + 画像 + ファイル + 音声 + 動画 → テキスト- 推論
- 音声・動画
- 長文ドキュメント
- 価格
- $1.25 / $10 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemini 3.1 Flash Lite
Gemini Flash-LiteLow-latency Gemini for high volume. Reads audio, video and PDF.
マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト- 低コスト
- 高速応答
- 音声・動画
- 価格
- $0.25 / $1.5 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemini 2.5 Flash Lite
Gemini Flash-LiteAmong the cheapest multimodal models here, 1M context.
マルチモーダルテキスト + 画像 + ファイル + 音声 + 動画 → テキスト- 低コスト
- 高速応答
- 音声・動画
- 価格
- $0.1 / $0.4 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemma 4 31B
Gemma 4Open-weight dense model with image and video input and function calling.
マルチモーダル画像 + テキスト + 動画 → テキスト- オープンウェイト
- 低コスト
- 画像理解
- 価格
- $0.09 / $0.34 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 262K コンテキスト
endueですぐ使えるエージェントで使う - Google
Gemma 4 26B
Gemma 4Open-weight MoE close to Gemma 4 31B quality at lower compute.
マルチモーダル画像 + テキスト + 動画 → テキスト- オープンウェイト
- 低コスト
- 高速応答
- 価格
- $0.077 / $0.26 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 262K コンテキスト
endueですぐ使えるエージェントで使う - Moonshot AI
Kimi K3
KimiLarge open-weight multimodal model for coding and long agent runs.
マルチモーダルテキスト + 画像 + 動画 → テキスト- コーディング
- エージェントタスク
- オープンウェイト
- 価格
- $1.19 / $14 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Alibaba Qwen
Qwen3.8 Max
Qwen3.8Largest Qwen, with text, image and video input.
マルチモーダルテキスト + 画像 + 動画 → テキスト- 推論
- コーディング
- 音声・動画
- 価格
- $2 / $6 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Alibaba Qwen
Qwen3.8 Flash
Qwen3.8Cheap multimodal Qwen for charts, documents and long videos.
マルチモーダルテキスト + 画像 + 動画 → テキスト- 低コスト
- 音声・動画
- 画像理解
- 価格
- $0.15 / $0.47 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Alibaba Qwen
Qwen3.6 Flash
Qwen3.6Fast Qwen with image and video input and a 1M context.
マルチモーダルテキスト + 画像 + 動画 → テキスト- 高速応答
- 低コスト
- 音声・動画
- 価格
- $0.19 / $1.13 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Z.ai
GLM-5V Turbo
GLM-5VGLM that reads images and video, for vision-based coding.
マルチモーダル画像 + テキスト + 動画 → テキスト- 画像理解
- コーディング
- 音声・動画
- 価格
- $1.2 / $4 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 203K コンテキスト
endueですぐ使えるエージェントで使う - MiniMax
MiniMax M3
MiniMaxMultimodal model with a 1M context for long agent work.
マルチモーダルテキスト + 画像 + 動画 → テキスト- 音声・動画
- エージェントタスク
- 低コスト
- 価格
- $0.3 / $1.2 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Meta
Muse Spark 1.3
Muse SparkKeeps track of long tasks. Reads text, images, audio, video and PDF.
マルチモーダルテキスト + 画像 + 動画 + ファイル → テキスト- エージェントタスク
- 音声・動画
- 長文ドキュメント
- 価格
- $1.25 / $4.25 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - Meta
Muse Spark 1.1
Muse SparkMultimodal reasoning for agent tasks, 1M context.
マルチモーダルテキスト + 画像 + 動画 + ファイル → テキスト- エージェントタスク
- 音声・動画
- 価格
- $1.25 / $4.25 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 1M コンテキスト
endueですぐ使えるエージェントで使う - StepFun
Step 3.7 Flash
StepEfficient MoE with native image and video understanding.
マルチモーダルテキスト + 画像 + 動画 → テキスト- 音声・動画
- 低コスト
- 画像理解
- 価格
- $0.2 / $1.15 1Mトークンあたり(入力 / 出力)
- コンテキストウィンドウ
- 262K コンテキスト
endueですぐ使えるエージェントで使う
この条件に合うモデルはありません。