endueendue

マルチモーダル

テキストに加えて、画像、音声、動画のうち2つ以上を受け取れるモデルです。

モデル
73
プロバイダー
15

価格と仕様の確認日:2026-10-05

18件のモデル

モデルを絞り込む

プロバイダー
読み取れる入力
機能
向いている用途
  • Google

    Gemini 3.8 Flash

    Gemini Flash

    Latest Gemini Flash. Reads text, images, audio and video; 1M context.

    マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト
    • 音声・動画
    • エージェントタスク
    • 長文ドキュメント
    価格
    $0.75 / $3.75 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemini 3.5 Flash

    Gemini Flash

    Near-Pro coding and reasoning at Flash cost, with parallel tool use.

    マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト
    • コーディング
    • 音声・動画
    • エージェントタスク
    価格
    $1.5 / $9 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemini 3.6 Flash

    Gemini Flash

    Flash model for coding and web/app development with fewer stray edits.

    マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト
    • コーディング
    • 音声・動画
    価格
    $0.75 / $3.75 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemini 3.5 Flash Lite

    Gemini Flash-Lite

    Cheap Gemini for sub-agents that run focused tasks.

    マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト
    • 低コスト
    • 音声・動画
    • 高速応答
    価格
    $0.3 / $2.5 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemini 2.5 Pro

    Gemini Pro

    Gemini with step-by-step thinking for math, science and code.

    マルチモーダルテキスト + 画像 + ファイル + 音声 + 動画 → テキスト
    • 推論
    • 音声・動画
    • 長文ドキュメント
    価格
    $1.25 / $10 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemini 3.1 Flash Lite

    Gemini Flash-Lite

    Low-latency Gemini for high volume. Reads audio, video and PDF.

    マルチモーダルテキスト + 画像 + 動画 + ファイル + 音声 → テキスト
    • 低コスト
    • 高速応答
    • 音声・動画
    価格
    $0.25 / $1.5 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemini 2.5 Flash Lite

    Gemini Flash-Lite

    Among the cheapest multimodal models here, 1M context.

    マルチモーダルテキスト + 画像 + ファイル + 音声 + 動画 → テキスト
    • 低コスト
    • 高速応答
    • 音声・動画
    価格
    $0.1 / $0.4 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemma 4 31B

    Gemma 4

    Open-weight dense model with image and video input and function calling.

    マルチモーダル画像 + テキスト + 動画 → テキスト
    • オープンウェイト
    • 低コスト
    • 画像理解
    価格
    $0.09 / $0.34 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    262K コンテキスト
    endueですぐ使えるエージェントで使う
  • Google

    Gemma 4 26B

    Gemma 4

    Open-weight MoE close to Gemma 4 31B quality at lower compute.

    マルチモーダル画像 + テキスト + 動画 → テキスト
    • オープンウェイト
    • 低コスト
    • 高速応答
    価格
    $0.077 / $0.26 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    262K コンテキスト
    endueですぐ使えるエージェントで使う
  • Moonshot AI

    Kimi K3

    Kimi

    Large open-weight multimodal model for coding and long agent runs.

    マルチモーダルテキスト + 画像 + 動画 → テキスト
    • コーディング
    • エージェントタスク
    • オープンウェイト
    価格
    $1.19 / $14 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Alibaba Qwen

    Qwen3.8 Max

    Qwen3.8

    Largest Qwen, with text, image and video input.

    マルチモーダルテキスト + 画像 + 動画 → テキスト
    • 推論
    • コーディング
    • 音声・動画
    価格
    $2 / $6 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Alibaba Qwen

    Qwen3.8 Flash

    Qwen3.8

    Cheap multimodal Qwen for charts, documents and long videos.

    マルチモーダルテキスト + 画像 + 動画 → テキスト
    • 低コスト
    • 音声・動画
    • 画像理解
    価格
    $0.15 / $0.47 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Alibaba Qwen

    Qwen3.6 Flash

    Qwen3.6

    Fast Qwen with image and video input and a 1M context.

    マルチモーダルテキスト + 画像 + 動画 → テキスト
    • 高速応答
    • 低コスト
    • 音声・動画
    価格
    $0.19 / $1.13 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Z.ai

    GLM-5V Turbo

    GLM-5V

    GLM that reads images and video, for vision-based coding.

    マルチモーダル画像 + テキスト + 動画 → テキスト
    • 画像理解
    • コーディング
    • 音声・動画
    価格
    $1.2 / $4 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    203K コンテキスト
    endueですぐ使えるエージェントで使う
  • MiniMax

    MiniMax M3

    MiniMax

    Multimodal model with a 1M context for long agent work.

    マルチモーダルテキスト + 画像 + 動画 → テキスト
    • 音声・動画
    • エージェントタスク
    • 低コスト
    価格
    $0.3 / $1.2 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Meta

    Muse Spark 1.3

    Muse Spark

    Keeps track of long tasks. Reads text, images, audio, video and PDF.

    マルチモーダルテキスト + 画像 + 動画 + ファイル → テキスト
    • エージェントタスク
    • 音声・動画
    • 長文ドキュメント
    価格
    $1.25 / $4.25 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • Meta

    Muse Spark 1.1

    Muse Spark

    Multimodal reasoning for agent tasks, 1M context.

    マルチモーダルテキスト + 画像 + 動画 + ファイル → テキスト
    • エージェントタスク
    • 音声・動画
    価格
    $1.25 / $4.25 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    1M コンテキスト
    endueですぐ使えるエージェントで使う
  • StepFun

    Step 3.7 Flash

    Step

    Efficient MoE with native image and video understanding.

    マルチモーダルテキスト + 画像 + 動画 → テキスト
    • 音声・動画
    • 低コスト
    • 画像理解
    価格
    $0.2 / $1.15 1Mトークンあたり(入力 / 出力)
    コンテキストウィンドウ
    262K コンテキスト
    endueですぐ使えるエージェントで使う