endueendue

Vidéo

Des modèles capables de regarder une vidéo que vous envoyez. endue ne propose pas encore de modèles de génération de vidéos.

modèles
73
fournisseurs
15

Prix et caractéristiques vérifiés le 2026-10-05

18 modèles

Filtrer les modèles

Fournisseur
Entrées acceptées
Capacités
Adapté à
  • Google

    Gemini 3.8 Flash

    Gemini Flash

    Latest Gemini Flash. Reads text, images, audio and video; 1M context.

    MultimodalTexte + Images + Vidéo + Fichiers + Audio → Texte
    • Audio et vidéo
    • Tâches agentiques
    • Documents longs
    Tarifs
    $0.75 / $3.75 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemini 3.5 Flash

    Gemini Flash

    Near-Pro coding and reasoning at Flash cost, with parallel tool use.

    MultimodalTexte + Images + Vidéo + Fichiers + Audio → Texte
    • Programmation
    • Audio et vidéo
    • Tâches agentiques
    Tarifs
    $1.5 / $9 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemini 3.6 Flash

    Gemini Flash

    Flash model for coding and web/app development with fewer stray edits.

    MultimodalTexte + Images + Vidéo + Fichiers + Audio → Texte
    • Programmation
    • Audio et vidéo
    Tarifs
    $0.75 / $3.75 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemini 3.5 Flash Lite

    Gemini Flash-Lite

    Cheap Gemini for sub-agents that run focused tasks.

    MultimodalTexte + Images + Vidéo + Fichiers + Audio → Texte
    • Faible coût
    • Audio et vidéo
    • Réponses rapides
    Tarifs
    $0.3 / $2.5 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemini 2.5 Pro

    Gemini Pro

    Gemini with step-by-step thinking for math, science and code.

    MultimodalTexte + Images + Fichiers + Audio + Vidéo → Texte
    • Raisonnement
    • Audio et vidéo
    • Documents longs
    Tarifs
    $1.25 / $10 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemini 3.1 Flash Lite

    Gemini Flash-Lite

    Low-latency Gemini for high volume. Reads audio, video and PDF.

    MultimodalTexte + Images + Vidéo + Fichiers + Audio → Texte
    • Faible coût
    • Réponses rapides
    • Audio et vidéo
    Tarifs
    $0.25 / $1.5 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemini 2.5 Flash Lite

    Gemini Flash-Lite

    Among the cheapest multimodal models here, 1M context.

    MultimodalTexte + Images + Fichiers + Audio + Vidéo → Texte
    • Faible coût
    • Réponses rapides
    • Audio et vidéo
    Tarifs
    $0.1 / $0.4 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemma 4 31B

    Gemma 4

    Open-weight dense model with image and video input and function calling.

    MultimodalImages + Texte + Vidéo → Texte
    • Poids ouverts
    • Faible coût
    • Analyse d’images
    Tarifs
    $0.09 / $0.34 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    262K contexte
    Disponible sur endueUtiliser dans un agent
  • Google

    Gemma 4 26B

    Gemma 4

    Open-weight MoE close to Gemma 4 31B quality at lower compute.

    MultimodalImages + Texte + Vidéo → Texte
    • Poids ouverts
    • Faible coût
    • Réponses rapides
    Tarifs
    $0.077 / $0.26 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    262K contexte
    Disponible sur endueUtiliser dans un agent
  • Moonshot AI

    Kimi K3

    Kimi

    Large open-weight multimodal model for coding and long agent runs.

    MultimodalTexte + Images + Vidéo → Texte
    • Programmation
    • Tâches agentiques
    • Poids ouverts
    Tarifs
    $1.19 / $14 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Alibaba Qwen

    Qwen3.8 Max

    Qwen3.8

    Largest Qwen, with text, image and video input.

    MultimodalTexte + Images + Vidéo → Texte
    • Raisonnement
    • Programmation
    • Audio et vidéo
    Tarifs
    $2 / $6 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Alibaba Qwen

    Qwen3.8 Flash

    Qwen3.8

    Cheap multimodal Qwen for charts, documents and long videos.

    MultimodalTexte + Images + Vidéo → Texte
    • Faible coût
    • Audio et vidéo
    • Analyse d’images
    Tarifs
    $0.15 / $0.47 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Alibaba Qwen

    Qwen3.6 Flash

    Qwen3.6

    Fast Qwen with image and video input and a 1M context.

    MultimodalTexte + Images + Vidéo → Texte
    • Réponses rapides
    • Faible coût
    • Audio et vidéo
    Tarifs
    $0.19 / $1.13 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Z.ai

    GLM-5V Turbo

    GLM-5V

    GLM that reads images and video, for vision-based coding.

    MultimodalImages + Texte + Vidéo → Texte
    • Analyse d’images
    • Programmation
    • Audio et vidéo
    Tarifs
    $1.2 / $4 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    203K contexte
    Disponible sur endueUtiliser dans un agent
  • MiniMax

    MiniMax M3

    MiniMax

    Multimodal model with a 1M context for long agent work.

    MultimodalTexte + Images + Vidéo → Texte
    • Audio et vidéo
    • Tâches agentiques
    • Faible coût
    Tarifs
    $0.3 / $1.2 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Meta

    Muse Spark 1.3

    Muse Spark

    Keeps track of long tasks. Reads text, images, audio, video and PDF.

    MultimodalTexte + Images + Vidéo + Fichiers → Texte
    • Tâches agentiques
    • Audio et vidéo
    • Documents longs
    Tarifs
    $1.25 / $4.25 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • Meta

    Muse Spark 1.1

    Muse Spark

    Multimodal reasoning for agent tasks, 1M context.

    MultimodalTexte + Images + Vidéo + Fichiers → Texte
    • Tâches agentiques
    • Audio et vidéo
    Tarifs
    $1.25 / $4.25 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    1M contexte
    Disponible sur endueUtiliser dans un agent
  • StepFun

    Step 3.7 Flash

    Step

    Efficient MoE with native image and video understanding.

    MultimodalTexte + Images + Vidéo → Texte
    • Audio et vidéo
    • Faible coût
    • Analyse d’images
    Tarifs
    $0.2 / $1.15 pour 1M de tokens, entrée / sortie
    Fenêtre de contexte
    262K contexte
    Disponible sur endueUtiliser dans un agent