Video
Modelle, die sich ein Video ansehen können, das Sie senden. endue bietet noch keine Modelle zur Videoerzeugung an.
- Modelle
- 73
- Anbieter
- 15
Preise und Spezifikationen geprüft am 2026-10-05
- Google
Gemini 3.8 Flash
Gemini FlashLatest Gemini Flash. Reads text, images, audio and video; 1M context.
MultimodalText + Bilder + Video + Dateien + Audio → Text- Audio & Video
- Agentenaufgaben
- Lange Dokumente
- Preise
- $0.75 / $3.75 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemini 3.5 Flash
Gemini FlashNear-Pro coding and reasoning at Flash cost, with parallel tool use.
MultimodalText + Bilder + Video + Dateien + Audio → Text- Programmieren
- Audio & Video
- Agentenaufgaben
- Preise
- $1.5 / $9 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemini 3.6 Flash
Gemini FlashFlash model for coding and web/app development with fewer stray edits.
MultimodalText + Bilder + Video + Dateien + Audio → Text- Programmieren
- Audio & Video
- Preise
- $0.75 / $3.75 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemini 3.5 Flash Lite
Gemini Flash-LiteCheap Gemini for sub-agents that run focused tasks.
MultimodalText + Bilder + Video + Dateien + Audio → Text- Geringe Kosten
- Audio & Video
- Schnelle Antworten
- Preise
- $0.3 / $2.5 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemini 2.5 Pro
Gemini ProGemini with step-by-step thinking for math, science and code.
MultimodalText + Bilder + Dateien + Audio + Video → Text- Logisches Denken
- Audio & Video
- Lange Dokumente
- Preise
- $1.25 / $10 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemini 3.1 Flash Lite
Gemini Flash-LiteLow-latency Gemini for high volume. Reads audio, video and PDF.
MultimodalText + Bilder + Video + Dateien + Audio → Text- Geringe Kosten
- Schnelle Antworten
- Audio & Video
- Preise
- $0.25 / $1.5 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemini 2.5 Flash Lite
Gemini Flash-LiteAmong the cheapest multimodal models here, 1M context.
MultimodalText + Bilder + Dateien + Audio + Video → Text- Geringe Kosten
- Schnelle Antworten
- Audio & Video
- Preise
- $0.1 / $0.4 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemma 4 31B
Gemma 4Open-weight dense model with image and video input and function calling.
MultimodalBilder + Text + Video → Text- Offene Gewichte
- Geringe Kosten
- Bildverständnis
- Preise
- $0.09 / $0.34 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 262K Kontext
Sofort in endue nutzbarIm Agenten verwenden - Google
Gemma 4 26B
Gemma 4Open-weight MoE close to Gemma 4 31B quality at lower compute.
MultimodalBilder + Text + Video → Text- Offene Gewichte
- Geringe Kosten
- Schnelle Antworten
- Preise
- $0.077 / $0.26 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 262K Kontext
Sofort in endue nutzbarIm Agenten verwenden - Moonshot AI
Kimi K3
KimiLarge open-weight multimodal model for coding and long agent runs.
MultimodalText + Bilder + Video → Text- Programmieren
- Agentenaufgaben
- Offene Gewichte
- Preise
- $1.19 / $14 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Alibaba Qwen
Qwen3.8 Max
Qwen3.8Largest Qwen, with text, image and video input.
MultimodalText + Bilder + Video → Text- Logisches Denken
- Programmieren
- Audio & Video
- Preise
- $2 / $6 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Alibaba Qwen
Qwen3.8 Flash
Qwen3.8Cheap multimodal Qwen for charts, documents and long videos.
MultimodalText + Bilder + Video → Text- Geringe Kosten
- Audio & Video
- Bildverständnis
- Preise
- $0.15 / $0.47 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Alibaba Qwen
Qwen3.6 Flash
Qwen3.6Fast Qwen with image and video input and a 1M context.
MultimodalText + Bilder + Video → Text- Schnelle Antworten
- Geringe Kosten
- Audio & Video
- Preise
- $0.19 / $1.13 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Z.ai
GLM-5V Turbo
GLM-5VGLM that reads images and video, for vision-based coding.
MultimodalBilder + Text + Video → Text- Bildverständnis
- Programmieren
- Audio & Video
- Preise
- $1.2 / $4 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 203K Kontext
Sofort in endue nutzbarIm Agenten verwenden - MiniMax
MiniMax M3
MiniMaxMultimodal model with a 1M context for long agent work.
MultimodalText + Bilder + Video → Text- Audio & Video
- Agentenaufgaben
- Geringe Kosten
- Preise
- $0.3 / $1.2 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Meta
Muse Spark 1.3
Muse SparkKeeps track of long tasks. Reads text, images, audio, video and PDF.
MultimodalText + Bilder + Video + Dateien → Text- Agentenaufgaben
- Audio & Video
- Lange Dokumente
- Preise
- $1.25 / $4.25 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - Meta
Muse Spark 1.1
Muse SparkMultimodal reasoning for agent tasks, 1M context.
MultimodalText + Bilder + Video + Dateien → Text- Agentenaufgaben
- Audio & Video
- Preise
- $1.25 / $4.25 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 1M Kontext
Sofort in endue nutzbarIm Agenten verwenden - StepFun
Step 3.7 Flash
StepEfficient MoE with native image and video understanding.
MultimodalText + Bilder + Video → Text- Audio & Video
- Geringe Kosten
- Bildverständnis
- Preise
- $0.2 / $1.15 pro 1 Mio. Tokens, Eingabe / Ausgabe
- Kontextfenster
- 262K Kontext
Sofort in endue nutzbarIm Agenten verwenden
Kein Modell passt zu diesen Filtern.