endueendue

Video

Modelle, die sich ein Video ansehen können, das Sie senden. endue bietet noch keine Modelle zur Videoerzeugung an.

Modelle
73
Anbieter
15

Preise und Spezifikationen geprüft am 2026-10-05

18 Modelle

Modelle filtern

Anbieter
Liest
Fähigkeiten
Geeignet für
  • Google

    Gemini 3.8 Flash

    Gemini Flash

    Latest Gemini Flash. Reads text, images, audio and video; 1M context.

    MultimodalText + Bilder + Video + Dateien + Audio → Text
    • Audio & Video
    • Agentenaufgaben
    • Lange Dokumente
    Preise
    $0.75 / $3.75 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemini 3.5 Flash

    Gemini Flash

    Near-Pro coding and reasoning at Flash cost, with parallel tool use.

    MultimodalText + Bilder + Video + Dateien + Audio → Text
    • Programmieren
    • Audio & Video
    • Agentenaufgaben
    Preise
    $1.5 / $9 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemini 3.6 Flash

    Gemini Flash

    Flash model for coding and web/app development with fewer stray edits.

    MultimodalText + Bilder + Video + Dateien + Audio → Text
    • Programmieren
    • Audio & Video
    Preise
    $0.75 / $3.75 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemini 3.5 Flash Lite

    Gemini Flash-Lite

    Cheap Gemini for sub-agents that run focused tasks.

    MultimodalText + Bilder + Video + Dateien + Audio → Text
    • Geringe Kosten
    • Audio & Video
    • Schnelle Antworten
    Preise
    $0.3 / $2.5 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemini 2.5 Pro

    Gemini Pro

    Gemini with step-by-step thinking for math, science and code.

    MultimodalText + Bilder + Dateien + Audio + Video → Text
    • Logisches Denken
    • Audio & Video
    • Lange Dokumente
    Preise
    $1.25 / $10 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemini 3.1 Flash Lite

    Gemini Flash-Lite

    Low-latency Gemini for high volume. Reads audio, video and PDF.

    MultimodalText + Bilder + Video + Dateien + Audio → Text
    • Geringe Kosten
    • Schnelle Antworten
    • Audio & Video
    Preise
    $0.25 / $1.5 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemini 2.5 Flash Lite

    Gemini Flash-Lite

    Among the cheapest multimodal models here, 1M context.

    MultimodalText + Bilder + Dateien + Audio + Video → Text
    • Geringe Kosten
    • Schnelle Antworten
    • Audio & Video
    Preise
    $0.1 / $0.4 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemma 4 31B

    Gemma 4

    Open-weight dense model with image and video input and function calling.

    MultimodalBilder + Text + Video → Text
    • Offene Gewichte
    • Geringe Kosten
    • Bildverständnis
    Preise
    $0.09 / $0.34 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    262K Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Google

    Gemma 4 26B

    Gemma 4

    Open-weight MoE close to Gemma 4 31B quality at lower compute.

    MultimodalBilder + Text + Video → Text
    • Offene Gewichte
    • Geringe Kosten
    • Schnelle Antworten
    Preise
    $0.077 / $0.26 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    262K Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Moonshot AI

    Kimi K3

    Kimi

    Large open-weight multimodal model for coding and long agent runs.

    MultimodalText + Bilder + Video → Text
    • Programmieren
    • Agentenaufgaben
    • Offene Gewichte
    Preise
    $1.19 / $14 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Alibaba Qwen

    Qwen3.8 Max

    Qwen3.8

    Largest Qwen, with text, image and video input.

    MultimodalText + Bilder + Video → Text
    • Logisches Denken
    • Programmieren
    • Audio & Video
    Preise
    $2 / $6 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Alibaba Qwen

    Qwen3.8 Flash

    Qwen3.8

    Cheap multimodal Qwen for charts, documents and long videos.

    MultimodalText + Bilder + Video → Text
    • Geringe Kosten
    • Audio & Video
    • Bildverständnis
    Preise
    $0.15 / $0.47 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Alibaba Qwen

    Qwen3.6 Flash

    Qwen3.6

    Fast Qwen with image and video input and a 1M context.

    MultimodalText + Bilder + Video → Text
    • Schnelle Antworten
    • Geringe Kosten
    • Audio & Video
    Preise
    $0.19 / $1.13 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Z.ai

    GLM-5V Turbo

    GLM-5V

    GLM that reads images and video, for vision-based coding.

    MultimodalBilder + Text + Video → Text
    • Bildverständnis
    • Programmieren
    • Audio & Video
    Preise
    $1.2 / $4 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    203K Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • MiniMax

    MiniMax M3

    MiniMax

    Multimodal model with a 1M context for long agent work.

    MultimodalText + Bilder + Video → Text
    • Audio & Video
    • Agentenaufgaben
    • Geringe Kosten
    Preise
    $0.3 / $1.2 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Meta

    Muse Spark 1.3

    Muse Spark

    Keeps track of long tasks. Reads text, images, audio, video and PDF.

    MultimodalText + Bilder + Video + Dateien → Text
    • Agentenaufgaben
    • Audio & Video
    • Lange Dokumente
    Preise
    $1.25 / $4.25 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • Meta

    Muse Spark 1.1

    Muse Spark

    Multimodal reasoning for agent tasks, 1M context.

    MultimodalText + Bilder + Video + Dateien → Text
    • Agentenaufgaben
    • Audio & Video
    Preise
    $1.25 / $4.25 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    1M Kontext
    Sofort in endue nutzbarIm Agenten verwenden
  • StepFun

    Step 3.7 Flash

    Step

    Efficient MoE with native image and video understanding.

    MultimodalText + Bilder + Video → Text
    • Audio & Video
    • Geringe Kosten
    • Bildverständnis
    Preise
    $0.2 / $1.15 pro 1 Mio. Tokens, Eingabe / Ausgabe
    Kontextfenster
    262K Kontext
    Sofort in endue nutzbarIm Agenten verwenden