#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Echtzeit, natürliche Sprachgespräche mit ChatGPT
ScreenAgent
Offene Quellensprach-Modell-Agent zur Steuerung von Computer-GUIs über Maus/Tastenplanung und -ausführung.
Grok 2
xAI-chatbot mit Fokus auf logische Argumentation, unterstützt Bildgenerierung und multimodale Eingaben
Nexa AI
On-Device AI Runtime für die lokale Ausführung von Modellen auf Smartphones, PCs und Edge-Hardware.
Project Astra
Ein universales AI-Agent, das mit Google DeepMind die Welt sieht, hört und sich in Echtzeit über die Welt unterhält.
OmniVision
Kompaktes Vision‑Language-Modell für On‑Device- und Edge‑AI-Bereitstellung.
Humain AI
Eine Saudi geförderte AI-Gesellschaft, die großskalige Infrastruktur und multimodale arabische LLMs für globale AI-Dienste entwickelt.
Uni-1 by Luma AI
Multimodale KI-Modell für hochwertige Bildgenerierung mit starker räumlicher Argumentation und genauem Textdarstellung.
Black Forest Labs
Ein Pionier in der KI-Industrie, spezialisiert auf fortschrittliche erzeugende Modelle für Bild- und Videounterstellungen.
Veo 4
Vielfachschuss-Kinematografie für AI-generierte Videos mit native synchronisierter Audio
OpenArt
Kreative KI‑Suite zum Erstellen von Kunst, Video und Audio aus Text oder Bildern
SuperAnnotate
Von Ende bis Ende-Plattform für die Datenannotation und -verwaltung für die Erstellung hochwertiger Trainingsdatensätze für AI
Gemma 3
Ein offenes AI-Modell für Single-GPU-Leistung optimiert, um multimodale Eingaben und über 140 Sprachen unterstützend.
GLM-4.6V
Open-Source-Multimodal-GLM von Z.ai, die visuelle, textuelle und funktionsaufrufbasierte Einheit zur Verarbeitung großer Kontexte, zum Suchen, zum Programmieren und zur Code-Generierung umfasst.
HappyHorse
Open-Source-Modell, das Video und synchronisierte Audio aus einer einzelnen Anregung generiert.
OpenAI GPT-4
OpenAI's multimodales großes Sprachmodell für Text, Code und Bildverständnis.
Codex CLI
Open-source, terminaleigene AI-Assistent, der lokal Code liest, schreibt und ausführt, unterstützt multimodale Eingaben.
LTX 2.3 Video Generator
KI-Videogenerator, der Textaufforderungen, Bilder und Audio zu zusammenhängenden Kurzvideos vereint.
MyShell
No-code AI Consumer-Plattform zum Erstellen, Teilen und Inhabens von AI-Apps.
LiveKit Agents
Open-Source-Framework zur Entwicklung von Echtzeit-, multimodalen Sprach- und Video-AI-Agenten.
Aivah
Entwickeln von interaktiven AI- Avatar-Agenten für immersive digitale Erfahrungen
Voice-gen.ai
Einzige Plattform für AI-generierte Sprechertexte, Bilder und Videos in einem Workspace.
WebVoyager
Ein LMM-gestützter Webagent, der Benutzeranweisungen end-to-end durch Interaktion mit Websites im Internet abschließt.
Jina AI
Multimodale Suchgrundlage für Embeddings, Reranking und RAG-Pipelines.
Seedance 1.5 Pro
Plattform für AI-gestützte Bildung von Videos mit synchronisierten Audio (Stimme, Lippen-Synchronisation, SFX) von Text oder Bilddaten, plus Bildgenerierung und AI-gestützter Bildbearbeitung.























