AgentPantheon

#Multimodal

25 tools tagged “Multimodal


OpenAI Advanced Voice logo
#1

OpenAI Advanced Voice

Echtzeit, natürliche Sprachgespräche mit ChatGPT

4.7 (6)
2Freemium
ScreenAgent logo
#2

ScreenAgent

Offene Quellensprach-Modell-Agent zur Steuerung von Computer-GUIs über Maus/Tastenplanung und -ausführung.

4.4 (5)
Freemium
Grok 2 logo
#3

Grok 2

xAI-chatbot mit Fokus auf logische Argumentation, unterstützt Bildgenerierung und multimodale Eingaben

4.3 (4)
Freemium
N
#4

Nexa AI

On-Device AI Runtime für die lokale Ausführung von Modellen auf Smartphones, PCs und Edge-Hardware.

4.8 (6)
Free
Project Astra logo
#5

Project Astra

Ein universales AI-Agent, das mit Google DeepMind die Welt sieht, hört und sich in Echtzeit über die Welt unterhält.

5.0 (4)
Freemium
OmniVision logo
#6

OmniVision

Kompaktes Vision‑Language-Modell für On‑Device- und Edge‑AI-Bereitstellung.

4.6 (5)
Freemium
Humain AI logo
#7

Humain AI

Eine Saudi geförderte AI-Gesellschaft, die großskalige Infrastruktur und multimodale arabische LLMs für globale AI-Dienste entwickelt.

4.7 (6)
Contact
Uni-1 by Luma AI logo
#8

Uni-1 by Luma AI

Multimodale KI-Modell für hochwertige Bildgenerierung mit starker räumlicher Argumentation und genauem Textdarstellung.

4.7 (6)
Freemium
Black Forest Labs logo
#9

Black Forest Labs

Ein Pionier in der KI-Industrie, spezialisiert auf fortschrittliche erzeugende Modelle für Bild- und Videounterstellungen.

5.0 (6)
Freemium
Veo 4 logo
#10

Veo 4

Vielfachschuss-Kinematografie für AI-generierte Videos mit native synchronisierter Audio

4.6 (5)
Freemium
OpenArt logo
#11

OpenArt

Kreative KI‑Suite zum Erstellen von Kunst, Video und Audio aus Text oder Bildern

4.7 (6)
Freemium
SuperAnnotate logo
#12

SuperAnnotate

Von Ende bis Ende-Plattform für die Datenannotation und -verwaltung für die Erstellung hochwertiger Trainingsdatensätze für AI

4.4 (5)
Freemium
Gemma 3 logo
#13

Gemma 3

Ein offenes AI-Modell für Single-GPU-Leistung optimiert, um multimodale Eingaben und über 140 Sprachen unterstützend.

4.8 (5)
Free
GLM-4.6V logo
#14

GLM-4.6V

Open-Source-Multimodal-GLM von Z.ai, die visuelle, textuelle und funktionsaufrufbasierte Einheit zur Verarbeitung großer Kontexte, zum Suchen, zum Programmieren und zur Code-Generierung umfasst.

4.3 (6)
Free
HappyHorse logo
#15

HappyHorse

Open-Source-Modell, das Video und synchronisierte Audio aus einer einzelnen Anregung generiert.

4.7 (6)
Free
OpenAI GPT-4 logo
#16

OpenAI GPT-4

OpenAI's multimodales großes Sprachmodell für Text, Code und Bildverständnis.

4.5 (6)
Freemium
Codex CLI logo
#17

Codex CLI

Open-source, terminaleigene AI-Assistent, der lokal Code liest, schreibt und ausführt, unterstützt multimodale Eingaben.

4.8 (5)
Free
LTX 2.3 Video Generator logo
#18

LTX 2.3 Video Generator

KI-Videogenerator, der Textaufforderungen, Bilder und Audio zu zusammenhängenden Kurzvideos vereint.

4.5 (4)
Free
MyShell logo
#19

MyShell

No-code AI Consumer-Plattform zum Erstellen, Teilen und Inhabens von AI-Apps.

4.8 (5)
Freemium
LiveKit Agents logo
#20

LiveKit Agents

Open-Source-Framework zur Entwicklung von Echtzeit-, multimodalen Sprach- und Video-AI-Agenten.

4.5 (6)
Freemium
Aivah logo
#21

Aivah

Entwickeln von interaktiven AI- Avatar-Agenten für immersive digitale Erfahrungen

4.8 (4)
Freemium
Voice-gen.ai logo
#22

Voice-gen.ai

Einzige Plattform für AI-generierte Sprechertexte, Bilder und Videos in einem Workspace.

4.8 (4)
Free
WebVoyager logo
#23

WebVoyager

Ein LMM-gestützter Webagent, der Benutzeranweisungen end-to-end durch Interaktion mit Websites im Internet abschließt.

5.0 (5)
Freemium
Jina AI logo
#24

Jina AI

Multimodale Suchgrundlage für Embeddings, Reranking und RAG-Pipelines.

4.2 (5)
Free
Seedance 1.5 Pro logo
#25

Seedance 1.5 Pro

Plattform für AI-gestützte Bildung von Videos mit synchronisierten Audio (Stimme, Lippen-Synchronisation, SFX) von Text oder Bilddaten, plus Bildgenerierung und AI-gestützter Bildbearbeitung.

4.8 (5)
Paid