#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Conversations vocales en temps réel et naturelles avec ChatGPT
ScreenAgent
Agent de langage visuel ouvert-source pour contrôler les interfaces graphiques d'ordinateur via planification et exécution de souris/clavier.
Grok 2
Chatbot de raisonnement focalisé xAI avec génération d'image et prise en charge multi-modale d'entrée
Nexa AI
Environnement d'exécution IA sur appareil pour exécuter des modèles localement sur téléphones, PC et matériel edge.
Project Astra
L'agent universel d'IA de Google DeepMind qui voit, entend et raisonne sur le monde en temps réel.
OmniVision
Modèle vision-langage compact conçu pour le déploiement sur appareil et en périphérie
Humain AI
Une société saoudienne soutenant l'intelligence artificielle développant des infrastructures à grande échelle et des LLM multimodaux en arabe pour les services d'intelligence artificielle mondiaux.
Uni-1 by Luma AI
Modèle AI multimodal pour la génération de images de haute fidélité avec mécanismes de raisonnement spatiaux avancés et traitement précis du texte dans l'image.
Black Forest Labs
Une startup AI pionnière spécialisée dans des modèles génératifs de pointe pour la synthèse d'images et de vidéos.
Veo 4
Contrôle cinématographique de la vidéo assistée par l'IA avec synchronisation audio native
OpenArt
Suite AI créative pour générer art, vidéo et audio à partir de texte ou d'images
SuperAnnotate
Plateforme de notation de données et de gestion de données de capteur pour construire des jeux de données d'entraînement haute qualité pour l'IA.
Gemma 3
Un modèle AI open-source optimisé pour la performance d'un GPU unique, supportant les entrées multimodales et plus de 140 langues.
GLM-4.6V
Modèle de langage GLM unissant vision, texte et appels d'outils ouverts source par Z.ai pour la raison de longue durée, les recherches, la codification et UI-to-code.
HappyHorse
Modèle open-source qui génère des vidéos avec une bande audio synchronisée à partir d'une seule prompte.
OpenAI GPT-4
Le modèle de langage large multimodal d'OpenAI pour la compréhension du texte, du code et des images.
Codex CLI
Assistant AI de ligne de commande open-source qui lit, écrit et exécute le code localement avec des entrées multimodales.
LTX 2.3 Video Generator
Générateur de vidéos AI qui unifie les invites textuelles, les images et l'audio en clips courts cohérents.
MyShell
Plateforme grand public AI sans code pour créer, partager et posséder des applications IA.
LiveKit Agents
Cadre ouvert pour la création d'agents IA à voix et vidéo multimodaux en temps réel.
Aivah
Créez des agents avatar IA interactifs pour des expériences numériques immersives
Voice-gen.ai
Unisexuel plate-forme pour le création de voix synthétique, images et vidéos
WebVoyager
WebVoyager, votre agent Web puissant propulsé par des modèles multimodales méthodes (LMM)
Jina AI
Fondation de recherche multimodale pour les embeddings, le réordonnancement et les pipelines RAG
Seedance 1.5 Pro
Plateforme d'IA pour la création de vidéos avec son synchronisé (voix, lip-synch, FX sonores) à partir de texte ou d'images, plus de génération d'image et d'outils d'édition AI d'image.























