#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Conversaciones en voz natural y en tiempo real con ChatGPT
ScreenAgent
Agente de VLM de código abierto para controlar interfaz de usuario de computadora mediante planificación y ejecución de teclado / ratón.
Grok 2
El chatbot centrado en el razonamiento de xAI con generación de imágenes y soporte para entradas multimodales.
Nexa AI
Runtime de Inteligencia Artificial para dispositivos que permite ejecutar modelos localmente en teléfonos, PCs y hardware de borde.
Project Astra
Agente AI universal de Google DeepMind que ve, escucha y razona sobre el mundo en tiempo real.
OmniVision
Modelo de visión-lenguaje compacto diseñado para la implementación de inteligencia en el borde y dispositivos móviles.
Humain AI
Una empresa de IA respaldada por Arabia Saudita que construye infraestructuras a gran escala y modelos de lenguaje multimedios en árabe para servicios de IA globales.
Uni-1 by Luma AI
Modelo de inteligencia artificial multimodal para la generación de imágenes de alta fidelidad con una sólida comprensión espacial y renderizado de texto preciso.
Black Forest Labs
Una startup pionera en IA especializada en modelos generativos de última generación para la síntesis de imágenes y vídeo.
Veo 4
Generación de video cinemático con múltiples disparos AI con audio sincronizado nativo
OpenArt
Conjunto de Inteligencia Artificial para la generación de arte, video y audio a partir de texto o imágenes
SuperAnnotate
Plataforma de anotación de datos integral y gestión para crear conjuntos de entrenamiento de alta calidad de IA.
Gemma 3
Un modelo de IA de código abierto optimizado para rendimiento en una sola GPU, que admite entradas multimodales y más de 140 idiomas.
GLM-4.6V
GLM‑4.6V, modelo multimodal de código abierto de Z.ai que unifica visión, texto y llamadas a herramientas para razonamiento de contexto largo, búsqueda, codificación y conversión UI‑a‑código.
HappyHorse
Modelo de código abierto que genera vídeo sincronizado con audio a partir de un único prompt.
OpenAI GPT-4
Modelo de lenguaje grande multimodal de OpenAI para la comprensión de texto, código y imágenes.
Codex CLI
Asistente de terminal AI de código abierto que lee, escribe y ejecuta código localmente con entrada multimodal
LTX 2.3 Video Generator
Generador de video con AI que une promps de texto, imágenes, y audio en clips cortos coherentes.
MyShell
Plataforma de consumo de AI sin código para crear, compartir y poseer aplicaciones de AI.
LiveKit Agents
Marco de código abierto para crear agentes de voz y video inteligentes en tiempo real, multimodales.
Aivah
Crea agentes de avatares de IA interactivos para experiencias digitales inmersivas
Voice-gen.ai
Plataforma unificada para la generación de voz, imágenes y videos con inteligencia artificial en un espacio de trabajo.
WebVoyager
Un agente web impulsado por LMM que completa instrucciones del usuario de principio a fin interactuando con sitios web reales.
Jina AI
Fundación de búsqueda multimodal para embeddings, reranking y pipelines RAG.
Seedance 1.5 Pro
Plataforma de creación de contenido IA para generar videos con audio y síncronización de labios (voz, sincronización de labios, EFX) desde texto o imágenes, más generación de imágenes y herramientas de edición de imágenes con IA.























