#Multimodal AI
19 tools tagged “Multimodal AI”
GenMix
Plataforma de IA tudo-em-um com 20+ modelos para criação de vídeo, imagem e voz
wan2-6.org
Gerador de vídeo multimodal de IA produzindo clipes de 1080p a partir de texto, imagens e entradas de referência.
Reka AI
Modelos de base multimodal que entendem texto, imagens, vídeo e áudio.
AMIE
Um agente diagnóstico multimodal de IA que conduz conversas clínicas e interpreta imagens médicas para diagnósticos precisos.
chris li
Gerador de vídeo multimodal com IA que transforma texto, imagens ou áudio em vídeos curtos.
Zenor AI
Assistente de compras de IA multimodal para lojas Shopify usando texto, voz e imagem.
OpenAdapt
Uma estrutura de código aberto que automatiza fluxos de trabalho de desktop usando grandes modelos multimodais.
Gemini Omni
IA multimodal para gerar, editar e renderizar vídeo pronto para produção
evolink
API unificada para IA multimodal em chat, imagem e vídeo
Seedance
Plataforma de IA multimodal para texto-para-vídeo, imagem-para-vídeo, texto-para-imagem e criação de dublagem.
HappyHorse-model
Plataforma de IA multimodal para gerar vídeos, imagens e áudio a partir de prompts de texto ou mídia.
Wan 2.7 AI Video Generator
Plataforma multimodal de IA para gerar vídeo consistente e controlável a partir de texto, imagens e referências.
Unitree R1
Robô humanoide compacto com 26 juntas e IA multimodal para pesquisa e educação
C Dance ai
Gerador de vídeo de dança multimodal de IA que transforma texto, imagens, áudio e clipes em vídeos de dança.
Google Gemini 2.0
Modelo de IA multimodal do Google criado para tarefas agenciais, raciocínio e uso nativo de ferramentas.
Self-Operating Computer
Agente de IA de código aberto que opera seu computador por meio de visão de tela e controle de mouse/teclado.
Gemini
Família de modelos de IA multimodal do Google com compreensão de contexto longo e arquitetura MoE.
AssiPilot
Assistente de IA tudo-em-um para criar imagens, vídeos, narrações e músicas
Seedance 2 AI Video Generator
Gerador de vídeo multimodal de IA que transforma texto, imagens e áudio em clipes curtos cinematográficos.


















