#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Conversas de voz naturais em tempo real com ChatGPT
ScreenAgent
Agente VLM de código aberto para controlar GUIs de computador via planejamento e execução de mouse/teclado.
Grok 2
Chatbot focado no raciocínio do xAI com geração de imagens e suporte a entrada multimodal.
Nexa AI
Motor de IA em dispositivo para execução de modelos localmente em telefones, PCs e hardware de borda
Project Astra
Agente de IA universal do Google DeepMind que vê, ouve e raciocina sobre o mundo em tempo real.
OmniVision
Modelo de visão-linguagem compacto construído para implantação de IA em dispositivos e bordos.
Humain AI
Uma empresa de IA apoiada pela Arábia Saudita, construindo infraestrutura em larga escala e LLMs árabes multimodais para serviços de IA globais.
Uni-1 by Luma AI
Modelo de IA multimodal para geração de imagens de alta fidelidade com forte raciocínio espacial e renderização de texto precisa.
Black Forest Labs
Uma startup de IA pioneira especializada em modelos gerativos de última geração para síntese de imagens e vídeos.
Veo 4
Geração de vídeo AI cinematográfico de múltiplas tomadas com áudio sincronizado nativo
OpenArt
Suíte de IA criativa para gerar arte, vídeo e áudio a partir de texto ou imagens
SuperAnnotate
Plataforma de anotação e gerenciamento de dados de ponta a ponta para construir conjuntos de dados de treinamento de IA de alta qualidade.
Gemma 3
Um modelo de IA de código aberto otimizado para desempenho em GPU único, suportando entradas multimodais e mais de 140 idiomas.
GLM-4.6V
Modelo multimodal GLM de código aberto da Z.ai unificando visão, texto e chamadas de ferramentas para raciocínio de longo contexto, busca, codificação e UI-para-código.
HappyHorse
Modelo de código aberto que gera vídeo acompanhado de áudio sincronizado a partir de uma única instrução.
OpenAI GPT-4
Modelo de linguagem multimodal de grande escala da OpenAI para texto, código e compreensão de imagens.
Codex CLI
Assistente de IA de terminal de código aberto que lê, escreve e executa código localmente com entrada multimodal.
LTX 2.3 Video Generator
Gerador de vídeo por IA que une prompts de texto, imagens e áudio em clipes curtos coesos.
MyShell
Plataforma de consumo de IA sem código para criar, compartilhar e possuir aplicativos de IA.
LiveKit Agents
Estrutura de código aberto para construir agentes de voz e vídeo multimodais em tempo real com IA.
Aivah
Crie agentes de avatar IA interativos para experiências digitais imersivas
Voice-gen.ai
Plataforma unificada para vozes, imagens e vídeos gerados por IA em um único espaço de trabalho.
WebVoyager
Um agente web alimentado por LMM que completa instruções de usuário de ponta a ponta interagindo com sites do mundo real.
Jina AI
Fundação de busca multimodal para embeddings, rerankings e pipelines de RAG.
Seedance 1.5 Pro
Plataforma de criação de IA para gerar vídeos com áudio sincronizado (voz, sincronização de lábios, efeitos sonoros) a partir de texto ou imagens, além de ferramentas de geração de imagens e edição de imagens com IA.























