#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Conversazioni a vocina naturale in tempo reale con ChatGPT
ScreenAgent
Agente open-source per il controllo delle interfacce utente tramite pianificazione ed esecuzione del mouse/tastiera.
Grok 2
Chatbot di ragionamento dell'AI di x con supporto per l'input multimodale e generazione di immagini.
Nexa AI
Runtime di AI locale per il caricamento di modelli direttamente sui dispositivi tra telefoni, computer e hardware di rete periferica.
Project Astra
L'agente di intelligenza artificiale universale di Google DeepMind che vedrà, ascolterà ed inferirà sul mondo in tempo reale.
OmniVision
Modello visivo-linguistico compatto progettato per la distribuzione di intelligenza artificiale al margine dispositivo/edge.
Humain AI
Azienda ai-supported saudita che costruisce infrastrutture su larga scala e LLM multimodali per l'Arabico per i servizi AI globali.
Uni-1 by Luma AI
Modello di apprendimento multi-sensoriale per la generazione di immagini ad alta fidelità con ragionamento spaziale forte e rendering del testo preciso.
Black Forest Labs
Un'azienda startup pioniera di intelligenza artificiale specializzata nell'utilizzo di modelli generativi di ultima generazione per la sintesi di immagini e video.
Veo 4
Generazione di video cinematografici multi-scena con audio sincronizzato nativo
OpenArt
Suite di intelligenza artificiale creativa per generare arte, video e audio da testi o immagini
SuperAnnotate
Piattaforma di annotazione dei dati end-to-end per la creazione di set di training di alta qualità per l'intelligenza artificiale.
Gemma 3
Un modello di intelligenza artificiale open-source ottimizzato per le prestazioni da un GPU, che supporta l'ingresso multimodale e oltre 140 lingue.
GLM-4.6V
Modello multiminimale open-source GLM da Z.ai che unisce visione, testo e chiamata dell'utente per la ragionevolezza in lungo contesto, ricerca, codifica e interfaccia-utente-a-codice.
HappyHorse
Modello open-source che genera video con audio sincronizzato da un unico prompt.
OpenAI GPT-4
Modello di linguaggio avanzato multimediali di OpenAI per la comprensione del testo, del codice e dell'immagine.
Codex CLI
Aiuto AI per terminale open-source che legge, scrive e esegue il codice localmente con input multimodale.
LTX 2.3 Video Generator
Generatore di video AI che unifica i punti di partenza testuali, le immagini e l'audio in clips a breve durata coerenti.
MyShell
Piattaforma senza codice per l'interazione con l'intelligenza artificiale, per costruire, condividere e possedere applicazioni AI.
LiveKit Agents
Frammento open-source per la creazione di agenti AI real-time con voce, video e multimodalità.
Aivah
Crea agenti interattivi di avatar di intelligenza artificiale per esperienze digitali immersive
Voice-gen.ai
Piattaforma unificata per la generazione di voce, immagini e video con intelligenza artificiale in un'unica area di lavoro.
WebVoyager
Un agente web alimentato da LMM per completare le istruzioni degli utenti dall'inizio alla fine interagendo con siti web reali.
Jina AI
Fondamento per la ricerca multimodale per embedded, reranking e flussi RAG.
Seedance 1.5 Pro
Piattaforma di AI per la creazione di video con audio sincronizzato (voce, sincronizzazione labbra, SFX) da testi o immagini, più generazione di immagini e strumenti di editing immagini con AI.























