#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Real-tidiga, naturliga röstsamtal med ChatGPT
ScreenAgent
Öppen-källkodsbaserad VLM-agenter för att kontrollera datorns GUI via mus-/ tangentbordspianering och -utvinning.
Grok 2
xAI:s förståelsefokuserade chattbot med stöd för bildgenerering och flermodulär inmatning.
Nexa AI
Kör AI-modeller lokalt på enheter som telefoner, datorer och edge-hårdvara
Project Astra
Googles DeepMind universella AI-agent som ser, hör och resonerar om världen i realtid.
OmniVision
Kompakt bildspråksmodell byggd för lokal och kant-AI-distribution.
Humain AI
En AI-företag med säte i Saudiarabien som bygger upp stora infrastrukturer och multimodal arabiska LLM:er för globala AI-tjänster.
Uni-1 by Luma AI
Multimodal AI-modell för högkvalitativ bildskapande med stark rumslig förståelse och exakt textrendering.
Black Forest Labs
En banbrytande AI-startup som specialiserar sig på toppmoderna generativa modeller för bild- och videosyntes.
Veo 4
Multishots med AI-baserad video och nativt synkroniserad ljud
OpenArt
Kreativ AI-paket för att skapa konst, video och ljud från text eller bilder
SuperAnnotate
Plattform för slutförande av dataanpassning och hantering för att utveckla högkvalitativa AI-träningsuppsättningar.
Gemma 3
Ett öppen källkodsförd AI-modell optimerad för enskild-GPU-prestanda, som stödjer multimodal ingångar och fler än 140 språk.
GLM-4.6V
Öppen källkodsmultimodal GLM från Z.ai som samlar vision, text och verktygsanrop för långsam resonemang, sökning, kodning och UI-to-kod.
HappyHorse
Öppen-sourcemodel som genererar video kopplat med synchroniserad ljud från en enda anspelning.
OpenAI GPT-4
OpenAI:s multimodala stora språkmodell för text-, kod- och bildförståelse.
Codex CLI
Open-source terminal AI-assistent som läser, skriver och kör kod lokalt med multimodal indata.
LTX 2.3 Video Generator
AI-videogenerator som förenar textprompt, bild och ljud till sammanhängande korta klipp.
MyShell
No-code-plattform för AI-konsumenter att bygga, dela och äga AI-applikationer.
LiveKit Agents
Öppenkällkodsramverk för att skapa realtids-, multimodala röst- och video-AI-agenter.
Aivah
Skapa interaktiva AI‑avatar‑agenter för uppslukande digitala upplevelser
Voice-gen.ai
En enkel plattform för AI-genererade röstrecensioner, bilder och videor i ett arbetsytefönster.
WebVoyager
Ett LMM-drivet webbservant som slutför användares instruktioner från början till slut genom att interagera med riktiga webbplatser.
Jina AI
Multimodalt sökfoundation för inbäddningar, omrankning och RAG-pipelines
Seedance 1.5 Pro
Plattform för AI-baserade skapande av videor med synkroniserat ljud (röst, munrörelser, effekter) från text eller bilder samt bildgenerering och redigering av bilder med AI.























