AgentPantheon

#Multimodal

25 tools tagged “Multimodal


OpenAI Advanced Voice logo
#1

OpenAI Advanced Voice

Sanntid, naturlige stemmebaserte samtaler med ChatGPT

4.7 (6)
2Freemium
ScreenAgent logo
#2

ScreenAgent

Open‑source VLM-agent for å kontrollere datamaskinens GUI‑er via muse- og tastaturplanlegging og utførelse.

4.4 (5)
Freemium
Grok 2 logo
#3

Grok 2

xAI sin resonneringsfokuserte chatbot med bildegenerering og støtte for multimodale inndata.

4.3 (4)
Freemium
N
#4

Nexa AI

On-device AI-runtime for kjøring av modeller lokalt på telefoner, PCer og edge‑hardware.

4.8 (6)
Free
Project Astra logo
#5

Project Astra

Google DeepMind's universelle AI-agent som ser, hører og forstår verden i sanntid.

5.0 (4)
Freemium
OmniVision logo
#6

OmniVision

Kompakt visjons‑språklig modell bygget for on‑device og edge‑AI‑utplassering.

4.6 (5)
Freemium
Humain AI logo
#7

Humain AI

Et saudisk-støttet AI-selskap som bygger infrastruktur i stor skala og multimodale arabiske LLM-er for globale AI-tjenester.

4.7 (6)
Contact
Uni-1 by Luma AI logo
#8

Uni-1 by Luma AI

Multi-modal AI- modell for høykvalitets bildegenerering med sterk romlig forståelse og nøyaktig tekstoppfølging

4.7 (6)
Freemium
Black Forest Labs logo
#9

Black Forest Labs

Et banebrytende AI-startup som spesialiserer seg på toppmoderne generative modeller for bilde- og videosyntese.

5.0 (6)
Freemium
Veo 4 logo
#10

Veo 4

Generering av multi-skuddelige filmmessige AI-videoklipp med nativt synkronisert lyd

4.6 (5)
Freemium
OpenArt logo
#11

OpenArt

Kreativ AI-suite for å generere kunst, video og lyd fra tekst eller bilder

4.7 (6)
Freemium
SuperAnnotate logo
#12

SuperAnnotate

Plattform for helt åpne datalabeling og -håndtering for å bygge høykvalitetsmaskinlærings-utdanningsdata.

4.4 (5)
Freemium
Gemma 3 logo
#13

Gemma 3

En åpen kildekode AI-modell optimalisert for enkelt-GPU-ytelse, som støtter multimodale innganger og over 140 språk.

4.8 (5)
Free
GLM-4.6V logo
#14

GLM-4.6V

Åpen kildekode multimodal GLM fra Z.ai som samler visjon, tekst og verktøykalling for langkontekst‑resonnering, søk, koding og UI-til-kode.

4.3 (6)
Free
HappyHorse logo
#15

HappyHorse

Åpen kildekode-modell som genererer video sammen med synkronisert lyd fra en enkelt prompt.

4.7 (6)
Free
OpenAI GPT-4 logo
#16

OpenAI GPT-4

OpenAIs multimodale LLM for tekst, kode og bildeforståelse.

4.5 (6)
Freemium
Codex CLI logo
#17

Codex CLI

Selvstendig terminal-AI-assistent som kan lese, skrive og kjøre kode lokalt med multimodal input

4.8 (5)
Free
LTX 2.3 Video Generator logo
#18

LTX 2.3 Video Generator

AI‑videogenerator som forener tekst‑prompter, bilder og lyd i sammenhengende korte klipp.

4.5 (4)
Free
MyShell logo
#19

MyShell

No-code AI-forbrukerplattform for å lage, dele og eie AI‑apper.

4.8 (5)
Freemium
LiveKit Agents logo
#20

LiveKit Agents

Open-source rammeverk for å bygge sanntids, multimodale stemme- og video-AI-agenter.

4.5 (6)
Freemium
Aivah logo
#21

Aivah

Bygg interaktive AI-avataragenter for innlevende digitale opplevelser

4.8 (4)
Freemium
Voice-gen.ai logo
#22

Voice-gen.ai

Samlet platform for generering av AI-drevne voiceovers, bilder og videoer i én arbeidsplass.

4.8 (4)
Free
WebVoyager logo
#23

WebVoyager

En LLM-drevet webagent som fullfører brukerinnledder sluttpunkt-t-til-sluttpunkt ved å interagere med virkelige verdens nettsteder.

5.0 (5)
Freemium
Jina AI logo
#24

Jina AI

Multimodal søkebasert plattform for embeddings, omrangering og RAG-pipelines

4.2 (5)
Free
Seedance 1.5 Pro logo
#25

Seedance 1.5 Pro

AI‑opprettelsesplattform for å generere videoer med synkronisert lyd (stemme, lip‑sync, SFX) fra tekst eller bilder, samt bildegenerering og AI‑bildebehandlingsverktøy.

4.8 (5)
Paid