AgentPantheon

#Multimodal

25 tools tagged “Multimodal


OpenAI Advanced Voice logo
#1

OpenAI Advanced Voice

Rozmowy głosowe w czasie rzeczywistym, naturalne, z ChatGPT

4.7 (6)
2Freemium
ScreenAgent logo
#2

ScreenAgent

Otwartoźródłowy agent VLM do sterowania interfejsami graficznymi komputerów poprzez planowanie i wykonywanie operacji myszy oraz klawiatury

4.4 (5)
Freemium
Grok 2 logo
#3

Grok 2

Chatbot skupiony na rozumowaniu od xAI, z generowaniem obrazów i obsługą wejścia multimodalnego.

4.3 (4)
Freemium
N
#4

Nexa AI

Silnik AI działający na urządzeniu do uruchamiania modeli lokalnie na telefonach, komputerach PC i urządzeniach brzegowych.

4.8 (6)
Free
Project Astra logo
#5

Project Astra

Uniwersalny agent AI od Google DeepMind, który widzi, słyszy i rozumie świat w czasie rzeczywistym.

5.0 (4)
Freemium
OmniVision logo
#6

OmniVision

Kompaktowy model wizyjno-językowy stworzony dla wdrożeń AI na urządzeniu i krawędzi sieci.

4.6 (5)
Freemium
Humain AI logo
#7

Humain AI

Firma AI wspierana przez Saudyjski rząd, budująca infrastrukturę na dużą skalę oraz multimodalne arabskie LLMy dla globalnych usług AI.

4.7 (6)
Contact
Uni-1 by Luma AI logo
#8

Uni-1 by Luma AI

Wielomodalny model AI do generowania obrazów o wysokiej wierności, z silnym rozumowaniem przestrzennym i dokładnym renderowaniem tekstu.

4.7 (6)
Freemium
Black Forest Labs logo
#9

Black Forest Labs

Przedsiębiorstwo AI pionierskie specjalizujące się w najnowocześniejszych modelach generatywnych do syntezy obrazów i wideo.

5.0 (6)
Freemium
Veo 4 logo
#10

Veo 4

Kinematograficzne generowanie wideo AI w trybie wieloklatkowym z natywnym zsynchronizowanym dźwiękiem

4.6 (5)
Freemium
OpenArt logo
#11

OpenArt

Kreacyjna platforma AI do generowania sztuki, wideo i dźwięku z tekstu lub obrazów

4.7 (6)
Freemium
SuperAnnotate logo
#12

SuperAnnotate

Platforma end-to-end do oznaczania i zarządzania danymi, służąca do tworzenia wysokiej jakości zestawów danych szkoleniowych AI.

4.4 (5)
Freemium
Gemma 3 logo
#13

Gemma 3

Otwartoźródłowy model AI zoptymalizowany pod wydajność na pojedynczym GPU, obsługujący multimodalne wejścia i ponad 140 języków.

4.8 (5)
Free
GLM-4.6V logo
#14

GLM-4.6V

Otwartoźródłowy multimodalny GLM od Z.ai integrujący wizję, tekst i wywoływanie narzędzi w celu rozumowania w długim kontekście, wyszukiwania, programowania oraz konwersji UI na kod.

4.3 (6)
Free
HappyHorse logo
#15

HappyHorse

Model open-source generujący wideo z synchronizowanym dźwiękiem na podstawie jednego polecenia.

4.7 (6)
Free
OpenAI GPT-4 logo
#16

OpenAI GPT-4

Wielomodalny duży model językowy OpenAI do rozumienia tekstu, kodu i obrazu.

4.5 (6)
Freemium
Codex CLI logo
#17

Codex CLI

Otwartoźródłowy terminalowy asystent AI, który odczytuje, zapisuje i uruchamia kod lokalnie z obsługą wielomodalnego wejścia.

4.8 (5)
Free
LTX 2.3 Video Generator logo
#18

LTX 2.3 Video Generator

Generator wideo AI, który łączy podpowiedzi tekstowe, obrazy i dźwięk w spójne krótkie klipy.

4.5 (4)
Free
MyShell logo
#19

MyShell

Platforma konsumencka AI bez kodu do tworzenia, udostępniania i posiadania aplikacji AI

4.8 (5)
Freemium
LiveKit Agents logo
#20

LiveKit Agents

Open-sourceowy framework do tworzenia agentów głosowych i wideo AI w czasie rzeczywistym, multimodalnych.

4.5 (6)
Freemium
Aivah logo
#21

Aivah

Twórz interaktywne agenty awatarów AI dla immersyjnych doświadczeń cyfrowych

4.8 (4)
Freemium
Voice-gen.ai logo
#22

Voice-gen.ai

Zintegrowana platforma do generowania AI‑napędzanych lektorów, obrazów i wideo w jednym miejscu pracy.

4.8 (4)
Free
WebVoyager logo
#23

WebVoyager

Agent internetowy oparty na LMM, realizujący instrukcje użytkownika od początku do końca poprzez interakcję z rzeczywistymi stronami internetowymi.

5.0 (5)
Freemium
Jina AI logo
#24

Jina AI

Podstawa wyszukiwania multimodalnego dla osadzeń, ponownego uporządkowania i potoków RAG.

4.2 (5)
Free
Seedance 1.5 Pro logo
#25

Seedance 1.5 Pro

Platforma AI do tworzenia wideo z synchronizowanym dźwiękiem (głos, lip-sync, SFX) na podstawie tekstu lub obrazów, wraz z generowaniem i edycją obrazów AI.

4.8 (5)
Paid