#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Rozmowy głosowe w czasie rzeczywistym, naturalne, z ChatGPT
ScreenAgent
Otwartoźródłowy agent VLM do sterowania interfejsami graficznymi komputerów poprzez planowanie i wykonywanie operacji myszy oraz klawiatury
Grok 2
Chatbot skupiony na rozumowaniu od xAI, z generowaniem obrazów i obsługą wejścia multimodalnego.
Nexa AI
Silnik AI działający na urządzeniu do uruchamiania modeli lokalnie na telefonach, komputerach PC i urządzeniach brzegowych.
Project Astra
Uniwersalny agent AI od Google DeepMind, który widzi, słyszy i rozumie świat w czasie rzeczywistym.
OmniVision
Kompaktowy model wizyjno-językowy stworzony dla wdrożeń AI na urządzeniu i krawędzi sieci.
Humain AI
Firma AI wspierana przez Saudyjski rząd, budująca infrastrukturę na dużą skalę oraz multimodalne arabskie LLMy dla globalnych usług AI.
Uni-1 by Luma AI
Wielomodalny model AI do generowania obrazów o wysokiej wierności, z silnym rozumowaniem przestrzennym i dokładnym renderowaniem tekstu.
Black Forest Labs
Przedsiębiorstwo AI pionierskie specjalizujące się w najnowocześniejszych modelach generatywnych do syntezy obrazów i wideo.
Veo 4
Kinematograficzne generowanie wideo AI w trybie wieloklatkowym z natywnym zsynchronizowanym dźwiękiem
OpenArt
Kreacyjna platforma AI do generowania sztuki, wideo i dźwięku z tekstu lub obrazów
SuperAnnotate
Platforma end-to-end do oznaczania i zarządzania danymi, służąca do tworzenia wysokiej jakości zestawów danych szkoleniowych AI.
Gemma 3
Otwartoźródłowy model AI zoptymalizowany pod wydajność na pojedynczym GPU, obsługujący multimodalne wejścia i ponad 140 języków.
GLM-4.6V
Otwartoźródłowy multimodalny GLM od Z.ai integrujący wizję, tekst i wywoływanie narzędzi w celu rozumowania w długim kontekście, wyszukiwania, programowania oraz konwersji UI na kod.
HappyHorse
Model open-source generujący wideo z synchronizowanym dźwiękiem na podstawie jednego polecenia.
OpenAI GPT-4
Wielomodalny duży model językowy OpenAI do rozumienia tekstu, kodu i obrazu.
Codex CLI
Otwartoźródłowy terminalowy asystent AI, który odczytuje, zapisuje i uruchamia kod lokalnie z obsługą wielomodalnego wejścia.
LTX 2.3 Video Generator
Generator wideo AI, który łączy podpowiedzi tekstowe, obrazy i dźwięk w spójne krótkie klipy.
MyShell
Platforma konsumencka AI bez kodu do tworzenia, udostępniania i posiadania aplikacji AI
LiveKit Agents
Open-sourceowy framework do tworzenia agentów głosowych i wideo AI w czasie rzeczywistym, multimodalnych.
Aivah
Twórz interaktywne agenty awatarów AI dla immersyjnych doświadczeń cyfrowych
Voice-gen.ai
Zintegrowana platforma do generowania AI‑napędzanych lektorów, obrazów i wideo w jednym miejscu pracy.
WebVoyager
Agent internetowy oparty na LMM, realizujący instrukcje użytkownika od początku do końca poprzez interakcję z rzeczywistymi stronami internetowymi.
Jina AI
Podstawa wyszukiwania multimodalnego dla osadzeń, ponownego uporządkowania i potoków RAG.
Seedance 1.5 Pro
Platforma AI do tworzenia wideo z synchronizowanym dźwiękiem (głos, lip-sync, SFX) na podstawie tekstu lub obrazów, wraz z generowaniem i edycją obrazów AI.























