#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
Розмови голосом в реальному часі з ChatGPT
ScreenAgent
Відкритий VLM‑агент для керування графічним інтерфейсом комп'ютера за допомогою планування й виконання дій миші й клавіатури.
Grok 2
xCи чатбот з фокусом на логічне мислення з підтримкою створення зображень та багатовимірної обробки даних.
Nexa AI
Рантайм локального ШІ для виконання моделей безпосередньо на телефонах, комп'ютерах та обладнанні краю мережі
Project Astra
Універсальний AI‑агент Google DeepMind, що бачить, слухає і розуміє світ у реальному часі.
OmniVision
Компактна модель відео-мови, створена для розгортання ШІ на пристроях та на краю мережі.
Humain AI
Компанія на підтримці Саудівської Аравії, яка створює масштабні інфраструктури та багато-модальні АІ-моделі арабської мови для глобальних послуг АІ.
Uni-1 by Luma AI
Мультимодальна AI‑модель для високоякісної генерації зображень із сильною просторовою логікою та точним рендерингом тексту.
Black Forest Labs
Піонерська компанія з розвитку аї для створення високорівневих генеративних моделей зображень та відео-синтезу.
Veo 4
Мультишотове кінотворче генерування відео з AI з нативною синхронізованою аудіо
OpenArt
Креативний AI‑пакет для створення мистецтва, відео і аудіо з тексту або зображень
SuperAnnotate
Повний цикл анотації та управління даними для створення високоякісних навчальних наборів даних ШІ
Gemma 3
Відкритий розподілений модель штучного інтелекту, оптимізований для виконання на одній GPU, підтримуючи багатодіапазонні вхідні дані та понад 140 мов.
GLM-4.6V
Відкрита багатомодальна модель GLM від Z.ai, яка об'єднує бачення, текст і виклик функції для багаторазових міркувань щодо пошуку, програмування та інтерфейсу між кодом.
HappyHorse
Офіційний відкритий модель, що створює відео разом з синхронізованими аудіо від однієї команди команди
OpenAI GPT-4
Мультимодальна велика мовна модель OpenAI для розуміння тексту, коду та зображень.
Codex CLI
Багатокомпонентний термінальний асистент AI, який читає, видавляє й виконує локально код з багатомодальною входжуюючої інформацією.
LTX 2.3 Video Generator
АІ відеозабір, який поєднує текстові заливки, зображення і аудіо в кохерентні короткі кліпи.
MyShell
Платформа створення ШІ для споживачів без коду для створення, спільного використання та володіння ШІ-додатками.
LiveKit Agents
Відкритий框врей для побудови реальнихчасових багатомодальних голосових та відеоагентів AI.
Aivah
Створюйте інтерактивні аватар-агентів з метою створення цифрових імпульсних досвідів
Voice-gen.ai
Уніфікована платформа для створення голосових озвучень, зображень і відео за допомогою ШІ в одному робочому просторі
WebVoyager
Веб‑агент на базі LMM, що завершує інструкції користувачів від початку до кінця, взаємодіючи з реальними веб‑сайтами.
Jina AI
Підсистема мультидименційної пошукової роботи для створення вбудованих, перерозмірівки та блоків RAG.
Seedance 1.5 Pro
Платформа створення AI для генерації відео з синхронізованим звуком (голос, синхронізація губ, SFX) з тексту або зображень, а також генерації зображень і інструментів AI для редагування зображень.























