AgentPantheon

#Multimodal

25 tools tagged “Multimodal


OpenAI Advanced Voice logo
#1

OpenAI Advanced Voice

Розмови голосом в реальному часі з ChatGPT

4.7 (6)
2Freemium
ScreenAgent logo
#2

ScreenAgent

Відкритий VLM‑агент для керування графічним інтерфейсом комп'ютера за допомогою планування й виконання дій миші й клавіатури.

4.4 (5)
Freemium
Grok 2 logo
#3

Grok 2

xCи чатбот з фокусом на логічне мислення з підтримкою створення зображень та багатовимірної обробки даних.

4.3 (4)
Freemium
N
#4

Nexa AI

Рантайм локального ШІ для виконання моделей безпосередньо на телефонах, комп'ютерах та обладнанні краю мережі

4.8 (6)
Free
Project Astra logo
#5

Project Astra

Універсальний AI‑агент Google DeepMind, що бачить, слухає і розуміє світ у реальному часі.

5.0 (4)
Freemium
OmniVision logo
#6

OmniVision

Компактна модель відео-мови, створена для розгортання ШІ на пристроях та на краю мережі.

4.6 (5)
Freemium
Humain AI logo
#7

Humain AI

Компанія на підтримці Саудівської Аравії, яка створює масштабні інфраструктури та багато-модальні АІ-моделі арабської мови для глобальних послуг АІ.

4.7 (6)
Contact
Uni-1 by Luma AI logo
#8

Uni-1 by Luma AI

Мультимодальна AI‑модель для високоякісної генерації зображень із сильною просторовою логікою та точним рендерингом тексту.

4.7 (6)
Freemium
Black Forest Labs logo
#9

Black Forest Labs

Піонерська компанія з розвитку аї для створення високорівневих генеративних моделей зображень та відео-синтезу.

5.0 (6)
Freemium
Veo 4 logo
#10

Veo 4

Мультишотове кінотворче генерування відео з AI з нативною синхронізованою аудіо

4.6 (5)
Freemium
OpenArt logo
#11

OpenArt

Креативний AI‑пакет для створення мистецтва, відео і аудіо з тексту або зображень

4.7 (6)
Freemium
SuperAnnotate logo
#12

SuperAnnotate

Повний цикл анотації та управління даними для створення високоякісних навчальних наборів даних ШІ

4.4 (5)
Freemium
Gemma 3 logo
#13

Gemma 3

Відкритий розподілений модель штучного інтелекту, оптимізований для виконання на одній GPU, підтримуючи багатодіапазонні вхідні дані та понад 140 мов.

4.8 (5)
Free
GLM-4.6V logo
#14

GLM-4.6V

Відкрита багатомодальна модель GLM від Z.ai, яка об'єднує бачення, текст і виклик функції для багаторазових міркувань щодо пошуку, програмування та інтерфейсу між кодом.

4.3 (6)
Free
HappyHorse logo
#15

HappyHorse

Офіційний відкритий модель, що створює відео разом з синхронізованими аудіо від однієї команди команди

4.7 (6)
Free
OpenAI GPT-4 logo
#16

OpenAI GPT-4

Мультимодальна велика мовна модель OpenAI для розуміння тексту, коду та зображень.

4.5 (6)
Freemium
Codex CLI logo
#17

Codex CLI

Багатокомпонентний термінальний асистент AI, який читає, видавляє й виконує локально код з багатомодальною входжуюючої інформацією.

4.8 (5)
Free
LTX 2.3 Video Generator logo
#18

LTX 2.3 Video Generator

АІ відеозабір, який поєднує текстові заливки, зображення і аудіо в кохерентні короткі кліпи.

4.5 (4)
Free
MyShell logo
#19

MyShell

Платформа створення ШІ для споживачів без коду для створення, спільного використання та володіння ШІ-додатками.

4.8 (5)
Freemium
LiveKit Agents logo
#20

LiveKit Agents

Відкритий框врей для побудови реальнихчасових багатомодальних голосових та відеоагентів AI.

4.5 (6)
Freemium
Aivah logo
#21

Aivah

Створюйте інтерактивні аватар-агентів з метою створення цифрових імпульсних досвідів

4.8 (4)
Freemium
Voice-gen.ai logo
#22

Voice-gen.ai

Уніфікована платформа для створення голосових озвучень, зображень і відео за допомогою ШІ в одному робочому просторі

4.8 (4)
Free
WebVoyager logo
#23

WebVoyager

Веб‑агент на базі LMM, що завершує інструкції користувачів від початку до кінця, взаємодіючи з реальними веб‑сайтами.

5.0 (5)
Freemium
Jina AI logo
#24

Jina AI

Підсистема мультидименційної пошукової роботи для створення вбудованих, перерозмірівки та блоків RAG.

4.2 (5)
Free
Seedance 1.5 Pro logo
#25

Seedance 1.5 Pro

Платформа створення AI для генерації відео з синхронізованим звуком (голос, синхронізація губ, SFX) з тексту або зображень, а також генерації зображень і інструментів AI для редагування зображень.

4.8 (5)
Paid