#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
与ChatGPT进行即时、自然的语音对话
ScreenAgent
开源视觉语言模型代理,通过鼠标/键盘规划和执行控制计算机GUI。
Grok 2
xAI 推出的关注推理的聊天机器人,支持图像生成和多模态输入。
Nexa AI
设备本地的 AI 运行时,为手机、PC 和边缘硬件运行模型。
Project Astra
像谷歌深度神经网络那样,在真实时刻内看, 聽, 和思考整个世界的一种通用 AI 代理
OmniVision
压缩版视觉语言模型,专为边缘设备部署而设计
Humain AI
一家由沙特支持的 AI 公司致力于建立大型基础设施和多模式阿拉伯 LLMs 为全球 AI 服务。
Uni-1 by Luma AI
多模态 AI 模型,用于高分辨率图像生成以及强大的空间推理和准确的文本渲染。
Black Forest Labs
一家领先的AI初创公司,专注于最先进的图像和视频合成生成模型。
Veo 4
多镜头电影级别的AI视频生成系统,支持原生同步音频
OpenArt
从文字或图像创建艺术、视频和音频
SuperAnnotate
构建高质量 AI 训练数据集的端到端数据标注和管理平台
Gemma 3
一款开源的AI模型,针对单GPU性能进行了优化,支持多模态输入和超过140种语言。
GLM-4.6V
Z.ai 开源多模式 GLM, 为视觉、文本和工具调用提供长上下文推理、搜索、编码和 UI-to-code 的统一入口。
HappyHorse
开源模型,通过单一提示生成配有同步音频的视频。
OpenAI GPT-4
来年语音的李檔形签园话弬一席一口檔读程一汽檔我海安录常给成仡
Codex CLI
开源终端AI助手,读取、编写和本地运行代码,支持多模态输入。
LTX 2.3 Video Generator
将文本提示、图像和音频整合到凝聚力强的短片视频生成器
MyShell
零代码 AI 消费者平台,帮助用户创造和共享 AI 应用
LiveKit Agents
开源框架,实时语音、视频 AI 代理
Aivah
打造互动AI虚拟角色,实现沉浸式数字体验
Voice-gen.ai
统一平台为 AI 生成语音、图像和视频
WebVoyager
LMM驱动的网络代理:即插即用完成用户指令
Jina AI
面向嵌入、重排序和 RAG 流水线的多模态搜索基础设施。
Seedance 1.5 Pro
一款为生成与音频(语音,唇语同步,音效)同步的视频(从文本或图像输入)而建立的 AI 创作平台,更提供图像生成和 AI 图像编辑工具。























