#Multimodal
25 tools tagged “Multimodal”
OpenAI Advanced Voice
リアルタイムのナチュラルな声の会話にChatGPT
ScreenAgent
オープンソースのVLMエージェント。マウス/キーボード計画の実行を使用してコンピュータGUIを制御。
Grok 2
xAIの推論に特化したチャットボット、画像生成とマルチモーダル入力対応
Nexa AI
端末内のAI実行環境でモデルを機器内で実行
Project Astra
Google DeepMindの汎用AIエージェントが本格的に世界を見る・ 聴く・理解することを実現します。
OmniVision
デバイス内およびエッジAIの展開に適したコンパクトな視覚言語モデル
Humain AI
サウジアラビアの支持を受ける人工知能企業が、世界的AIサービス向けに、大規模な基盤インフラと多モーダルアラビアLLMの構築を目指しています。
Uni-1 by Luma AI
多モーダル AI モデルによる、高解像度イメージ ジェネレーション用の強力な空間推論と正確なテキストレンダリング。
Black Forest Labs
最新の生成型モデルの先駆的AIスタートアップとして、映像とビデオ合成の専門家。
Veo 4
マルチショットのシネマティックなAIビデオ生成にネイティブに同期された音声
OpenArt
創作 AI 套件により、テキストまたは画像から画像、ビデオ、および音を生成
SuperAnnotate
端末からエンドまでのデータラベリングと管理プラットフォームを用い、高品質なAIトレーニングデータセットを作成する。
Gemma 3
オープンソースのAIモデルを、シングル・GPUパフォーマンスの最適化でサポートする、モーダリティの複数入力と140以上の言語をサポート
GLM-4.6V
オープンソースのマルチモーダル GLM から Z.ai により、視覚、テキスト、ツールコールを統合する長文脈推論、検索、コード作成、および UI-to-code.
HappyHorse
1つのパラメータに基づいて動画や同期されたオーディオを同時に生成するオープンソースモデル。
OpenAI GPT-4
OpenAIのマルチモーダルな大規模言語モデル
Codex CLI
オープンソースのターミナルAIアシスタントがローカルでマルチモーダル入力を受け付け、読み書き、実行します。
LTX 2.3 Video Generator
テキスト提示、画像、音を統合したコヒーシブな短編動画生成AI
MyShell
コードを書かずに構築、共有、そしてAI アプリを所有するNo-code AI consumer プラットフォーム
LiveKit Agents
リアルタイムのムルチモーダルVoIPとビデオのAIエージェントを作成するオープンソースフレームワーク
Aivah
インマーシブなデジタル体験用に、互換性のあるAIアバターエージェントを見つける
Voice-gen.ai
統合プラットフォームでのAIジェネレートビデオ、イメージ、およびボイスオーバー
WebVoyager
LMMを活用したウェブエージェント、ユーザーの指示に従って実行中のウェブサイトと対話することでエンドツーエンドのタスクを完了する。
Jina AI
多モード検索基盤としてのエンベッディング、およびRERANKINGとRAGパイプライン向け
Seedance 1.5 Pro
テキストまたは画像を入力して、音声、口唇動き、効果音などのシンクライジングした音声と音画を生成するためのAI創造プラットフォーム。























