ツールを支える基盤モデルを紹介します:ベンダー、モダリティ、そしてどのツールが使っているか。まずベンダーやモダリティで閲覧し、ツールページで公式ドキュメントを確認してください。
OpenAI
OpenAI が2026年9月に発表した最新の最上位モデル。Astra Pro を含み、ChatGPT と Codex で提供される現行の既定フラッグシップです。
OpenAI
2026年7月以降の OpenAI API の主力世代。能力とコストで Sol・Terra・Luna の3段階に分かれ、GPT-5 の推論とツール呼び出しを引き継ぎます。
OpenAI
2025年8月7日に公開された OpenAI のモデル。公開と同時に GPT-4o に代わって ChatGPT のフラッグシップになり、タスクごとに推論の深さを自動調整します。
OpenAI
OpenAIの第4世代モデル。推論と文章作成の品質に優れ、多くのライティング・コーディング・知識系ツールの既定エンジンとして使われています。
OpenAI
2025年8月5日に公開された OpenAI 初のオープンウェイトモデル。120b と 20b の2種類を Apache 2.0 で提供し、無償でセルフホスト・ファインチューニングできます。
OpenAI
2026年9月8日公開の OpenAI の画像モデルで、DALL·E 3 に代わり ChatGPT 内蔵の生成エンジンに。長いプロンプトの再現と図中テキストが強化されています。
OpenAI
OpenAIの第3世代テキストto画像モデル。2026年5月12日にAPIから恒久撤去され、ChatGPT の画像生成は GPT Image 2.5 へ移行、Microsoft 側の Bing Image Creator も Image Creator from Designer にリブランドされました。
OpenAI
OpenAIの第2世代テキストto画像モデル。画像編集とバリエーション生成で拡散モデルの商用化を切り開きましたが、2026年5月12日に DALL·E 3 と同時に退役しました。
OpenAI
OpenAI のテキストto画像モデル群の総称で、DALL·E 2 から DALL·E 3 まで揃えますが、両 SKU とも2026年5月12日に撤去され、後継は GPT Image 2.5 です。
OpenAI
2025年9月30日公開の Sora 2 / Sora 2 Pro。物理表現と音画同期が向上した一方、コンシューマー向けアプリは2026年4月26日に終了し、API も2026年9月24日から廃止が進みます。
Anthropic
長いコンテキストと文章作成・コーディング能力で知られる Anthropic のモデル群。現行は Claude Opus 5・Sonnet 5 と4.5世代の3段階で、開発者向けやライティング系ツールに広く採用されています。
Anthropic
2026年7月24日公開の Anthropic の旗艦モデル。長時間のエージェント動作と難問推論で最強ですが、価格と遅延も最も大きくなります。
Anthropic
2026年6月公開の Claude 5 世代の中核段位。Opus 5 に近い能力を低コスト・低遅延で提供し、コーディングとエージェント作業流の既定になりがちです。
Anthropic
2025年11月の前世代旗艦。長時間のプログラミングと多段エージェントが大きく進歩し、Claude 5 世代以前のコーディング基準になりました。
Anthropic
2025年9月公開の前世代中核モデル。推論・文章作成・コーディングのバランスが良く、Claude 3.5 Sonnet に代わって Cursor などの既定を受け継ぎました。
Anthropic
2025年10月15日公開の軽量段位。ほぼ即時の応答で前世代旗艦に近い能力を持ち、高頻度の対話や分割サブタスクに向きます。
Anthropic
長い文書の処理とコード理解に優れた Claude 3.5 世代の総称。2025年10月28日の退役期間で世代ごと終了し、4.5 と 5 世代が引き継いでいます。
Anthropic
初めて視覚理解を導入し Haiku/Sonnet/Opus の3段階を揃えた Claude 3 世代の総称。Sonnet は2025年7月21日に退役し、世代全体が主力から外れています。
Google のネイティブマルチモーダルモデル群。テキスト線は Gemini 3 Pro を筆頭に 2.5 と Omni、画像は Nano Banana Pro、動画は Veo、音楽は Lyria が担当し、長いコンテキストと検索・オフィス連携に強みがあります。
2025年11月18日公開の Google の旗艦。2.5 世代より推論とマルチモーダル理解が一段上になり、同時期に Ultra 段位は廃止されて Pro が旗艦名を担います。
2026年に出た Google の omni 級高速段位。テキスト・画像・音声・動画を統一的に扱い、低遅延のリアルタイムマルチモーダル対話を狙います。
2025年3月25日公開の前世代旗艦。思考予算を持つ長いコンテキストの推論モデルで、今も多くのサードパーティツールの既定エンジンです。
2025年6月から普及した Gemini 2.5 の高速段位。低コスト・低遅延で高並列の推論とマルチモーダル処理をさばきます。
モデルID gemini-3.1-flash-image の Google の画像モデル。Nano Banana の名で広まり、Imagen 4 に代わって Google 現在の画像 SKU となり、複数画像の一貫性や対話型編集に優れます。
Google DeepMind
Google の動画生成の現行版。Veo 3 の音映像同時生成とカメラワーク制御を引き継ぎつつ、被写体の一貫性と参照画像・最初最後フレームの制御が強化されています。
Google DeepMind
音声を同時に生成した Google DeepMind 最初の動画モデルで、画質と一貫性は最上位クラス。veo-3.0 は2026年6月30日に終了し、現行は Veo 3.1 です。
Google DeepMind
Google DeepMind の音楽生成モデル。テキストプロンプトからボーカル入りのフル尺の曲を作り、Flow や Gemini App などの制作ツールから呼び出せます。
Meta
Metaのオープンウェイトモデル群。重みが公開され生態系も大きく、ローカル実行やセルフホストの事実上の標準基盤です。最新世代は Llama 4。
Meta
2025年4月5日公開の Meta のオープンウェイト世代。Scout と Maverick は公開直後からダウンロードでき、同世代の Behemoth は学習中で未公開と明言されています。
xAI
2026年の xAI 公式ドキュメントで現行主力の旗艦世代。4 系の推論とリアルタイム情報をさらに強化し、Grok と X の製品線に接続します。
xAI
推論とリアルタイム情報処理を強化し X データと深く統合された xAI の4世代モデル。ただし現行主力の Grok 4.6 より2バージョン後ろです。
xAI
xAIの第3世代モデル。リアルタイムの質疑応答と率直な応答スタイルに向いています。
xAI
xAI の画像・動画・音声生成プロダクトライン。テキストから素早く動画とナレーションを作る消費者向け入口として提供されます。
Mistral
Mistral の現行オープンウェイト旗艦(バージョン v25.12)。多言語・推論・関数呼び出しを揃え、重み公開によりセルフホストも可能です。
Mistral
Mistral の旗艦段位を指す汎用的な表記で、欧州企業での導入が進んでいます。現在はこの表記、Mistral Large 3 に落ち着くことがほとんどです。
Mistral
Mistralの軽量モデル。高効率・低コストで、ローカルやエッジへの配備に適します。
Mistral
Mistral のコード専用モデル(25.08 リリース)。行内補完とリポジトリ規模のコンテキストを扱い、IDE プラグインの後端として定番です。
Mistral
Mistral の音声モデル。音声をそのままマルチモーダルモデルへ入力し、多言語の文字起こしや音声での質問応答に使えます。
DeepSeek
2025年12月に出た DeepSeek のオープンソース主幹。長いコンテキストの推論とツール呼び出しで V3.1 を引き継ぎ、価格は従来通り攻めています。
DeepSeek
DeepSeek の V4 世代の公式SKU(スナップショット V4-Pro-0813)。複雑な推論と長いコード作業を担い、API では deepseek-v4-pro という名前で呼びます。
DeepSeek
DeepSeek V4 世代の高速段位で、公式API名は deepseek-flash、現行は V4.1-Flash。低コスト・低遅延で高頻度とバッチ呼び出しをさばきます。
DeepSeek
DeepSeek のオープンソースモデル群の総称で、現行は V3.1/V3.2 主幹と V4 の2段位。なお「DeepSeek V4」は公式SKU名ではなく、deepseek-v4-pro / deepseek-flash を使います。
アリババ
2025年4月28日に開放されたアリババの Qwen 世代。エッジ機からサーバー向けの規模まで揃うオープンウェイトで、中国のセルフホスト基盤の主力です。
アリババ
2025年9月24日発表のアリババの旗艦。1T を超えるパラメータで複雑な推論とエージェント作業を狙い、主にAPI経由で提供されます。
アリババ
2026年8月12日に重みが公開された Qwen の新世代。オープンウェイト路線を続け、セルフホストと微調整ができます。
アリババ
Qwen の旗艦API段位名。中国語理解とマルチモーダル能力が高く企業の商用配備が進み、対応する最新のオープン重み世代は Qwen3 シリーズです。
アリババ
Qwen のバランス型モデル。性能とコストのバランスが良く、多くの中国語の対話・文章作成シーンに適します。
アリババ
Qwen の高速モデル。低コスト・高スループットで、大規模なテキスト処理に適します。
アリババ
アリババのオープンソース動画生成モデル群。テキストto動画と画像to動画の品質はオープンソースでも最上位クラスで、中国の制作コミュニティで広く使われています。
Zhipu AI
2025年9月に出た Zhipu AI の前世代旗艦。重みを開放し、コーディングと長文が得意で、セルフホスト構成でよく引用されます。
Zhipu AI
Zhipu AI の新世代主幹。GLM-4.6 に代わって主力段位になり、エージェントとコーディングを強化しつつ長いコンテキストとツール呼び出しを進めました。
Zhipu AI
Zhipu AI の現行上位バージョン。100万トークン級のコンテキストとオープンウェイトを両立し、長文書とリポジトリ全体のコード理解を主軸にします。
ByteDance
2025年9月9日公開の ByteDance の画像生成モデル。Volcano Engine や Doubao、Jimeng 経由で提供され、中国製テキストto画像の主流の選択肢です。
Kuaishou
Kuaishou の Kling 成熟期の主力バージョン。1.x より人物の一貫性、動きの幅、中国語指示理解が明確に良くなり、テキストto動画と画像to動画に対応します。
Kuaishou
2026年に出た Kuaishou の最新世代。1回15秒までの生成、4K 出力、リップシンクに対応し、中国製動画生成のトップ候補です。
MiniMax
MiniMax の Hailuo 動画モデルの総称で、現行は Hailuo-02、2.3、オープンウェイトの全モダリティ版 H3 を含みます。人物の動きが自然で物理表現もリアル、中国語の指示理解に優れます。
MiniMax
Hailuo の前世代主力動画バージョン。02 世代より指示追従、物理のリアリティ、キャラクター一貫性が向上し、SNS短尺や広告の絵作りによく使われます。
MiniMax
2026年7月発表の MiniMax 最新世代。オープンウェイトの全モダリティ(omni)モデルとして提供され、動画の生成と理解を同一スタックで運用できます。
MiniMax
2026年5月に出た MiniMax の汎用大規模モデル。長いコンテキストとエージェント作業を主軸にし、Hailuo シリーズ側のテキスト主力です。
Moonshot AI
Moonshot AI の Kimi モデル群の総称。初期の長文モデルから K2、K2.5、2.8T パラメータの K3 まで進化しましたが、超長文の読解とファイル解析は引き続き看板能力です。
Moonshot AI
2025年7月公開の Moonshot AI のオープンソース旗艦。総1T・活性化32B の MoE 構成で、修正版 MIT ライセンスにより重みを開放し、エージェントとコードに強みがあります。
Moonshot AI
2026年1月に出た K2 の改良バージョン。マルチモーダル理解と推論チェーンを強化しつつ、長文書の解析力はそのまま優位です。
Moonshot AI
2026年7月発表の Moonshot AI の最新旗艦。パラメータ規模2.8T で、長時間のエージェントと複雑な推論作業をターゲットにします。
Stability AI
Stability AIのオープンソース旗艦テキストto画像モデル。ローカル配備と微調整の生態系が非常に大きく、CivitaiやComfyUIなどコミュニティの基盤モデルです。
Stability AI
Stable Diffusionの定番版。モデルサイズが小さくControlNetの生態系も成熟しており、ローカル配備の入門に最適です。
Stability AI
Stability AIのリアルタイムテキストto画像モデル。1ステップで生成でき遅延が極めて低く、リアルタイムキャンバスや対話的な用途に適します。
Stability AI
Stability AIのオープンソース動画拡散モデル。画像to動画の代表格で、コミュニティによる微調整や統合が広がっています。
Stability AI
Stability AIの音楽・効果音生成モデル。商用利用できる音楽やサンプル、効果音を生成でき、商用ライセンスも用意されています。
Black Forest Labs
Black Forest Labsの画像生成モデル群。画質と文字描画が業界をリードし、現行は FLUX.2 の [pro]/[dev]/[klein] の3段階で、FLUX.1 系も引き続き使われています。
Black Forest Labs
2025年12月公開の Black Forest Labs の画像世代。[pro] はAPI経由、[dev] は重みを開放して微調整向き、[klein] は2026年1月にオープンで軽量・高速枠として出ました。
オープンソースコミュニティ
オープンソースの画像超解像モデル。ローカルで動作し完全無料で、Upscaylなど拡大ツールの中核エンジンです。
Midjourney
2026年3月17日からアルファ提供された Midjourney の最新世代。安定化するまで V7 と並行して選べます。
Midjourney
2025年4月4日公開の Midjourney 世代。V6 より画質とプロンプト追従が上がり、しばらく同社画像製品のメインラインでした。
Recraft
Recraftの第3世代モデル。ベクター生成とブランドスタイルの制御で業界をリードし、デザイナーのワークフローに特化しています。後継世代は本目録では未収録なので、採用時は公式文書を確認してください。
Ideogram
2025年3月公開の Ideogram 世代。文字描画とレイアウト構成がさらに一歩進み、ポスターやブランドビジュアルでよく使われます。
Ideogram
Ideogramの第2世代モデル。文字描画が正確で、ポスターやロゴの構想、タイポグラフィ画像の生成が安定していましたが、2025年3月の Ideogram 3 に引き継がれました。
Ideogram
Ideogramの第1世代モデル。テキストto画像における信頼できる文字描画を切り開きました。
Leonardo AI
Leonardo AIの新世代基盤モデル。画質とプロンプト追従性が大きく向上し、ゲームやクリエイティブアセットでよく使われます。
Leonardo AI
Leonardo AIの初期の拡散モデル群。スタイルテンプレートが豊富で、コミュニティ作品も膨大です。
Adobe
Adobeの第3世代Fireflyモデル。PhotoshopやIllustratorと深く統合され、商用利用の権利関係も明確です。
Adobe
Adobeの第2世代Fireflyモデル。生成塗りつぶしと文字効果が成熟し、デザインワークフローに組み込まれています。
Freepik
Freepikの高精細画像生成モデル。細部の描写が豊かで、素材ライブラリと商用ライセンス体系が一体になっています。
Magnific AI
Magnificの画像拡大モデル。幻想的なディテール再構築で知られ、低解像度の画像を高精細な作品へ引き上げます。
Playground
Playgroundのキャンバス型画像モデル。生成・部分修正・レイヤー編集を一体化して扱えます。
Krea
Kreaのリアルタイム生成モデル。キャンバス上のラフを即座に描画・拡大でき、コンセプトデザインの反復が非常に速くなります。
Runway
2025年12月11日に出た Runway の上位版。物理のリアリティと指示追従をさらに進め、同社の動画旗艦の位置にあります。
Runway
2025年4月1日公開の Runway の動画モデル。参照映像による人物・シーンの一貫性とカメラ操作を軸に、Gen-3 Alpha からメインラインを引き継ぎました。
Runway
2025年7月31日公開の Runway の動画編集モデル。生成済みの映像を編集対象として扱い、被写体やカメラを変えても残りの情報は維持できます。
Runway
2025年8月20日公開の Runway の演技転送モデル。演技者の動きと表情をターゲットキャラクターに移し、元の演技の機微を保ちます。
Pika
Pikaの第2世代動画モデル。エフェクトテンプレートとキャラクターの一貫性に強く、SNSの短尺動画でよく使われます。
Pika
Pikaの第1世代動画モデル。軽量で始めやすく、SNS向けのアイデア動画で人気です。
Luma AI
Luma AIの動画モデル。自然な物理運動と映画的なカメラワークが得意で、キーフレーム制御やループ動画に対応します。
Luma AI
Lumaのキャプチャと再構築の技術。動画や写真から3Dシーンとガウススプラッティングのアセットを再構築します。
Genmo
Genmoのオープンソース動画モデル。ローカル配備とセルフホストが可能で、オープンな動画生成の重要な節目です。
LTX Studio
LTX Studioの動画モデル。映像ナラティブ向けに絵コンテ、キャラクターの一貫性、カメラ制御を統合しています。
D-ID
D-IDの写真駆動型アバターモデル。1枚の顔写真で話させることができ、APIはカスタマーサポートやマーケティングへの組み込みに適します。
HeyGen
HeyGenのアバターモデル。台本からリアルな質感の口播動画を一発生成し、動画翻訳とリップシンクにも強いです。
ByteDance
CapCutに内蔵されたAIモデル群。スマート編集、自動字幕、AIエフェクト、アバターをカバーし、中国語圏のテンプレートが最も充実しています。
VEED
VEEDのオンライン編集AIモデル群。自動字幕、AIナレーション、ノイズ除去、アバターをカバーします。
Suno
2026年9月に出た Suno の現行版。学習データセットとして初めてレコード会社の許諾を得た構成が打ち出され、商用の透明性が主眼になっています。
Suno
2025年9月23日公開の Suno の音楽モデル。ボーカルとアレンジのリアルさが第4世代から明確に上がり、v6 までの主線でした。
Udio
Udioの高忠実度音楽モデル。ボーカル入りの楽曲と多ジャンルのフルトラックに強く、部分再生成や細かな編集に対応します。
ElevenLabs
ElevenLabsの音声合成モデル群の総称。リアルさと感情表現は業界の基準で、現行主線は Eleven v3 です。
ElevenLabs
2025年6月公開の ElevenLabs の新世代音声モデル。70以上の言語をカバーし、感情やスタイルの制御・長い連続生成・複数話者の会話にも対応します。
Murf
Murfのナレーションモデルライブラリ。120以上の声が20以上の言語をカバーし、企業研修や解説動画でよく使われます。
LOVO
LOVOのGennyナレーションモデル。500以上の声と感情表現を備え、ナレーションと動画編集が一体になっています。
Play.ht
Play.htの音声合成モデル。低遅延のストリーミング出力がリアルタイム用途に適し、音声ライブラリは多言語をカバーします。
Speechify
Speechifyの読み上げモデル。文書・Webページ・書籍を自然な音声に変換し、学習やアクセシビリティの場面でよく使われます。
Kits.AI
Kits.AIの声モデル学習プラットフォーム。自分の声をクローンしたり、許諾済みアーティストの声でデモを作れます。
Adobe
Adobe Podcastの音声強化モデル。雑音の多い録音をワンクリックでスタジオ品質にし、無料で使えます。
Meshy
Meshyの第2世代3D生成モデル。テキストto 3Dと画像to 3Dの品質が向上し、ゲームやECのアセットでよく使われます。
Meshy
Meshyの第1世代3D生成モデル。テキストから3Dへの入口を低くしました。
Tripo AI
Tripo AIの3D生成モデル。画像to 3Dとテキストto 3Dが高速で、トポロジー品質も向上を続けています。
Deemos
Deemosの高忠実度3D生成モデル。人物やキャラクターのフォトリアルなアセットに特化し、映像やバーチャルヒューマンの案件でよく使われます。
Spline
Splineのブラウザ内3DデザインAI。プロンプトからシーンとモーションを生成し、そのままWebに埋め込めます。
Grammarly
Grammarlyのライティング支援モデル。文法校正、トーン調整、盗用チェックを一体化し、ブラウザとモバイルキーボードで使えます。
Rytr
Rytrの軽量ライティングモデル。40以上の用途とトーンのテンプレートを備え、手頃な価格で始めやすいです。
Consensus
Consensusの学術Q&Aモデル。査読論文に基づき、研究結論と引用の質の指標を添えた回答を返します。
Character.AI
Character.AIのロールプレイ対話モデル。コミュニティが作るキャラクター生態系が膨大で、寄り添い・娯楽系の代表です。
Replit
Replitのコーディングモデル。プロンプトから動くアプリを組み立て、そのままデプロイまで行えます。
ClickUp
ClickUpのプロジェクト管理AIモデル。タスクの作成、文書の要約、プロジェクト状況への回答を自動化します。
Gamma
Gammaのプレゼン生成モデル。アウトラインや文書から美しいスライドとサイトを自動生成します。
Beautiful.ai
Beautiful.aiのスマートレイアウトモデル。内容に応じてスライドが自動で整列・再配置されます。
Descript
Descriptの編集モデル。文書を編集するように音声・動画を編集でき、文字起こし駆動の編集体験を切り開きました。
ユーザー学習モデル
ユーザーが自分の素材で微調整・学習させたモデル。CivitaiやTensor.ArtなどコミュニティのLoRA生態系でよく見られます。
複数ベンダー
各社が自社製品向けに独自開発し非公開のモデルの総称。能力の範囲は各社の公式ドキュメントに準じます。
Fliki
Flikiのナレーションモデルライブラリ。2000以上のAI音声が80以上の言語をカバーし、テキストto動画のナレーションに特化しています。
NovelAI
NovelAIの物語生成モデル。長編小説の執筆に特化し、文体の維持とキャラクターの一貫性に優れます。
NovelAI
NovelAIのアニメ調画像モデル。キャラクターの一貫性と二次創作コミュニティでの評価が高いです。
モデルディレクトリには「公開名称があり、本ディレクトリのツールが明示的に使用を記載している」モデルのみを収録します。独自モデルを名称非公開で利用するツールは、モデル文字列をツールページに残し、独立したモデル項目にはしません。同一ベンダーの複数バージョンは対応するシリーズ項目にまとめます。能力・提供状況・ライセンス条件はベンダーの公式ドキュメントに従います。
ツールページは製品の機能を説明し、モデルページは基盤となるエンジンに答えます。同じベンダーのバージョン間の違いや、候補のツールが同じ基盤モデルを使っているかを確認しましょう。ツール層の機能だけを比べるより、先に基盤を確認したほうが早く候補を絞り込めます。