【8月10日のAI関連耳よりニュース】3強だけがAIじゃない──画像・映像・文章、「専門AI」の使い分け方

こんにちは、合同会社440の山本です。ChatGPT、Gemini、Claude。AIの話題はいつもこの3強で回っています。でも実は、画像・映像・文章それぞれの分野では、3強とは別の「専門AI」が主役だったりします。今日はその使い分けの話を。

【ニュース①】画像はMidjourney V8.2とFLUX.2──「絵の美しさ」と「文字の正確さ」で選ぶ

キャンバスに厚く塗り重ねられた極彩色の絵の具

▶ Midjourneyは7月24日からV8.2が標準に。生成速度が従来比5倍、ネイティブ2K出力に対応し、低品質画像が出る確率も大きく下がりました。ブランディング用ビジュアル、建築・インテリアのプレゼンパース、SNS広告の制作で使われています。一方、画像の中に文字を入れたいならFLUX.2。Stable Diffusionの元開発陣が立ち上げたBlack Forest Labsのモデルで、1月には1秒以内で生成できる高速版「FLUX.2 [klein]」が公開され、13GBのグラフィックメモリがあれば自分のパソコンでも動きます。ただし長い説明文の正確な描画はまだ苦手で、ロゴや短いキャッチコピー向きです。

💬 440の見解:ここが一番の落とし穴だと思っていて、「文字が入る画像」と「絵として美しい画像」は求める性能がまるで違います。バナーを作るのにアート系を使って文字が崩れる、というのはよく見る失敗です。用途で分けるだけで仕上がりが変わります。

【ニュース②】映像はRunway Gen-4.5とKling 3.0──あのSoraは撤退した

動画編集ソフトのタイムライン画面

▶ OpenAIの動画生成AI「Sora」は3月24日に終了が発表され、アプリは4月に停止、APIも9月24日で完全終了します。1日100万ドル規模といわれるコストが背景と報じられました。今の主役はRunway Gen-4.5とKling 3.0です。Runwayは映像の評価指標Eloスコアで首位に立ち、『ジョン・ウィック』などで知られるLionsgateと提携して映画制作にも入っています。Kling 3.0は2月4日リリースで、1つの指示から複数カットを自動で分け、日本語を含む音声も同時生成、最大4K出力に対応。アパレルブランドが商品写真から紹介動画を量産してSNS配信した事例も出ています。

💬 440の見解:世界のOpenAIですら撤退する領域がある、というのが面白いところです。裏を返せば専門でやっている会社の方が強い。中小企業目線だと、商品紹介や採用動画を撮影なしで作れる意味は小さくないと思います。

【ニュース③】文章は検索特化のPerplexity──「書ける」より「裏が取れる」

ノートパソコンで文書を作成している画面

▶ 文章系で3強と役割が違うのがPerplexityです。質問すると最新のWebを検索し、出典を引用しながら文章で返してくれます。市場調査の初期リサーチ、競合分析のまとめ、ニュース要約に向いた設計です。翻訳・推敲ならDeepL、SEO記事ならCatchyやSAKUBUNといった国産の特化型もあります。

💬 440の見解:文章でAIを使うとき、怖いのは文章力ではなく事実の間違いです。出典が出るツールで裏を取ってから本文を書く、この二段構えにするだけで事故はかなり減ります。自社でもこの順番は徹底しています。

まとめ:AIは1つに絞らなくていい

2026年のAIは「万能ツール」から「用途別の最適ツール」へ移りました。理想はメインを1つ決めて、そこに特化型を1〜2つ足す形です。全部を試す必要はありません。自社の業務で一番時間を食っている作業はどれか、そこだけ専門AIに任せる。それが一番早い近道だと思います。

(出典:Midjourney公式ドキュメント、CodeZine、Ledge.ai、Impress Watch、OpenAI公式ヘルプ、WEEL、MiraLabAI ほか)

コメントする

メールアドレスが公開されることはありません。 が付いている欄は必須項目です