AIは画像や声も理解できる?マルチモーダルAIとは

ChatGPTなどのAIというと、「文字を入力すると、文章で答えてくれるもの」というイメージを持っている人も多いかもしれません。

しかし、現在のAIは文字だけを扱うものではありません。

写真を見せて質問したり、声で会話したり、動画や資料の内容を読み取ったりと、さまざまな種類の情報を扱えるAIが登場しています。

こうしたAIを理解するうえで重要なのが、「マルチモーダルAI」という言葉です。

今回は、マルチモーダルAIとは何なのか、実際に何ができるのかを初心者向けに見ていきます。


1. マルチモーダルAIとは?

マルチモーダルAIとは、 文字・画像・音声・動画など、複数の種類の情報を扱えるAI のことです。

「モダリティ(modality)」とは?
簡単にいえば、AIが受け取る「情報の種類や形式」のことです。

たとえば、私たちがAIに渡せる情報にはこんなものがあります。

文章
画像
音声
動画
PDF・資料
AI
複数の情報をまとめて扱う これが「マルチモーダルAI」

「マルチ」は複数という意味です。 つまりマルチモーダルAIとは、一つの種類だけではなく、 さまざまな形式の情報を組み合わせて扱えるAIと考えると分かりやすいでしょう。

たとえば、AIに写真を見せながら文章で質問することもできます。 「この写真に写っているものは何?」と聞けるのも、 AIが文章と画像の両方を扱えるからです。

ポイント: 「マルチモーダル=いろいろな種類の情報を扱える」と覚えればOKです。

「マルチモーダルAI」と聞くと難しそうですが、 実はすでに 身近なところで使える機能 が増えています。

AI

例えば何ができる?

写真を見せて質問する

例えば、料理の写真をAIに見せて質問できます。

あなた: 「この料理には何が使われていそう?」

ほかにも、マルチモーダルAIでは 次のような使い方ができます。

写真を見せる

写っているものについて質問したり、 状況を説明してもらったりできます。

資料を渡す

PDFなどの資料を読み込ませて、 内容を要約したり質問したりできます。

声で話す

キーボードを使わず、 AIと声でやり取りすることもできます。

画面を見せる

画面の内容を見せながら、 操作方法や問題について相談できます。

つまり、すべてを文章で説明しなくても、
「これを見て」とAIに渡せる
ようになってきたということです。

3. AIは本当に画像や声を「理解」しているの?

ここで少し疑問が出てきます。

AIは人間と同じように、 写真を見たり、声を聞いたりしているのでしょうか。

厳密には、 人間とまったく同じように理解しているわけではありません。

AIは画像・音声・文章などの情報を コンピューターが扱える形に変換し、 学習した大量のデータとの関係 から判断しています。

AIが情報を判断するときのイメージ
「これは何が
写っているのか?」
「何を
話しているのか?」
「文章と画像には
どんな関係があるのか?」
AI
情報を照らし合わせる
学習した大量のデータ をもとに、
情報同士の関係や特徴を探す
こうしてAIは、 「何が写っているのか」 「何を話しているのか」 「文章と画像にはどんな関係があるのか」 などを判断しています。

例えば猫の写真を見せた場合も、 人間のように 「猫を見た」と感じているわけではありません。

画像に含まれる特徴と、 学習した「猫」に関する情報との関係から、 猫である可能性が高い と判断しています。

そのため、現在のAIでも 見間違いや聞き間違いをすることがあります。

4. ChatGPTやGeminiもマルチモーダルAI?

マルチモーダルAIというと、 何か特別な最新技術のように感じるかもしれません。 しかし実際には、 私たちが普段使っている有名なAIにも マルチモーダルの機能が取り入れられています。

マルチモーダルAIは、 すでに身近な存在 です。
AI
ChatGPT

ChatGPTでは文章だけでなく、 画像を見せて質問したり、 声で会話したり、 ファイルの内容について質問したりできます。

文章 画像 音声 ファイル
AI
Gemini

Geminiでも、 写真や動画、音声、ドキュメントなどを渡して、 内容について質問や分析をすることができます。

文章 画像 音声 動画・資料
文章だけを扱うAI
さまざまな情報を扱うAI
私たちは、すでにマルチモーダルAIを使い始めています。 写真を見せたり、声で話したり、 資料を渡したりできるのも、 マルチモーダルAIの身近な例です。

※利用できる機能や上限は、 サービス・モデル・料金プランなどによって異なる場合があります。


5. ただし、見たものが必ず正しいとは限らない

マルチモーダルAIは便利ですが、 画像や音声、資料を渡せば 必ず正しく判断できるわけではありません。

!
AIが画像や資料を確認したからといって、 その回答が必ず正しいとは限りません。

マルチモーダルAIでも、 入力された情報をうまく読み取れず、 間違った判断をしてしまうことがあります。

例えば、こんな間違いがあります。
×
画像の一部を見間違える
×
音声を聞き間違える
×
資料の内容を誤って解釈する
こんな考え方には注意
AIが画像を見たから正しい
資料を読み込ませたから間違いない
AIの回答は「確認材料のひとつ」と考える

AIは情報を整理したり、 内容を理解する手助けにはとても便利です。 ただし、重要な判断をすべてAIだけに任せるのは避けましょう。

特に重要な情報については、 元の情報や公式情報を自分でも確認する ことが大切です。

まとめ

マルチモーダルAIとは、 文字・画像・音声・動画など、 複数の情報を扱えるAI のこと。
ChatGPTやGeminiなど、 すでに身近なAIにも使われている 技術です。
とても便利ですが、 AIの判断が必ず正しいとは限りません。
難しく考えず、 「マルチモーダル = いろいろな種類の情報を扱えるAI」 と覚えておけばOKです。

参考:公式情報

※各サービスの機能や仕様は変更される場合があります。最新情報は公式ページをご確認ください。