目次
1. はじめに
NVIDIAが公開している「Video Search and Summarization(VSS)」を知り、少し調べてみたところ、その可能性に大きな衝撃を受けました。
動画の内容を理解し、自然言語で検索したり、要約したりできる。こうした技術が製造現場に活用されれば、これまで十分に活かしきれていなかった動画データの価値が、大きく変わるのではないかと感じました。
特に、現場の動画を単なる記録として保存するだけでなく、製造データと紐付けて蓄積しておくことで、将来的に新たな活用の可能性が広がるのではないかと考えています。
こうした動画理解の技術にも関わる基盤技術として、画像と自然言語を組み合わせて扱う「VLM(Vision-Language Model)」があります。VLMは、動画理解や、ロボットが周囲を認識して行動するフィジカルAIなどにも関わる技術です。
そこで今回は、まず基礎となるVLMについて、以下の4本の論文を中心に調べました。
- [1] Radford et al., Learning Transferable Visual Models From Natural Language Supervision(CLIP), 2021
- [2] Li et al., BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models, 2023
- [3] Liu et al., Visual Instruction Tuning(LLaVA), 2023
- [4] Fu et al., Vision-Language Models for Vision Tasks: A Survey, 2023
本記事では、VLMとは何か、どのような研究の流れを経て発展してきたのかを論文をもとに整理し、製造現場での活用可能性について考察します。
2. VLMとは何か
2.1 VLMの概要
VLM(Vision-Language Model)とは、画像などの視覚情報と、テキストなどの言語情報を関連づけて処理するAIモデルです。
動画を扱うモデルもありますが、基本的には画像と言語の関係を学習する技術として発展してきました。
画像と言語の関係を学習することで、
・画像とテキストの類似度の評価
・画像の内容について自然言語で質問に回答
・説明の生成
などが出来るようになります。
なお、画像と言語を結びつける仕組みはモデルによって異なり、画像とテキストの対応関係を学習する方式や、画像の特徴を言語モデルに接続する方式などがあります。
2.2 従来の画像認識との違い
従来の画像認識モデルとVLMの大きな違いは、
従来の画像認識モデル:主に特定のタスクや定義されたクラスに基づいて画像を分類・判定する
VLM:画像と言語の関係を学習することで、画像に含まれる情報を自然言語と結びつけて扱える
という点です。
例えば、
従来の画像認識では「正常」「異常」といった定義済みのクラスを判定するのに対し、
VLMでは、定義済みの内容にとどまらず、画像に映る状態や特徴をテキストで表現したり、画像についての質問に回答したり、自然言語で指定した分類候補を追加学習なしで扱える場合があります。
つまり、画像に含まれる意味的な情報を自然言語と結び付けて扱うことで、あらかじめ定義されたクラスにとどまらず、より多様な概念を柔軟に扱えるようになります。
ただし、VLMが従来の画像認識を全面的に置き換えるわけではありません。
定義済みのクラスを高精度に判定する用途では専用モデルが有効な場合があり、自然言語を介して多様な概念を扱いたい場合にはVLMが有効だと考えられます。
3. VLMの発展と代表的なモデル
ここでは、VLMの発展を理解するうえで重要と考えられる3つの論文を取り上げます。
今回選んだのは、画像と言語を結び付ける仕組みから、視覚情報を用いた自然言語での応答へと発展していく過程を理解するうえで、重要な技術的転換点を示す研究の論文です。
具体的には、CLIP、BLIP-2、LLaVAの3つを取り上げ、それぞれの研究の背景や目的、提案された手法、モデルのアーキテクチャを中心に解説します。
なお、本記事では数式や実験結果の詳細には深く踏み込まず、
各論文がどのような課題に取り組み、どのような仕組みによって画像と言語を結び付けているのか
を理解することを重視します。
これらの論文を通じて、VLMがどのように発展してきたのかを整理していきます。
3.1 CLIP:画像と言語を共通の意味空間に結び付ける
① 研究の背景と目的
CLIP(Contrastive Language-Image Pre-training)は、OpenAIが2021年に発表した画像と言語を扱うモデルです。
従来の画像分類モデルでは、あらかじめ定義されたクラスのラベルを用いて学習し、画像がどのクラスに属するかを判定する方法が一般的でした。
これに対してCLIPでは、画像とテキストの対応関係を大規模なデータから学習することで、自然言語を用いた柔軟な画像認識を実現することを目指しています。
この仕組みにより、学習時に分類クラスとして明示的に与えられていない対象であっても、自然言語で候補を指定することで分類できる場合があります。
② 提案手法の要点
CLIPの特徴は、次の3点に整理できます。
- 学習データ: インターネット上から収集した約4億組の画像・テキストペアを用いて学習。
- モデル構造: 画像を処理するImage Encoderと、テキストを処理するText Encoderを組み合わせる。
- 学習方法: 正しい画像・テキストのペアの類似度を高め、誤ったペアとの類似度を相対的に低くするように学習する。
このように、画像とテキストを個別に処理するのではなく、両者の意味的な対応関係を学習することがCLIPの基本的な考え方です。
③ モデルの仕組み
CLIPは、画像とテキストをそれぞれベクトルに変換し、共通の意味空間で対応関係を学習します。
モデルは、以下の2つのエンコーダで構成されています。
| 構成要素 | 役割 |
|---|---|
| Image Encoder | 画像を入力し、画像の特徴をベクトルに変換する |
| Text Encoder | テキストを入力し、テキストの特徴をベクトルに変換する |
Image EncoderにはResNetやVision Transformer(ViT)などが、Text EncoderにはTransformerベースのモデルが使用されます。
学習時には、画像とテキストの対応関係を次のように学習します。
- 画像とテキストをそれぞれエンコーダに入力し、特徴ベクトルを生成する。
- 画像とテキストのベクトル間の類似度を計算する。
- 正しいペアの類似度が高くなるように、対照学習(Contrastive Learning)によってモデルを学習する。
この学習により、画像とテキストの意味的な対応関係が共通の空間に反映されます。
図:CLIPの学習フェーズと推論フェーズ
④ ゼロショット分類
CLIPの特徴的な応用の一つが、ゼロショット分類(Zero-shot Classification)です。
ゼロショット分類とは、対象となるクラスの正解ラベルを用いて追加学習することなく、分類を行う手法です。
CLIPでは、入力画像と、分類候補となるテキストをそれぞれベクトルに変換し、類似度を比較することで分類を行います。
例えば、犬の画像に対して、次のような候補テキストを用意します。
- “a dog”
- “a cat”
- “a bird”
- “a motorcycle”
それぞれのテキストと画像の類似度を計算し、最も類似度が高いテキストを予測結果として選択します。
この方法では、分類対象を自然言語で指定できるため、学習時に分類クラスとして与えられていない概念であっても、モデルが事前学習を通じて関連する概念を獲得していれば、追加学習なしで分類できる場合があります。
ただし、未知の概念を必ず認識できるわけではなく、候補テキストの表現や画像の内容によって認識性能は変わります。
⑤ 技術的な意義
CLIPの重要な点は、画像と言語の対応関係を大規模に学習することで、自然言語を介した画像認識を可能にしたことです。
従来の画像分類モデルでは、分類対象を追加する際に、追加データの収集やラベル付け、モデルの再学習が必要になる場合があります。
一方、CLIPでは候補となるテキストを変更することで、さまざまな概念との類似度を評価できます。
このような仕組みは、画像と言語を結び付けるVLMの基礎的な考え方の一つとなっています。
なお、CLIPは画像の内容を自然言語で自由に説明するモデルではありません。主な機能は、画像とテキストの対応関係を評価することです。
3.2 BLIP-2:画像情報を大規模言語モデルに接続する
① 研究の背景と目的
BLIP-2(Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models)は、2023年に発表された画像と言語を扱うモデルです。
CLIPなどのモデルは、画像とテキストの対応関係を学習することで、自然言語を用いた画像認識を可能にしました。
一方、画像の内容を自然言語で説明したり、画像に関する質問に回答したりするには、視覚情報を言語生成モデルに適切に伝える仕組みが必要です。
しかし、画像エンコーダーと大規模言語モデル(LLM)を一体化して学習するには、多くの計算資源が必要になります。
そこでBLIP-2では、事前学習済みの画像エンコーダーとLLMを凍結し、その間を接続する軽量なモジュールを学習する方法を提案しました。
これにより、既存の大規模モデルの能力を活用しながら、比較的少ない学習パラメータで画像からの言語生成を実現することを目指しています。
② 提案手法の要点
BLIP-2の特徴は、次の3点に整理できます。
- 凍結した事前学習済みモデルの活用: 画像エンコーダーとLLMのパラメータを固定し、それらを接続する部分を中心に学習する。
- Q-Formerの導入: 画像エンコーダーが出力する視覚特徴から、言語モデルに有用な情報を抽出する。
- 2段階の学習: 画像と言語の対応関係を学習した後、抽出した視覚情報をLLMに接続し、画像を条件とした言語生成を学習する。
このように、BLIP-2では画像エンコーダーやLLMそのものを大規模に再学習するのではなく、両者をつなぐ仕組みを学習することで、画像からの言語生成を実現しています。
③ モデルの仕組み
BLIP-2は、主に以下の3つの要素で構成されています。
| 構成要素 | 役割 |
|---|---|
| Image Encoder | 入力画像から視覚特徴を抽出する |
| Q-Former | 視覚情報から言語生成に有用な情報を抽出し、画像と言語を繋ぐ |
| LLM | Q-Formerから受け取った視覚情報を利用して文章を生成する |
画像エンコーダーにはCLIPで学習されたViTなどが、LLMにはOPTやFlan-T5などが使用されています。
Q-Former:画像情報を抽出する中核モジュール
BLIP-2の中核となる技術が、Q-Former(Querying Transformer)です。
Q-Formerは、学習可能なQuery(クエリ)を用いて、画像エンコーダーが出力した視覚特徴から必要な情報を抽出する仕組みです。
画像エンコーダーが出力する視覚特徴には、画像内のさまざまな情報が含まれています。しかし、そのすべてをLLMに渡す必要はありません。
Q-Formerは、限られた数のQueryを通じて視覚情報を抽出することで、LLMに渡す情報を絞り込みます。
この構造は、情報のボトルネックとして機能します。
つまり、Q-Formerは単なる情報の圧縮器ではなく、言語生成に役立つ視覚情報を選択的に抽出し、LLMが利用できる表現へと変換する役割を担っています。
2段階の学習
BLIP-2の学習は、大きく2つの段階に分かれています。
第1段階:画像と言語の対応関係を学習
第1段階では、凍結した画像エンコーダーにQ-Formerを接続し、画像と言語の対応関係を学習します。
この段階では、以下の3つの学習目的が用いられます。
| 学習目的 | 内容 |
|---|---|
| ITC(Image-Text Contrastive Learning) | 画像とテキストの対応関係を学習し、正しいペアの類似度を高める |
| ITM(Image-Text Matching) | 画像とテキストが対応しているかを判定し、細かな対応関係を学習する |
| ITG(Image-Grounded Text Generation) | 画像を条件として文章を生成し、生成に必要な視覚情報を扱う能力を学習する |
それぞれの学習目的を組み合わせることで、Q-Formerは画像と言語の意味的な対応関係を捉えながら、文章生成に有用な視覚情報を抽出する能力を獲得します。
第2段階:LLMとの接続と視覚情報からの言語生成
第2段階では、第1段階で学習したQ-Formerを凍結したLLMに接続します。
Q-Formerが抽出した視覚情報は、LLMが受け取れる形式に変換され、入力として渡されます。
この段階では、画像情報を条件として文章を生成できるように、Q-Formerと接続部分を中心に学習します。
つまり、第1段階で画像と言語の対応関係を学習し、第2段階でその情報をLLMによる文章生成につなげる構成です。
この2段階の学習によって、BLIP-2は既存の画像エンコーダーとLLMの能力を活用しながら、視覚情報を用いた言語生成を可能にしています。
モデル全体の処理の流れ
BLIP-2の基本的な処理の流れは、次のように整理できます。
画像 → Image Encoder → 視覚特徴 → Q-Former → LLM → 文章生成
ここで、Q-Formerは視覚特徴から情報を抽出し、LLMが利用できる形式へとつなぐ役割を担います。
④ 画像を用いた言語生成
BLIP-2では、画像の内容を説明する文章の生成や、画像に関する質問応答などが可能です。
例えば、画像を入力し、「画像に何が写っていますか?」と質問すると、画像の内容に基づいた回答を生成できます。
これは、画像と言語の類似度を評価するCLIPとは異なり、画像の視覚情報をLLMに渡し、自然言語による出力を生成する仕組みによって実現されています。
ただし、画像に関する質問応答や指示への応答が可能であることと、複数のやり取りを通じて文脈を維持する高度な対話能力は別のものです。
BLIP-2の論文では、複数の画像・テキストを組み合わせた文脈内学習に制約があることも報告されています。
⑤ 技術的な意義
BLIP-2の重要な点は、事前学習済みの画像エンコーダーとLLMを、Q-Formerを介して効率的に接続する方法を示したことです。
CLIPが画像と言語の対応関係を学習することで自然言語による画像認識を可能にしたのに対し、BLIP-2は画像から抽出した情報をLLMに渡し、文章生成につなげる仕組みを示しました。
特に、Q-Formerによって視覚情報を選択的に抽出し、2段階の学習を通じてLLMに接続する構成は、画像と言語を結び付ける技術を、画像を用いた言語生成へと発展させるうえで重要な考え方です。
このように、画像と言語の対応関係を学習するだけでなく、視覚情報を言語モデルに接続することで、画像の説明や質問応答などのタスクに対応できるようになった点が、BLIP-2の技術的な意義です。
3.3 LLaVA:画像について対話できるモデルへの発展
① 研究の背景と目的
LLaVA(Large Language and Vision Assistant)は、2023年に発表された画像と言語を扱う大規模マルチモーダルモデルです。
CLIPは画像と言語の対応関係を学習し、BLIP-2は画像エンコーダーと大規模言語モデル(LLM)を接続することで、画像を条件とした言語生成を可能にしました。
しかし、画像について人間の指示に応じて説明したり、複雑な質問に回答したりするには、視覚情報を言語モデルに渡すだけでなく、画像を含む指示に適切に応答する能力を学習させることが重要になります。
そこでLLaVAでは、画像エンコーダーとLLMを接続したモデルに対して、画像と言語を組み合わせた指示追従データを用いて学習する「Visual Instruction Tuning」を提案しました。
この研究の特徴は、GPT-4を活用して画像に関する質問・回答データを生成し、それを用いてモデルを学習させたことです。
これにより、画像の内容を説明するだけでなく、自然言語による指示に応じて画像について対話するモデルの実現を目指しました。
② 提案手法の要点
LLaVAの特徴は、次の3点に整理できます。
- シンプルなモデル構造: CLIPの画像エンコーダーとLLMをLinear Projectionで接続する。
- Visual Instruction Dataの生成: GPT-4を活用し、画像の内容に関する質問・回答や対話、詳細な説明、複雑な推論を含むデータを生成する。
- Visual Instruction Tuning: 画像と言語を組み合わせた指示追従データを用いて、画像を条件とした応答を生成できるように学習する。
このように、LLaVAでは画像エンコーダーとLLMを接続するだけでなく、画像を含む指示に対して適切な応答を生成する能力を、指示追従学習によって獲得させることが重要なポイントです。
③ モデルの仕組み
LLaVAは、主に以下の3つの要素で構成されています。
| 構成要素 | 役割 |
|---|---|
| Vision Encoder | 入力画像から視覚特徴を抽出する |
| Linear Projection | 視覚特徴をLLMが扱える埋め込み空間に変換する |
| LLM | 画像情報と自然言語の指示を基に、回答を生成する |
画像エンコーダーにはCLIPのViT(Vision Transformer)が、LLMにはVicunaが使用されています。
Linear Projection:画像特徴をLLMに接続する
LLaVAの特徴の一つは、画像エンコーダーとLLMの間を、比較的シンプルなLinear Projectionで接続していることです。
画像エンコーダーは、入力画像から視覚特徴を抽出します。
しかし、その特徴をそのままLLMに入力することはできません。画像特徴をLLMの単語埋め込みと同じ次元の表現に変換する必要があります。
そこでLLaVAでは、学習可能なLinear Projectionを用いて、画像特徴をLLMが扱える視覚トークンへと変換します。
基本的な処理の流れは、次のようになります。
画像 → CLIP ViT → 視覚特徴 → Linear Projection → LLM → 回答生成
BLIP-2ではQ-Formerを用いて視覚情報を抽出・変換していましたが、LLaVAではLinear Projectionを用いるシンプルな構造を採用しています。
2段階の学習
LLaVAでは、画像特徴とLLMを接続するための学習と、画像を含む指示に応答する能力を獲得するための学習を、2段階に分けて行います。
第1段階:画像特徴とLLMの埋め込み空間を整合させる
第1段階では、画像エンコーダーとLLMのパラメータを凍結し、Linear Projectionのみを学習します。
この段階の目的は、画像エンコーダーが出力する視覚特徴を、LLMが扱える埋め込み空間に変換することです。
画像とキャプションのペアを用いて学習し、視覚情報をLLMに接続するための基盤を構築します。
第2段階:Visual Instruction Tuning
第2段階では、画像エンコーダーを凍結したまま、Linear ProjectionとLLMをファインチューニングします。
ここでは、画像と言語を組み合わせた指示追従データを用いて、画像の内容に関する質問や指示に適切に応答できるように学習します。
この段階を通じて、LLMは画像から得られる視覚情報を利用しながら、自然言語による指示に応じた回答を生成する能力を獲得します。
モデル全体の処理の流れ
LLaVAの基本的な処理の流れは、次のように整理できます。
画像 → CLIP ViT → Linear Projection → LLM → 回答生成
推論時には、画像から抽出した視覚情報と、ユーザーからの質問・指示をLLMに入力し、その内容に応じた文章を生成します
図:LLaVAの学習フェーズと推論フェーズ
④ Visual Instruction Tuning:画像について対話するための学習
LLaVAの大きな特徴は、GPT-4を活用してVisual Instruction Dataを生成したことです。
GPT-4を活用した学習データの生成
一般的な画像キャプションデータは、画像の内容を説明する短い文章が中心です。
しかし、画像について対話するモデルを学習するには、単純なキャプションだけでなく、質問・回答や複雑な推論など、さまざまな形式のデータが必要になります。
そこでLLaVAでは、画像に付随するキャプションや物体の位置情報などを利用し、言語のみを扱うGPT-4に、画像に関する質問・回答や対話データを生成させる方法を採用しました。
重要なのは、GPT-4に画像そのものを入力しているわけではないことです。
画像の内容を表すテキスト情報をGPT-4に与え、それをもとに画像に対応する質問・回答データを生成しています。
生成されるデータの種類
論文では、Visual Instruction Dataを大きく3つの種類に分類しています。
| データの種類 | 内容 |
|---|---|
| Conversation (対話) | 画像に関する質問と回答を複数ターンにわたって行う |
| Detailed Description (詳細な説明) | 画像の内容を詳しく説明する |
| Complex Reasoning (複雑な推論) | 画像の情報をもとに、複数の要素を組み合わせた推論を行う |
これらのデータを用いて学習することで、画像について単純に説明するだけでなく、さまざまな指示に応じた応答を生成する能力を獲得します。
データ生成方式の特徴と限界
GPT-4を活用したデータ生成方式には、画像そのものをGPT-4に入力する必要がないという特徴があります。
一方で、GPT-4が参照できる情報は、キャプションや物体の位置情報など、事前に用意されたテキスト情報に限られます。
そのため、キャプションに含まれていない細かな視覚情報や、記述されていない物体間の関係などが、生成される学習データに十分に反映されない可能性があります。
これは、学習データを生成する際に、元となる画像情報をどの程度テキストで表現できているかが重要になることを示しています。
⑤ 技術的な意義
LLaVAの重要な点は、画像エンコーダーとLLMを接続したモデルに、Visual Instruction Tuningを適用することで、画像について対話する能力を獲得させたことです。
CLIPが画像と言語の対応関係を学習し、BLIP-2が視覚情報をLLMに接続する方法を示したのに対し、LLaVAは画像を含む指示に応じた応答を生成する能力に焦点を当てました。
3つの論文の発展を整理すると、次のようになります。
| 論文 | 技術的な特徴 |
|---|---|
| CLIP | 画像と言語の対応関係を学習する |
| BLIP-2 | Q-Formerを介して視覚情報をLLMに接続する |
| LLaVA | Visual Instruction Tuningによって画像に関する指示追従・対話能力を学習する |
このように、LLaVAは、画像と言語を結び付ける技術を、人間の指示に応じて画像について説明・応答するマルチモーダルな対話モデルへと発展させた研究と捉えることができます。
なお、本記事ではLLaVAの初期論文を対象としています。その後、LLaVA-1.5などの後続モデルでは、学習データやモデル構成の改良が進められています。
4. 製造現場では何が変わり得るのか
ここまで、CLIP・BLIP-2・LLaVAの論文を通じて、画像と言語を結び付けるVLMの仕組みを整理してきました。
これらの技術の発展によって期待される大きな変化は、画像データの活用が、あらかじめ定義されたタスクの判定から、画像に含まれる意味情報の抽出・活用へと広がることです。
従来の画像認識技術では、画像から特定の特徴や状態を抽出し、あらかじめ定義されたタスクに応じて判定する用途が広く利用されてきました。
一方、VLMは画像と言語を結び付けることで、画像に含まれる情報を自然言語で説明したり、画像に関する質問に回答したりすることを可能にします。
これにより、画像を単に判定結果を得るための入力として扱うだけでなく、現場の状態を理解し、検索・説明・分析に活用するための情報源として利用できる可能性が広がります。
では、こうした技術が製造現場に導入されると、具体的にどのような変化が考えられるのでしょうか。
ここでは、画像からの状態理解、作業動画の活用、ゼロショットによる異常候補の探索という3つの観点から考えてみます。
4.1 画像から状態を理解し、自然言語で説明する
VLMの特徴の一つは、画像に含まれる情報を自然言語と結び付け、画像の内容を説明したり、画像に関する質問に回答したりできることです。
この能力を製造現場に応用することで、画像から得られる情報を、単なる判定結果としてではなく、現場の状態を理解し、説明するための情報として活用できる可能性があります。
例えば、作業者やワークの位置・動きの検出について考えます。
従来の画像認識技術では、作業者やワークの位置・動きなどを検出し、あらかじめ定義した条件に基づいて正常・異常を判定する用途で活用されてきました。
一方、VLMを活用すれば、異常が検出された際に、作業者がどのような動作をしていたのか、ワークがどのような状態にあったのかを質問することで、異常が発生した状況をより詳しく把握し、原因を追究するための手掛かりを得られる可能性があります。
このように、VLMによって、画像をあらかじめ定義された判定のためだけに使うのではなく、現場で何が起きていたのかを理解し、原因究明に活用するという方向への広がりが期待されます。
4.2 作業動画を製造データとして活用する
製造現場では、作業状況の確認やトラブル発生時の検証などを目的として、作業動画が記録・保存されることがあります。
しかし、動画には膨大な情報が含まれており、必要な場面を探し出すには、人が映像を確認するなどの手間がかかります。そのため、動画を記録していても、蓄積された映像を分析や原因究明に十分に活用することは容易ではありません。
一方、動画の内容を理解し、自然言語による検索を可能にする技術が発展すれば、蓄積された動画から必要な情報を効率的に探し出し、現場の状況把握や原因究明に活用できる可能性があります。
さらに、動画を製品や工程、製造条件などのデータと紐付けて蓄積することで、映像と製造データを組み合わせた分析を通じて、原因究明や改善活動に活用できる可能性が広がります。
このように、作業動画を単なる記録として保存するだけでなく、製造データと紐付けて蓄積し、将来的な分析や原因究明に活用できるデータとして扱うことが重要になるのではないでしょうか。
4.3 ゼロショットによる異常候補の探索
製造現場では、新しい製品や異常に対応する際、対象となる状態を検出・分類するための画像認識モデルを構築し、必要な精度を確保するための学習データを収集することが一般的です。
しかし、新製品の立ち上げ時や、発生頻度の低い異常への対応では、十分な学習データを確保することが難しい場合があります。
一方、VLMを活用したゼロショット分類では、あらかじめ学習していない分類対象であっても、画像と自然言語で記述した分類候補との関連性を評価することで、分類できる可能性があります。
これにより、十分な学習データが集まっていない段階でも、異常の可能性がある画像を抽出し、確認や分析の対象とするといった活用が考えられます。
ただし、ゼロショット分類によって、未知の異常を確実に検出できるわけではありません。特に、微細な外観不良や高い判定精度が求められる検査では、対象に特化した画像認識モデルが有効な場合もあります。
このように、ゼロショット分類は、学習データが十分に揃っていない段階で異常候補を探索するための手段として、従来の画像認識技術を補完する可能性があります。
5. おわりに
今回は、VLMの基礎と、製造現場における活用可能性について整理しました。
VLMに関連する技術は、静止画だけでなく、動画の内容を理解し、検索や要約に活用する技術にも広がっています。
次回以降は、NVIDIAのVSSやVLA(Vision-Language-Action)などの技術についても取り上げ、製造現場における動画データの活用可能性をさらに掘り下げていきたいと思います。
特に、動画を単なる記録として保存するのではなく、製造データと紐付けて蓄積することで、将来の製造DXにどのような価値をもたらせるのかを考えていきます。


