画像認識と自然言語処理の連成による核セキュリティ悪意行為検知
公開日:
カテゴリ: 第17回
画像認識と自然言語処理の連成による核セキュリティ上の悪意行為検知
Detection of malicious acts on nuclear security by combining image recognition and natural language processing
東京大学大学院
出町和之
KazuyukiDEMACHI
Member
東京大学大学院
陳実
ShiCHEN
Member
An algorithm has been developed to detect sabotage, etc. by converting surveillance camera images and rule documents into graph structures by deep learning. In the verification using the demo video, the judgment accuracy of 90% or more was obtained. A basic technology has been established to realize an interface with natural language processing AI with image AI.
Keywords: Object recognition, Posture recognition, Natural language processing, nuclear security, malicious acts
1.緒言
画像データは多くの情報を含むため、画像解析を応用した核物質盗取行為や妨害破壊行為を検知する技術の開発が期待されている。しかし現存する画像解析に基づく行為検知技術における判定は、「通常/逸脱」の二値判定も しくは画像識別の組み合わせに対する〇×設定に過ぎず、 状況の組み合わせが無数にあり得る核セキュリティへの適用は困難である。一方、撮影された状況が核セキュリティ上のルールに違反しているか否かを柔軟に判定できれば実用性は格段に高くなるが、それには画像と言語とい う異なるAI 同士のインターフェイスが必要である。そこで本研究では、異なる AI 同士の相関=AI インターフェ イス技術を開発した。
近年、深層学習などのAI を用いたシステムは数多く開発されているが、画像 AI は画像のみ、言語 AI は言語のみとそれぞれ個々のデータ形態の中で閉じており、異な るデータ形態を扱う AI 同士が相関するためには両データ形態を別の共通なデータ形態に変換する必要がある。 すなわち、人間が眼で見たモノやヒトの形状・位置などの 視覚情報を脳内での単純化・関係性抽出・論理表現化を経 て言語というデータ形態に変換することで周囲の状況を 理解しているのと同じように、画像 AI と言語 AI との相関は、互いが取得した情報を単純化・関係性抽出・論理表
連絡先: 出町和之、〒113-8654 東京都文京区本郷7-3- 1、東京大学大学院工学系研究科原子力国際専攻、E-mail: demachi@n.t.u-tokyo.ac.jp
現化して共通データ形態に変換することで、はじめて可 能となる。その上でまず重要なのは、共通データ形態の選 択である。本研究では最適形態としてグラフ構造を選択 した。グラフ構造とはグラフ理論とも呼ばれ、モノやヒト 同士の関係性を点(ノード)と矢印(エッジ)の連結で表現す る手法である。
2.画像AI と言語 AI とのインターフェイス
画像情報のグラフ構造化
まず、物体認識・姿勢認識AI と非AI 画像解析とを融合させた画像情報のグラフ構造化アルゴリズムを開発した。これにより、監視カメラなどで撮影された状況(シーン)を変換したグラフ構造がリアルタイムで出力される。ビッグデータに依存しがちなAI 研究の主流とは異なり、AI と非AI 画像解析とを融合させることで少ない教師データでの学習と学習時間短縮を実現した。
Fig.1 Model structure of YOLOv3[1]
物体認識には YOLOv3[1]を、姿勢認識には Xnect[2]を
使用した。それぞれのアーキテクチャを Fig. 1,2 に示す。YOLOv3 とXnect が検出したと物体と姿勢をSi, Tj とし、相互のユークリッド距離を用いた相関度に基づきSi -Tj 間の相関性を判定した(Fig.3)。
Fig.2 Model structure of Xnect[2]
Fig.3 Euclidean distance-based relationship extraction
Fig. 4 に、「ヘルメットと手袋と全面マスクを装着した人物」の画像から、相関性に基づき出力したグラフ構造の 例を示す。
Fig.4 Example of output result of image graph structure
文情報のグラフ構造化
文をグラフ構造に変換するために開発したアルゴリズ ムをFig. 5 に示す。まず入力されたルール文を記号化・形態素解析した後、特徴抽出とオントロジー解析により語句同士の論理関係および文グラフ構造を出力する。
Fig.5 Algorithm for sentence graph structure conversion
ただし、If then(条件), must(遵守), must not(禁止)を 表現するために、ここではグラフ構造として階層型グラフ構造を提案した。Fig.6 に文グラフ構造出力の例を示す。
Fig.6 Example of sentence graph structure
グラフ構造同士の比較による判定
最後に、画像と文のグラフ構造とを比較することで、禁 止・遵守行為の有無を自動判定する必要がある。ここでは、 グラフ構造同士の同型写像により、画像の状況と遵守・禁止ルールとの一致/不一致を判定した。判定の精度は、Precision(精度)およびRecall(再現率)により評価した。
3.結果
Fig.7 に、開発したアルゴリズムを用いた判定結果の例を示す。横軸がカメラからの距離、縦軸がPrecision(精度)、Recall(再現率)を示す。Fig.7 を含む7 つの状況に対する平均はPrecision=94.2%, Recall=84.4%であった。
Fig.6 Example of precision and recall
4.結論
深層学習モデルを用いて文と画像情報をグラフ構造化 することで、ルール文に基づく柔軟な状況判定が可能となる悪意行為ケチ手法を開発した。
参考文献
J. Redmon and A. Farhadhi, “YOLOv3: An incremental improvement,” arXiv preprint arXive: 1804.02767 (2018)
Mehta,.D. et al., “Xenct: Real-time multi-person 3d human pose estimation with a single camera.”, arXiv preprint arXiv: 1907.00837 (2019)