ディープラーニングを使用してビデオから車両速度を推定する

ディープラーニングを使用してビデオから車両速度を推定する

私が解決したい問題は、車にカメラが付いていて、車がどれくらいの速さで走っているのかを知りたいということです。当然ながら、スピードメーターは見ることができず、ビデオクリップそのものしか見ることができません。ここではディープラーニングの魔法が役立つはずです。

データ

2つの異なるビデオがあります。 1つはトレーニング用、もう1つはテスト用です。トレーニング ビデオには 20399 フレームがあり、テスト ビデオには 10797 フレームがあります。ビデオのダウンロードアドレス: https://github.com/commaai/speedchallenge。以下にいくつか例を挙げます。

ビデオのサンプル画像

トレーニング ビデオのラベルは .txt ファイルであり、各行は特定のフレームの速度に対応します。

方法

この問題の最も興味深い部分は、ニューラル ネットワークへの入力がどのようになるかという点です。静止画像だけでは速度を計算することは不可能です。効果的な方法は、2 つ以上の画像を積み重ねるか、LSTM や Transformer のように連続して積み重ねることです。もう 1 つはオプティカルフローを計算するもので、これを使用することにしました。

オプティカルフローとは何でしょうか? 基本的には、2 つの画像間の相対的な動きを示す各ピクセルのベクトルを計算する方法です。素晴らしいコンピューター愛好家向けビデオがあります: https://www.youtube.com/watch?v=4v_keMNROv4 で詳細を確認できます。オプティカルフローを計算するために使用できる「古典的な」コンピュータービジョンアルゴリズムがいくつかありますが、ディープラーニングははるかに改善されています (当然のことですが)。では、SOTA メソッドとは何か、paperswithcode で確認してみましょう。

RAFT は見た目も良く、PyTorch 実装も備えています。元のリポジトリをフォークして、少しシンプルにしました。研修や評価などは必要ありません。私はそれを推論のためだけに使います。

オプティカルフローの計算

推論のために、ネットワークは 2 つの画像を連結し、形状のテンソル (2、image_height、image_width) を予測します。前述したように、画像内の各ピクセルは 2 次元ベクトルに対応します。これらのファイルは実際のトレーニングで使用するため、.npy ファイルとして保存します。オプティカルフロー画像を想像すると次のようになります。

電車

私たちのトレーニングの目的を思い出してください:

オプティカルフロー → モデル → 車両速度推定

私が選んだモデルはEfficientNetです。スケーラビリティが高いのでとても気に入っています。選択できるバージョンは 8 つあり、最大のバージョンである EfficientNet-B7 は依然として非常に優れています。まずは B0 のような小型のモデルから始めて、すべてが正常に動作し、十分な性能の GPU がある場合は、より大きなモデルを選択できます。事前トレーニング済みのネットワーク モデルを簡単にロードするために使用する PyTorch ライブラリもあります: https://github.com/lukemelas/effecentnet-PyTorch [train.ipynb](https://github.com/sharifelfouly/vehicle-speed-estimate)を開くと、トレーニングがどのように機能するかを確認できます。

私の GPU には 6 GB のメモリしかないため、常に B0 から開始して B3 までスケールアップします。トレーニング後、次の結果が得られました (損失は平均二乗誤差です)。

トレーニング損失

検証損失

素晴らしい、すべて正常に動作しているようです。トレーニングと検証の両方の損失が減少しており、ネットワークは過剰適合していません。

結果は次のとおりです。

完璧ではありませんが、いくつかの用途はあります。

要約する

私は通常、機能エンジニアリングの大ファンではありませんが、この場合はかなりうまく機能していると思います。次のステップは、Transformer や LSTM のような、より順次的なものを試すことです。

<<:  AIの分野を深く探究しよう!新しい機能が次々と登場し、携帯電話で包括的なスマート体験を提供します

>>:  2020 年の人工知能におけるトップ 10 の技術進歩

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

大きなモデルもスライスできます。Microsoft SliceGPTはLLAMA-2の計算効率を大幅に向上させます。

大規模言語モデル (LLM) には通常、数十億のパラメータがあり、数兆のトークンのデータを使用してト...

AI製品化の鍵はアルゴリズムではなくインフラとデータ

[[187402]]人工知能は現在、魔法のような大流行を経験しています。データは、数字の羅列としてニ...

...

ブロックチェーンと人工知能、統合開発の「win-winゲーム」

[[259445]]ブロックチェーンと人工知能はどちらも今話題になっています。クールな「ブラックテ...

AIを使ってAIを攻撃する?敵対的機械学習に対する脅威と防御

人工知能 (AI) や機械学習 (ML) プロジェクトを適用する組織が増えるにつれて、これらのプロジ...

現代のサイバーセキュリティに人工知能が必要な理由

ダイヤルアップ インターネットの時代よりずっと以前、ウイルスが感染したフロッピー ディスクを介して拡...

ChatGPTという独立系ゲームがSteamから削除されました。開発者は「貯金と3年半の人生が消えてしまいました」と語っています。

3年半このゲームに一生懸命取り組んだのに、ChatGPT を使用したという理由だけで Steam ...

研究者:AIモデルの「推論」はより多くの電力を消費し、業界の電力消費は2027年に「オランダに匹敵する」ようになる

今週10月13日、Cellの姉妹誌Jouleは「人工知能の増大するエネルギーフットプリント」と題する...

機械知能に取って代わられない5つのスキル

「機械知能が人間のために行っている 5 つのこと」という記事では、機械が常に新しい奇跡を生み出してい...

マイクロサービスにおける電流制限ロジックとアルゴリズム

[[341117]]この記事はWeChatの公開アカウント「Invincible Coder」から転...

...

AIチップのスタートアップ企業が岐路に立つ

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

...

AIの世界は「データ」から「知識」へと移行している

人工知能(AI)革命は半世紀以上前に始まりました。過去 10 年間で、人工知能は学術科学の領域から私...