ディープラーニングフレームワークFlashを使用して、わずか数行のコードで画像分類器を構築する方法

[[412621]]

【51CTO.com クイック翻訳】 1. はじめに

画像分類は、画像がどのクラスに属するかを予測するタスクです。このタスクは画像表現のため困難です。画像を平坦化すると、長い 1 次元ベクトルが作成されます。さらに、この表現では隣接する情報が失われます。したがって、特徴を抽出し結果を予測するにはディープラーニングが必要です。

場合によっては、ディープラーニングモデルの構築は困難な作業になることがあります。画像分類の基本モデルは作成しましたが、コードの作成にかなり時間がかかりました。データの準備、モデルのトレーニング、モデルのテスト、サーバーへのモデルのデプロイを行うためのコードを準備する必要があります。ここで Flash が役に立ちます!

Flash は、ディープラーニングモデルを迅速に構築、トレーニング、テストするための高レベルのディープラーニングフレームワークです。 Flash は PyTorch フレームワークに基づいています。したがって、PyTorch を知っていれば、Flash にも精通しているはずです。

PyTorch や Lightning と比較すると、Flash は使いやすいですが、以前のライブラリほど柔軟ではありません。より複雑なモデルを構築する場合は、Lightning を使用するか、PyTorch を直接使用することができます。

Flash を使用すると、わずか数行のコードでディープラーニングモデルを構築できます。ディープラーニングを初めて使用する場合でも、心配する必要はありません。 Flash を使用すると、コードに混乱することなくディープラーニングモデルを構築できます。

この記事では、Flash を使用して画像分類器を構築する方法を説明します。

II. 実施

ライブラリのインストール

ライブラリをインストールするには、次のように pip コマンドを使用します。

 pip インストール lightning-flash

そのコマンドが機能しない場合は、GitHub リポジトリを使用してライブラリをインストールできます。コマンドは次のとおりです。

 pip で git+https://github.com/PyTorchLightning/lightning-flash.git をインストールします

パッケージを正常にダウンロードできたら、ライブラリをロードできるようになります。シードも42番に設定しました。これを実行するコードは次のとおりです。

 pytorch_lightningからseed_everything をインポートします
 
フラッシュをインポート
flash.core.classificationからラベルをインポート
flash.core.data.utilsからdownload_data をインポートします
flash.imageからImageClassificationData、ImageClassifier をインポートします
 
 #ランダムシードを設定します。
シード_エブリシング(42)
グローバルシードセット  42まで
42

データをダウンロード

ライブラリがインストールされたので、次はデータを取得します。デモンストレーションのために、「Cat and Dog dataset」というデータセットを使用します。

このデータセットには、猫と犬の 2 つのカテゴリの画像が含まれています。データセットにアクセスするには、Kaggle で検索してください。データセットにはここからアクセスできます。

データの読み込み中

データをダウンロードしたら、データセットをオブジェクトにロードしましょう。 from_folders メソッドを使用して、データを ImageClassification オブジェクトに格納します。これを実行するコードは次のとおりです。

データモジュール = ImageClassificationData.from_folders(
    train_folder = "cat_and_dog/training_set" 、
    val_folder = "cat_and_dog/validation_set" 、
 ）

モデルの読み込み

データをロードした後、次のステップはモデルをロードすることです。独自のアーキテクチャをゼロから構築するわけではないので、既存の畳み込みニューラルネットワークアーキテクチャに基づく事前トレーニング済みモデルを使用します。

事前トレーニング済みの ResNet-50 モデルを使用します。さらに、データセットに基づいてカテゴリの数を設定します。これを実行するコードは次のとおりです。

モデル = ImageClassifier(バックボーン = "resnet50" 、num_classes = datamodule.num_classes)

モデルのトレーニング

モデルが読み込まれたら、次はモデルをトレーニングします。まず Trainer オブジェクトを初期化する必要があります。モデルを 3 エポックにわたってトレーニングします。さらに、GPU を使用してモデルをトレーニングできるようにします。これを実行するコードは次のとおりです。

トレーナー = flash.Trainer(max_epochs=3, gpus=1)
使用可能な GPU: True 、使用済み: True使用可能な TPU: False 、使用中: 0 TPU コア

オブジェクトを初期化したら、モデルをトレーニングしましょう。モデルをトレーニングするには、finetune と呼ばれる関数を使用できます。関数内で、モデルとデータを設定します。さらに、トレーニング戦略をフリーズに設定して、特徴抽出器をトレーニングしないことを示します。つまり、分類器部分のみをトレーニングします。

これを実行するコードは次のとおりです。

 trainer.finetune(モデル、データモジュール=datamodule、戦略= "freeze" )
 LOCAL_RANK: 0 - CUDA_VISIBLE_DEVICES: [0] |名前| タイプ | パラメータ---------------------------------------- 0 | メトリック | ModuleDict | 0 1 | バックボーン | シーケンシャル | 23.5 M 2 | ヘッド | シーケンシャル | 4.1 K ---------------------------------------- 57.2 K トレーニング可能なパラメータ 23.5 M トレーニング不可能なパラメータ 23.5 M 合計パラメータ 94.049 推定モデルパラメータの合計サイズ (MB)  
検証の妥当性チェック: 0it [00:00, ?it/s]
グローバルシードセット  42まで
トレーニング: 0it [00:00, ?it/s]
検証中: 0it [00:00, ?it/s]
検証中: 0it [00:00, ?it/s]
検証中: 0it [00:00, ?it/s]

評価結果は次のとおりです。

結果から、モデルの精度は約 97% であることがわかります。悪くないですね！では、新しいデータでモデルをテストしてみましょう。

モデルのテスト

モデルがトレーニングされていないサンプルデータを使用します。以下はテストするモデルのサンプルです。

 matplotlib.pyplot をpltとしてインポートします。
 PIL インポート画像から
 
図、ax = plt.subplots(1, 5、図のサイズ=(40,8))
 iが範囲(5)内にある場合:
    ax[i].imshow(Image.open ( f'cat_and_dog/testing/{i+1}.jpg' ) )
 plt.show()

モデルをテストするには、フラッシュライブラリの predict メソッドを使用できます。これを実行するコードは次のとおりです。

 model.serializer = ラベル() 
 
予測 = model.predict([ "cat_and_dog/testing/1.jpg" ,
 「cat_and_dog/テスト/2.jpg」 、
 「cat_and_dog/テスト/3.jpg」 、
 「cat_and_dog/テスト/4.jpg」 、
 「cat_and_dog/テスト/5.jpg」 )
印刷(予測)
 [ '犬' 、 '犬' 、 '猫' 、 '猫' 、 '犬' ]

上記の結果から、モデルが正しいラベルを持つサンプルを予測していることがわかります。素晴らしい！後で使用するためにモデルを保存しましょう。

モデルを保存する

モデルをトレーニングし、テストしました。 save_checkpoint メソッドを使用してモデルを保存しましょう。これを実行するコードは次のとおりです。

 trainer.save_checkpoint( "cat_dog_classifier.pt" )

別のコードに対してモデルをロードする場合は、load_from_checkpoint メソッドを使用できます。これを実行するコードは次のとおりです。

モデル = ImageClassifier.load_from_checkpoint( "cat_dog_classifier.pt" )

3. 結論

よくできました! Flash を使用して画像分類器を構築する方法を学びました。記事の冒頭で述べたように、必要なのはほんの数行のコードだけです。すごいと思いませんか?

この記事が、皆さんの状況に合わせた独自のディープラーニングモデルの構築に役立つことを願っています。より複雑なモデルを実装したい場合は、PyTorch の学習を開始することをお勧めします。

原題: Flash を使って数行のコードで画像分類器を構築する方法、著者: Irfan Alghani Khalid

[51CTOによる翻訳。パートナーサイトに転載する場合は、元の翻訳者と出典を51CTO.comとして明記してください]

<<: ディープラーニングを使用して、写真用の強力な画像検索エンジンを構築します

>>: ドローン基地局は被災地の通信復旧にどのように役立つのでしょうか?

ブログ

顔認識を法的に規制する方法

ブログ

知識が求められるポストディープラーニング時代において、知識グラフをいかに効率的かつ自動的に構築できるのでしょうか?

ブログ

ディープラーニングフレームワークFlashを使用して、わずか数行のコードで画像分類器を構築する方法

[[412621]]

【51CTO.com クイック翻訳】 1. はじめに

II. 実施

ライブラリのインストール

データをダウンロード

データの読み込み中

モデルの読み込み

モデルのトレーニング

モデルのテスト

モデルを保存する

3. 結論

顔認識禁止が迫る：テクノロジー企業はどこへ向かうべきか？

レポートの解釈: 企業の 91% が 2023 年に AI がビジネスの成長を促進すると予想

「ムスク」がスピーキングの練習に役立ちます！ GitHub のリアルタイム AI 音声チャットが話題に

大規模モデルはなぜこんなに遅いのか？考えすぎだったことが判明：新しい方向性は、人間と同じ思考アルゴリズムを使用することです

機械学習における不均衡なクラスに対処するための 5 つの戦略

顔認識を法的に規制する方法

知識が求められるポストディープラーニング時代において、知識グラフをいかに効率的かつ自動的に構築できるのでしょうか?

推薦する

自然言語処理 (NLP) とは何ですか?

イェール大学教授を征服したアルゴリズムプログラマーを見て、「人間本位」を実践してスマートコミュニティの脳を開発するにはどうすればよいのでしょうか?

アントチェーン、AI + ブロックチェーン技術でオリジナル作品を共同保護するデジタル著作権サービスプラットフォームの開設を発表

自動運転車におけるセンサー応用に関する重要な考慮事項

オープンソースの自動車機械ソフトウェアであるOpenpilotがアップデートされ、ナビゲーションに基づいて一般の自動車が自動運転できるようになる

AIと5Gテクノロジーがスマートグリッドのセキュリティ課題解決に貢献

Java プログラミングスキル - データ構造とアルゴリズム「バイナリソートツリー」

人工知能は良いものだが、企業はAIの適用時に4つの大きな間違いを犯している。

AIRankingsが世界の大学AIランキングを発表

河南省鄭州市：自動運転オンライン配車サービス車両が一般公開

AI大学院生は年間50万元を稼ぐことができるが、彼らの給料は学校を卒業する前からすでに奪われている。

自動運転マシンビジョンの4つの基本タスクを理解するための1万語