この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。 機械学習に携わる人の多くは、データ管理に悩んでいます。 データセットが古いため、手動で修正して注釈を付ける必要がある。 あるいは、他の人によって調整された同じデータ セットのバージョンが多数存在するため、どこから始めればよいかがわかりにくくなります。 または、適切なデータセットが存在しない場合には、自分で構築する必要があります。 海外では、 Simon Louskyというプログラマーがついに我慢できなくなり、機械学習用のデータ バージョン管理ツール(Data Version Control、DVC) を開発しました。 ワンクリックでデータセットを呼び出し、ワンクリックで編集履歴を表示します...最も重要なのは、DVC ツールの背後には、GitHub のようなデータ ホスティング コミュニティがあることです。 データセットを「アクティブ化」するSimon Lousky 氏は、学生時代にプロジェクトに取り組んでいたときに、機械学習データセットの管理が不便であるという問題点を感じていました。 当時、彼のモデルはトレーニングのために植物や花のデータを必要としていましたが、オープンソースのデータセットでは妥当な結果を生み出すことができませんでした。 そこで彼は数時間かけて、データセット内の多数の古くて不合理な注釈を一つずつ修正し、トレーニング結果は非常に満足のいくものでした。 彼はこのプロジェクト以外にも、その後多くのデータセットを修正、補足、作成しました。彼はこれらの時間と労力を要する作業を「データセットのデバッグと試行錯誤」と呼び、意図的に操作履歴を記録するようになりました。 彼は、自分のプロジェクトでのデータ管理は常に混乱しているが、GitHub でホストされているコードは常に整然としていることに徐々に気づきました。 では、データ管理に特化した GitHub のようなツールを作ってみてはいかがでしょうか? DVCが誕生しました。 データセットの呼び出し、履歴操作情報の表示などの機能を実装したプリインストールされたツールライブラリです。 その出現は、研究者がこれまでローカルの「デッド」データセットでモデルをトレーニングしていた方法が完全に変わることを意味します。 プロジェクトをオンラインでホストされているデータセット (または任意のファイル) にリンクして、リアルタイムで正確な接続を確立できます。データセットの更新や変更はタイムリーに把握できるため、プロジェクトの開発が容易になります。 たとえば、現在、リポジトリ A は「ライブ」データセットであり、メタデータ ファイルは専用サーバーに保存されている実際の大きなファイルをポイントしています。 ユーザーはデータセット ファイルをディレクトリに整理し、ユーティリティ関数を使用してコード ファイルを追加して簡単に呼び出すことができます。 さらに、機械学習プロジェクトに対応するリポジトリ B があります。プロジェクト コードには、DVC を使用してデータセットをインポートするための手順が含まれています。 A と B 間の接続を確立するには、データ レジストリを作成するだけです。
この時点で、データセット ディレクトリは次のようになります。 データセットの関連情報を表示するには、次のコマンドを入力します。
データセットのプレビューは、DVC によって追跡されるディレクトリに保存されます。 その後、ユーザーはコードとデータをホストされたリポジトリにプッシュするだけで、いつでもどこからでもアクセスして他のユーザーと共有できるようになります。 もちろん、DVC が機能するには、その背後にあるDAGsHubが不可欠です。 DAGsHub は GitHub のデータ管理バージョンであり、git リポジトリ、DVC、機械学習プロセス プラットフォーム mlflow の 3 つの部分で構成されています。 ユーザーは独自のプロジェクトを提出することができ、DAGsHub は提出されたプロジェクトを自動的にスキャンし、実験パラメータ、データ ファイル、モデルへのリンクなどの有用な情報を抽出し、それらをシンプルなインターフェイスに組み合わせます。 DAGsHub を使用すると、何もダウンロードせずにコード、データ、モデル、実験を閲覧および比較できます。 さらに、視覚的なデータ パイプライン、データ操作履歴を生成し、モデルのパフォーマンスを自動的かつ美しく記録できます。 機械学習プロジェクトで「ライブ」データセットを使用する方法DAGsHub を使用するには、登録してログインするだけです。 次のコマンドを使用して DVC をインストールします。
DAGsHub でデータセットを見つけました。それを自分のモデルで使用するにはどうすればよいですか? まず、ホストされているデータセットからディレクトリを生のファイルであるかのようにインポートします。
画像と注釈は、履歴情報を保持したまま、独自のプロジェクトにダウンロードされます。 データセットの変更履歴を知りたい場合は、次のコマンドを実行するだけです。 DVC アップデート 視覚化の結果をデフォルトのディレクトリに保存することができます。 便利じゃないですか? ちなみに、DVC と DAGsHub はどちらもオープンソースで無料ですので、ぜひ試してみてください。 ポータル: DVC チュートリアル: https://dagshub.com/docs/experiment-tutorial/2-data-versioning/ |
<<: IDC: 2021 年の中国スマート デバイス市場に関するトップ 10 の予測
[[187357]]顔の表情や頭の動きから自閉症やADHDの患者を識別できる新しいコンピューターアル...
2020年は自動運転業界が徐々に安定する年だ。ウェイモなどの巨大企業が商業化の模索を開始し、テスラ...
CCF-GAIR 2020人工知能フロンティア特別セッションでは、南京大学コンピュータサイエンス学...
人工知能はすでに多くの業界に大きな影響を与えています。調査会社IDCの調査によると、2019年の人工...
古代のシルクロードから、今日の AI 主導の超高精度な小売補充需要予測に至るまで、テクノロジーは常に...
適切な技術人材の採用は、企業組織による人工知能 (AI) の導入に対する大きな障壁となっています。最...
オープンソースの「ビッグコードモデル」が登場しました。 UIUC 清華大学の研究者チームは、70 億...
翻訳者 | 劉涛レビュー | Chonglou AIがなぜ機能するのか誰も知らないですよね?はい、そ...
この記事は、Heart of Autonomous Driving の公開アカウントから許可を得て転...
パートナーシップ、会社登録、資金調達なしで、独立系開発者の Li Xiaoyu は継続的に実践と反復...
9月20日、Googleの人工知能チームDeepMindは、AlphaMissenseと呼ばれる新し...