ML Ops: データ品質が鍵

ML Ops: データ品質が鍵

ML Ops は AI 分野における比較的新しい概念であり、「機械学習操作」として説明できます。モデルを効率的に開発、展開、監視できるように、データ サイエンティストと運用スタッフをより適切に管理するにはどうすればよいでしょうか。データの品質は非常に重要です。

[[346458]]

この記事では、ML Ops の概要を説明し、ML Ops ワークフローにおけるデータ品質の重要な役割について説明します。

ML Ops の開発は、機械学習と従来のソフトウェア エンジニアリングの間のギャップを埋め、データ品質は ML Ops ワークフローの鍵となり、データ チームの加速とデータの信頼性の維持に役立ちます。

ML Opsとは

ML Ops という用語は DevOps から発展しました。

DevOps は、開発 (アプリケーション/ソフトウェア エンジニアリング)、技術運用、品質保証 (QA) 部門間のコミュニケーション、コラボレーション、統合を促進する一連のプロセス、方法、システムです。 DevOps は、ソフトウェア開発者 (Dev) と IT 運用技術者 (Ops) 間のコミュニケーションとコラボレーションを重視する文化、運動、または実践です。ソフトウェアの配信とアーキテクチャの変更プロセスを自動化することで、ソフトウェアをより速く、より頻繁に、より確実に構築、テスト、リリースできるようになります。

一方、MLOps は、継続的インテグレーション、継続的デリバリー、継続的デプロイメントなど、ワークフローの効率を向上させる DevOps の原則とプラクティスに基づいています。 ML Ops は、次の目標を掲げて、これらの原則を機械学習プロセスに適用します。

  • より速くモデルを実験し開発する
  • モデルをより早く本番環境に導入
  • 品質保証

DevOps の一般的な例としては、git などのツールを使用したコードのバージョン管理、コードレビュー、継続的インテグレーション (CI、つまり共有メインラインへのコードの頻繁なマージ)、自動テスト、継続的デプロイメント (CD、つまり本番環境へのコードの自動マージ) などがあります。

ML Ops を機械学習に適用すると、モデル出力の品質を確保しながら、機械学習モデルの開発と本番環境への展開を加速することを目的としています。ただし、ソフトウェア開発とは異なり、ML ではコードとデータの両方を扱う必要があります。

  • 機械学習はデータから始まりますが、データはさまざまなソースから取得されるため、さまざまなソースからのデータをクリーンアップ、変換、および保存するためのコードが必要です。
  • 処理されたデータはデータ サイエンティストに提供され、データ サイエンティストはコードを記述し、機能エンジニアリングを完了し、機械学習モデルを開発、トレーニング、テストし、最終的にこれらのモデルを運用環境に展開します。
  • 運用環境では、ML モデルはコードとして存在し、さまざまなソースから入力データを取得し、製品やビジネス プロセスに取り込まれる出力データを作成します。

上記の説明ではプロセスが簡略化されていますが、ML 環境ではコードとデータが密接に結合されており、ML Ops は両方を処理する必要があることがわかります。

具体的には、ML Ops には次のタスクが含まれます。

  • データ変換とモデル定義に使用されるコードのバージョン管理。
  • 取得したデータとモデル コードを本番環境に移行する前に自動的にテストします。
  • 安定したスケーラブルな環境でモデルを本番環境にデプロイします。
  • モデルのパフォーマンスと出力を監視します。

データ テストとドキュメントは ML Ops にどのように適合しますか?

ML Ops は、モデル出力の品質を確保しながら、機械学習モデルの開発と実稼働展開を加速することを目的としています。もちろん、データ品質の専門家が ML ワークフローの各段階でスピードと品質を達成するには、データのテストとドキュメント化が非常に重要です。

  • 利害関係者側では、質の悪いデータはシステムに対する信頼に影響を与え、その結果、そのシステムに基づいた意思決定に悪影響を及ぼす可能性があります。さらに悪いことに、データ品質の問題に気付かないと誤った結論につながる可能性があり、それを修正すると多くの時間が無駄になる可能性があります。
  • エンジニアリング側では、下流の消費者が気付いたデータ品質の問題を急いで修正することが、チームの時間を浪費し、チームの生産性と士気を徐々に低下させる最大の問題の 1 つです。
  • さらに、データの文書化は、すべての関係者間でデータを伝達し、データ契約を確立するために重要です。

次のセクションでは、ML パイプラインのさまざまなステージを大まかに説明し、データ テストとドキュメントが各ステージにどのように適合するかについて説明します。

1. データ収集段階

データ セット処理の初期段階であっても、データの品質チェックと文書化を行うことで、長期的には操作を大幅に高速化できます。エンジニアにとって、不必要な問題を引き起こすことなくデータ取り込みパイプラインに安全に変更を加えることができる信頼性の高いデータ テストが重要です。同時に、社内外の上流ソースからデータを取得する際には、取得段階でデータ検証を実行し、データに予期しない変更がないことを確認することが非常に重要です。

2. モデル開発

この記事では、コアモデル開発プロセスの一部として、特徴エンジニアリング、モデル トレーニング、モデル テストについて説明します。この継続的な反復プロセスでは、データ サイエンティストをサポートするためにデータ変換コードとモデル出力に関するサポートが提供されるため、1 か所の変更によって他の部分が壊れることはありません。

従来の DevOps では、CI/CD ワークフローによる継続的なテストにより、コードの変更によって生じた問題を迅速に特定できます。さらに一歩進んで、ほとんどのソフトウェア エンジニアリング チームでは、開発者が既存のテストを使用してコードをテストするだけでなく、新しい機能を作成するときに新しいテストを追加することも要求しています。同様に、テストの実行と新しいテストの作成は、ML モデル開発プロセスの一部である必要があります。

3. モデルを本番環境で実行する

すべての ML Ops と同様に、本番環境で実行されるモデルは、信頼性の高い結果を生成するためにコードと入力データに依存します。データ取得フェーズと同様に、コードの変更や実際のデータの変更によって生じる不要な問題を回避するために、データ入力を保護する必要があります。同時に、モデルが期待どおりに動作し続けることを確認するために、モデル出力に関するテストも実行する必要があります。

特にブラックボックス ML モデルを使用する環境では、モデル出力の品質基準を確立し、維持することが重要です。同様に、モデルの予想される出力を共有領域に文書化することで、データ チームと関係者が「データ コントラクト」を定義して伝達できるようになり、ML パイプラインの透明性と信頼性が向上します。

オリジナルリンク: https://greatexpectations.io/blog/ml-ops-data-quality/

[この記事は51CTOコラム「Machine Heart」、WeChatパブリックアカウント「Machine Heart(id:almosthuman2014)」によるオリジナル翻訳です]

この著者の他の記事を読むにはここをクリックしてください

<<:  比較分析に基づく人工知能技術の革新の道筋に関する研究

>>:  マイクロソフトの新しい画像キャプションAIは、Word、Outlook、その他のソフトウェアのアクセシビリティ向上に役立ちます。

ブログ    

推薦する

...

ハギングフェイスCEOが2024年のAI業界の6つの大きな変化を予測!

2024年にAI業界はどのように進化するのでしょうか? OpenAIのグレッグ・ブロックマン会長は...

自動運転の4つの主要技術の簡単な分析

2017年5月に世界保健機関が発表したデータによると、世界中で毎年約125万人が交通事故で亡くなって...

今年のノーベル賞はアルトゥール・エケルト氏が受賞すると見られている。百度研究所の科学者の力を過小評価すべきではない。

2019年のノーベル賞受賞者のリストは、今年10月7日から発表されます。発表日が近づくにつれ、学界...

CBインサイトがAI業界の25大トレンドを発表:中国では顔認識や無人店舗が急速に発展

[[260147]]この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI...

...

特許出願は世界中に広がっています!中国の新興人工知能についてあなたが知らないこと

待望の2020年世界インターネット会議が先日、烏鎮で開催されました。中国サイバースペースアカデミーが...

Nvidiaが自動運転AIアルゴリズムをオープンソース化、チップ性能をXavierの7倍にアップグレード

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

人間の脳細胞は、マトリックスのように、AIよりも速く、エネルギー効率よく、ペトリ皿の中でゲームをすることを学ぶ

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

ニューラルネットワークのデバッグは難しすぎる。6つの実用的なヒントをご紹介します

ニューラル ネットワークに基づくプロジェクトにおけるボトルネックは通常、ネットワークの実装ではありま...

ビル・ゲイツ:人工知能に国境を簡単に引いてはいけない

[[260361]]新華社によると、ビル&メリンダ・ゲイツ財団の共同議長ビル・ゲイツ氏は最近スタンフ...

Microsoft PowerPoint は 11 月に Copilot を統合します: 数秒でプレゼンテーションを生成

10月13日、Microsoft 365 ロードマップによると、OneNote、Word、OneDr...

NIST: AIの偏りはデータだけにとどまらない

現時点では、ほとんどの AI がある程度問題のある偏見に基づいて構築され、現在もそれを使用しているこ...

マイクロソフトとフェイスブックが共同で人工知能ソフトウェアを開発し、グーグルの主導的地位に挑戦

マイクロソフトはすでにオープンソースの人工知能ソフトウェアを持っています。しかしここ数カ月、マイクロ...