機械学習研究開発プラットフォームの選択

機械学習研究開発プラットフォームの選択

機械学習は現在隆盛を極めていますが、機械学習を学習・研究し、実稼働環境で活用したい場合には、プラットフォーム、開発言語、機械学習ライブラリの選択を慎重に検討する必要があります。以下は、機械学習に関する私自身の経験に基づいた、参考のための提案です。

[[188142]]

まず、プラットフォームの選択に関する最初の質問は、それを実稼働環境、つまり特定の製品で使用するのか、それとも研究や学習のためだけに使用するのかということです。

1. 本番環境での機械学習プラットフォームの構築

プラットフォームを本番環境で使用する場合は、製品のために分析する必要があるデータの量を見積もる必要があります。データ量が多い場合は、ビッグデータ プラットフォームを選択する必要があります。それ以外の場合は、スタンドアロン プラットフォームだけが必要です。

1.1 本番環境での機械学習ビッグデータプラットフォームの構築

実稼働環境で最も主流のビッグデータ プラットフォームは Spark プラットフォームであり、これに YARN や Mesos などの補助的な分散データ処理コンテナーが加わります。オンライン データをリアルタイムで収集する必要がある場合は、Kafka を追加します。つまり、一般的なビッグデータ処理プラットフォームは、Spark + YARN(Mesos)+ Kafkaを統合したものです。私が現在取り組んでいる製品プロジェクトはすべてSpark + YARN + Kafkaに基づいています。現時点では、このプラットフォームの選択が基本的に主流の方向です。

もちろん、これほど多くのオープンソースソフトウェアを統合するのは面倒だし、落とし穴も多いはずだという人もいるでしょう。Spark + YARN + Kafka のようなビッグデータプラットフォーム機能を組み込めるユニバーサルプラットフォームはないでしょうか。私の知る限りでは、CDAP (http://cdap.io) が比較的うまくいっています。 Spark、YARN、Kafka、およびいくつかの主流のオープンソースデータ処理ソフトウェアを統合します。開発者は、そこにカプセル化された API レイヤーで二次開発を行うだけで済みます。これは良いアイデアであるはずですが、まだ商業的に成功した事例がないため、アーキテクチャを選択する際に CDAP は考慮しませんでした。

したがって、Spark + YARN + Kafka に基づくビッグデータ プラットフォームは依然として最適です。 Spark MLlib の機械学習アルゴリズムは豊富ではなく、使いやすいものでもありません。そのため、製品に MLlib で利用できないアルゴリズムが必要な場合は、オープンソースの実装を自分で探す必要があります。

1.2 実稼働環境での機械学習のためのスタンドアロンマシンデータプラットフォームの構築

本番環境のデータが大きくない場合、ビッグデータ プラットフォームはやや過剰設計のように思えます。現時点では、選択肢はもっとあります。 ***、これはまだ Spark プラットフォームですが、分散コンテナ YARN と分散データ配信ルーティング Kafka は不要になりました。なぜ Spark か? 拡張性を考慮する必要があるからです。現在のデータ量が少ないからといって、将来的にもデータ量が少なくなるというわけではありません。これは、私が参加したいくつかの小規模なデータ分析プロジェクトに Spark を選んだ理由でもあります。もちろん、もう 1 つの理由は、Spark が Python、Java、Scala、R を同時にサポートしていることだと思います。これにより、多くのプログラマーにとって参加のハードルが下がります。私が参加したSparkプロジェクトでは、開発言語は主にJavaとScalaでした。速度上の理由から Python は選択されず、システムの残りの部分は Java で記述されています。

2 番目のオプションは、numpy、scipy、pandas、MatplotLib などを含む、scikit-learn に基づく一連の Python ツールです。その特徴は豊富なクラスライブラリ、特に機械学習ライブラリの scikit-learn はあらゆる武器を持っているとも言えるでしょう。さらに、プログラムをインタラクティブに記述できるため、プロトタイプを迅速に開発することが容易になります。私は実現可能性分析段階にある 2 つのプロジェクトに関わっており、どちらのプロジェクトでも scikit-learn を使用して顧客向けのプロトタイプとデモを作成しています。

したがって、本番環境のスタンドアロンの機械学習データ プラットフォームの場合、製品開発には Spark が最適な選択肢であり、迅速なプロトタイピングと検証には scikit-learn ファミリーが適しています。

2. 研究環境における機械学習プラットフォームの構築

単に調査をするだけなら選択肢はたくさんあり、主流は 3 つあります。

  • 1 つ目は学習用の Spark MLlib に基づいています。メリットは、学習した内容をシームレスに本番環境に移行できることですが、デメリットも明らかです。Spark には多くの機能があり、単一のマシンで実行するとメモリを大量に消費し、比較的遅くなります。また、MLlib クラス ライブラリは豊富ではなく、多くのアルゴリズムではクラス ライブラリを自分で探す必要があります。同僚からのフィードバックによると、かなり難しいとのことなので、Spark MLlib をベースに機械学習を学ぶのは個人的には良い選択ではないと思います。
  • 2 つ目は、前述の numpy、scipy、pandas、MatplotLib などを含む、scikit-learn に基づく一連の Python ツールを使用して学習することです。クラスライブラリが豊富でAPIが強力であるため、データ分析に集中できるのがメリットです。また、例題も豊富なので、学習も難しくありません。もちろん、欠点もあります。つまり、これらすべての Python ライブラリを使いこなせるようになるには、ある程度の時間がかかります。 個人的にはこの方法をお勧めします。同僚の間では、学習とコミュニケーションに scikit-learn を使用するのも主流です。
  • 3 つ目のタイプは、機械学習に R ベースのプラットフォーム (Spark R を除く) を使用するもので、主なプラットフォームは R studio です。 R は比較的古い言語であるため、データ処理や機械学習用の API が豊富に用意されており、特にデータアナリストだった人には馴染み深いものとなっています。しかし、R は比較的閉鎖的な言語であり、そのコミュニティは Python に比べてはるかに活動的ではありません。さらに、プログラマーにとって、R の構文は使いにくいものです。数年前までは、機械学習においては R が Python よりも優れていると一般的に考えられていましたが、現在では Python は R を大きく引き離しています。したがって、R 言語にすでに精通していない限り、機械学習の学習に R を使用することはお勧めできません。ちなみに、ここで R を差別するつもりはありません。

つまり、機械学習を勉強したいが、特別な R のバックグラウンドがない場合は、scikit-learn が最適な選択肢です。もちろん、機械学習アルゴリズムを自分で少しずつ実装するのが好きで、クラスライブラリを直接呼び出すのは好きではないと言う人もいるでしょう。これは良くないのでしょうか? もちろん、これは間違いなく非常に良いことであり、さまざまなアルゴリズムの理解を深めるのに非常に役立ちます。ただ、これはかなり時間がかかります。私のように時間があまりない場合は、API を直接呼び出してデータを調べる方が簡単です。

<<:  AGVロボットマルチエージェント経路探索の4つの主要な研究方向

>>:  Python 機械学習の実践: クレジットカード詐欺検出

ブログ    
ブログ    

推薦する

「オープン性、透明性、倫理」という目標を達成するために、AIアルゴリズムが政府の規制を策定するために使用される。

ニュージーランド政府は、政府機関がアルゴリズムを使用する方法のガイドとなることを目的とした一連の標準...

このベクターニューラルスタイルのブラシを使用すると、GANなしで美しい絵画を生成できます

CVPR 2021で発表された論文の中で、NetEase Fuxiとミシガン大学の研究者は、制御可能...

マイクロソフト、Windows 10を開発者向けAIプラットフォームに

人工知能の人気が高まるにつれ、あらゆるテクノロジーメーカーが自社の製品やサービスに人工知能というラベ...

...

Python 自然言語処理 (NLP) を使用して要約を作成する方法

たくさんのレポートを読まなければならないときに、それぞれのレポートを簡単に要約したいという状況に遭遇...

Nvidia H100 は GPT-3 を 11 分でトレーニングしました。PyTorch の創設者: 時間だけを見るのはやめましょう

昨日、Lao Huangが再び「勝利」しました!なぜ?最新の MLPerf ベンチマークでは、NVI...

13歳の天才少年がAIスピーカーを開発。2010年代以降の世代は単純ではない

現代のティーンエイジャーにとってクールなものは何でしょうか?おそらくそれは AJ シューズを履くこと...

米商務省の新規制:承認なしに中国とセキュリティの脆弱性を共有することを禁止、マイクロソフトの異議は無効

最近、米国商務省産業安全保障局(BIS)は、サイバーセキュリティ分野に関する最新の輸出管理規制を正式...

...

今年のダブルイレブンでは、ドローン、無人運転車、ロボットがすべて配備されます!

近年、科学技術革命と産業変革の新たな局面の始まりに伴い、わが国の物流業界は情報化、デジタル化、インテ...

学術専門家を募集中 | 過去 10 年間に人工知能の 21 のサブ分野で引用数の多い学者

人工知能は、特に過去 10 年間で急速に発展しました。人工知能の分野は、自然言語処理、コンピューター...

Tongyi Qianwenが再びオープンソース化、Qwen1.5は6つのボリュームモデルを導入、そのパフォーマンスはGPT3.5を上回る

春節の直前に、同義千文モデル(Qwen)バージョン1.5がリリースされました。今朝、新バージョンのニ...

...