Github のトップ 5 オープンソース機械学習プロジェクト!データ計算が最大80倍高速化!

Github のトップ 5 オープンソース機械学習プロジェクト!データ計算が最大80倍高速化!

挑戦的なオープンソース機械学習プロジェクト 5 つで、2020 年を良いスタートを切りましょう。これらの機械学習プロジェクトは、Python プログラミングや NLP など、幅広い分野をカバーしています。

データサイエンスへの移行方法を模索する人が増えています。大学を卒業したばかりの人、業界に比較的最近参入した人、中堅の専門家、あるいは単に機械学習に興味がある人など、誰もがデータサイエンスの分野に参入したいと考えています。

最先端のフレームワークとライブラリに慣れていただくために、オープンソースの機械学習プロジェクト 5 つ(2020 年 1 月に作成)を厳選しました。 自然言語処理 (NLP) から Python プログラミングまで、あらゆることが学べます。

1. Reformer – PyTorch での効率的な移行

Transformer アーキテクチャは自然言語処理 (NLP) の状況を変えました。 BERT、XLNet、GPT-2 など、多くの NLP フレームワークが生まれました。

しかし、皆さんのほとんどが共感できる問題が 1 つあります。それは、これらのトランス駆動モデルが非常に大きいことです。 これらは最先端の結果をもたらしますが、それを学んで実装したいほとんどの人にとっては高価すぎて手の届かないものです。このプロジェクトの作成者は、独自のモデルを構築するのに役立つ、シンプルでありながら効果的な例とコード全体を提供しています。

2. PandaPy – 最も人気のあるPythonライブラリ

私は先週 PandaPy を発見し、現在のプロジェクトで使用しています。 これは、主流になる可能性を秘めた魅力的な Python ライブラリです。

混合データ型 (int、float、datetime、str など) を使用する機械学習プロジェクトに取り組んでいる場合は、Pandas ではなく PandaPy を使用してみてください。 これらのデータ型の場合、Pandas よりもメモリ消費量が約 3 分の 1 少なくなります。

興味深いと思われる 3 つの主要領域を以下に示します (これらのポイントは PandaPy GitHub リポジトリからそのまま引用したものです)。

1) 小さなデータセット(プラス、マルチサイン、対数など)での単純な計算では、PandaPyはPandasよりも25倍から80倍高速です。

2) 小さなデータセットのテーブル関数 (グループ化、ピボット、ドロップ、結合、フィル、ポピュレートなど) の場合、PandaPy は Pandas よりも 5 倍から 100 倍高速です。

3) PandaPyは、小規模なデータを扱うほとんどのユースケースでDask、Modin Ray、Pandasよりも高速です。

3. Google Earth Engine – 地理空間データを分析するための 300 以上の Jupyter ノートブック

素晴らしい GitHub リポジトリですね! 多くのデータ サイエンティスト志望者からソーシャル プラットフォーム上で連絡があり、地理空間分析を始めるにはどうすればよいかを尋ねられました。 これはペタバイト単位のデータが利用できる非常に興味深い分野です。 必要なのは、それをクリーンアップして分析するための構造化された方法だけです。この素晴らしいリポジトリには、Google Earth Engine データの操作例を含む 300 を超える Jupyter Notebook が集められています。

[[318927]]

これらのノートブックは、コードを実行するために 3 つの Python ライブラリに依存しています。

  • アースエンジン Python API
  • フォリウム
  • ジーハイドロ

GitHub リポジトリには、初心者が始めるのに役立つ Python コードの例が多数含まれています。

4. 自動ビジュアル分析

初心者向けのもう一つの高品質なデータ視覚化のアイデアをご紹介します。 データ探索ステップを自動化するというアイデアは、実質的なフレームワークがないまま、しばらく前から浮上していました。自動ビジュアル分析は、ビジュアル分析を AI 駆動型かつ自動化することを目的としています。

5. Fast Neptune – 機械学習プロジェクトの加速

再現性は、研究と産業の両方において、今日のあらゆる機械学習プロジェクトの重要な側面です。 実行するすべてのテスト、すべての反復、機械学習モデルのすべてのパラメーター、および結果を追跡する必要があります。

Fast Neptune ライブラリを使用すると、機械学習実験を開始するために必要なすべての情報をすばやく記録できます。 言い換えれば、Fast Neptune は、上記の段落を読んだときにおそらく尋ねた再現性の質問に対する答えです。

迅速な実験を行うために Fast Neptune が使用する機能は次のとおりです。

  • コードが実行されているコンピュータに関するメタデータ(オペレーティングシステムと OS バージョンを含む)
  • 実験を実行するためのノートブックの要件
  • エクスペリエンス中に使用されるパラメータ。値を追跡する変数の名前を示します。
  • 実行時にログに記録するコード

最先端のテクノロジーは急速に進歩し続けており、初心者にとってはそれに追いつくのが大変な場合があります。ハングリー精神を持ち続けましょう!

<<:  テクノロジーがコロナウイルスと戦う10の方法

>>:  ファーウェイ、加算のみを使用するニューラルネットワークをオープンソース化:インターン生が開発を主導、効果は従来のCNNと同等

ブログ    
ブログ    
ブログ    

推薦する

...

私の国における人工知能の発展に対する最大の圧力は、基礎理論と独自のアルゴリズムです。

業界では、人工知能はこれまで2世代を経てきたと一般的に考えられています。第一世代の人工知能は知識主導...

人工知能によりデータセンターの設計が再考される

AI が企業で大規模に導入されるにつれて、データセンターのワークロードのより大きな割合が AI によ...

...

MITが脳制御ロボットを開発:脳波を使ってロボットのエラーを修正できる

ロボットが人間のように行動するためには、人間を理解する必要があります。多くの場合、それは妥協しなけれ...

DeepMind: 畳み込みネットワークは ViT ほど優れていないと誰が言ったのですか?

ディープラーニングの初期の成功は、畳み込みニューラル ネットワーク (ConvNet) の開発による...

...

ハイパーオートメーション – AIの新時代における自動化

「自動化」の本質的な意味は変わりませんが、その用語の使用法は時間の経過とともに確実に変化してきました...

人工知能とビッグデータは私たちの生活をこのように変えるだろう

現在、知能ロボットが急速に発展していますが、機械を知能化するための鍵は実はビッグデータです。ビッグデ...

自動駐車を徹底研究!業界標準の動向、評価指標、システム紹介まであらゆる角度から収集!

この記事は、Heart of Autonomous Driving の公開アカウントから許可を得て転...

機械学習について昨日、今日、そして明日に語りましょう

機械学習今日、機械学習は、そのアルゴリズムの1つであるディープラーニングの優れたパフォーマンスを誇っ...

傲慢か偏見か?AIはあなたの美的観念に影響を与えていますか?

数日前、TikTokで、ある親がTikTokの特殊効果を使って子供の年齢と容姿を計測する動画を見まし...

約 200 以上の自動運転データセットの包括的な調査!データクローズドループプロセス全体の概要

序文と個人的な理解自動運転技術は、最新のハードウェアとディープラーニング手法の進歩により急速に発展し...

AIはスペインの流行において重要な役割を果たし、新規感染者の死亡率を半減させた。

[[361228]]スペインは、感染者数が170万人を超え、欧州で新型コロナウイルスのパンデミック...