機械学習を知っていれば十分でしょうか?次世代のデータ サイエンティストは「フル スタック」へと移行しています。

機械学習を知っていれば十分でしょうか?次世代のデータ サイエンティストは「フル スタック」へと移行しています。

[[342168]]

データサイエンスは、特にコンピューターサイエンス、統計、ビジネス分析、エンジニアリング管理、物理学、数学などのバックグラウンドを持つ若者にとって、常に魅力的な分野です。しかし、霧の中で花を見るというのは、いつもはっきりしないものです。データサイエンスの背後には多くの謎があり、機械学習や統計だけではない、と人々はいつも考えています。

長年にわたり、私は多くの専門家とデータサイエンス分野に参入する方法について議論してきました。データ サイエンスはなぜいつもこれほど話題になっているのでしょうか。この分野に参入するのに役立つのは、今でも統計学と機械学習でしょうか。今後もそうなるでしょうか。

2か月前、私は大学院を卒業してすぐにメディア大手のViacomCBSにデータサイエンティストとして入社しました。研究助手およびインターンシップ以外のフルタイムの業界経験はありません。私の職務は、この記事に記載されている作業方法のほとんどを使用して、ML 製品の構想から開発、製造まで多岐にわたります。この記事が、この分野に参入することに興味を持っているすべてのデータ サイエンティストと機械学習エンジニアに役立つことを願っています。

データサイエンスについてはなぜいつもこれほど大騒ぎになっているのでしょうか?

ほぼすべての人がデータサイエンスに携わりたいと思っています。数年前、データサイエンスの分野では需要と供給の問題が発生していました。DJ Patil博士とJeff Hammerbacherがデータサイエンスという用語を作り出して以来、データサイエンティストの需要が大幅に増加し、関連する人材が不足しているようです。

2020年までに状況は改善しました。正式な教育や MOOC 教育を受けたデータサイエンス愛好家の数が増え、人材の需要も高まっていますが、前者ほどではありません。この用語はますます広範囲に及ぶようになり、データ サイエンスの作業に必要な機能のほとんどを網羅するようになりました。誰もがデータサイエンスについて話しますが、ほとんどの人は実際にそれをどのように行うのか知りません。

データ サイエンスが常に話題になっているのには、いくつかの理由があると思います。

  • 最先端の開発
  • 仕事への満足度が高い
  • ビジネスに大きなインパクト
  • データ生成の増加
  • データ サイエンティストという肩書きの背後にある神秘性
  • データは素晴らしいですね!(文字通りではありませんが~)
  • 多くの学校やブートキャンプがデータサイエンスの学位を提供しています
  • 多くの求人サイトでは、この職業を最もホットな職業として評価しています(過去 3 年間、Glassdoor によって米国で最もホットな職業として評価されています)。

自分をデータサイエンティストと呼ぶ人ですか?

人々はいつもこのように自己紹介をするので、業界の現状について真実をお話ししましょう。

求人需要の増加とデータサイエンティストの魅力的な肩書により、多くの企業が製品アナリスト、ビジネスインテリジェンスアナリスト、ビジネスアナリスト、サプライチェーンアナリスト、データアナリスト、統計学者の職をデータサイエンティストに変更し始めています。これは、多くの人が仕事を辞めてデータサイエンティストの職に応募する一方で、実際にはこれらの企業が提供する仕事は同じであることが多いためです。

多くの人は、自分の役職名の言葉が少し変わるだけで、尊重されていると感じます。そのため、企業は、データ サイエンティスト - アナリティクス、製品データ サイエンティスト、データ サイエンティスト - 成長、データ サイエンティスト - サプライ チェーン、データ サイエンティスト - 視覚化、データ サイエンティストなど、自社のポジションをより目立たせ、魅力的にするために、同じように職種名​​を変更しています。他に何を追加できないでしょうか?

教育やオンライントレーニングを受ける人のほとんどは、すべてのデータサイエンティストが高度な機械学習モデルを構築できると誤解していますが、この認識は完全に正しいわけではありません。これは私が応用データサイエンスの修士課程を始めたときに考えたことで、ほとんどのデータサイエンティストは機械学習を行っていると思っていました。

しかし、アメリカでインターンシップや仕事を始めると、徐々に真実がわかってきました。データ サイエンスへの移行の原動力となっているのは、人工知能とそのビジネスへの影響に関する誇大宣伝です。

次世代のデータサイエンティスト — 機械学習

2020 年現在、博士号を取得せずにデータ サイエンティスト ML トラック (データ サイエンティスト アナリティクス トラックではないためこのように呼ばれています) として応用機械学習を行おうとする人にとっては、データセットに機械学習を適用すること (これは誰でも実行できることです) 以外にも多くの選択肢があります。面接で役立つかもしれない、私の経験からいくつかの重要なポイントをお伝えします。

  • 分散データ処理/機械学習: 大規模なデータ/ML パイプラインを作成できることを示す、Apache Spark、Apache Hadoop、Dask などのテクノロジーの実践的な経験。これらのテクノロジーのいずれかの経験があれば有利ですが、Apache Spark (Python または Scala を使用) をお勧めします。
  • 実稼働機械学習/データ パイプライン: Apache Airflow を実際に体験してみるのは素晴らしいことです。 Apache Airflow は、データと機械学習のパイプラインを作成するための標準的なオープンソースのジョブ オーケストレーション ツールです。業界ではすでに使用されているので、これを学習して、それを中心にいくつかのプロジェクトを構築することをお勧めします。
  • DevOps/クラウド: データ サイエンスの分野では、多くの人が DevOps を過度に無視しています。インフラストラクチャがない場合、どのように ML パイプラインを構築しますか? コースで行ったように、ローカル マシンで実行されるノートブックやコードを構築するのは簡単ではありません。記述するコードは、自分またはチーム内の他のユーザーが作成するインフラストラクチャ全体で拡張可能である必要があります。

多くの企業はまだ ML インフラストラクチャを構築しておらず、開始するための人材を探している可能性があります。コース内でも、Docker、Kubernetes に慣れ、Flask などのフレームワークを使用して ML アプリケーションを構築することが標準的な実践になるはずです。 Docker が好きな理由は、そのスケーラビリティと、インフラストラクチャ イメージを構築して Kubernetes クラスター上のサーバー/クラウドにそれを複製する機能があるからです。

  • データベース: データベースとクエリ言語に関する知識は必須です。 SQL は見過ごされがちですが、クラウド プラットフォームやデータベースに関係なく、業界標準であり続けます。 leetcode で複雑な SQL の練習を始めると、前処理が完了したときにウェアハウスからデータをインポートする責任があるため、DS プロファイルのコーディング面接のセクションで役立ちます。これにより、ML モデルを実行する前の前処理が簡素化されます。ほとんどの特徴エンジニアリングは、SQL を使用してデータをモデルに転送するときに実行できますが、多くの人がこれを見落としています。
  • プログラミング言語: データサイエンスに推奨されるプログラミング言語は、Python、R、Scala、Java です。これらのいずれかを知っていれば、問題を解決するのに役立ちます。 ML タイプの求人の場合、面接プロセス中にライブ コーディングが行われるため、Leetcode や Hackerrank など、自分が効率的だと感じる場所で練習する必要があります。

現在、業界内で重要なコネクションを持っている(ネットワークは非常に重要です!)か、優れた研究実績を持っているという幸運に恵まれない限り、機械学習や統計を知っているだけでは、データサイエンスの分野に進み、ML を学ぶことはできません。ビジネスアプリケーションやドメイン知識には多くの場合、実務経験が必要ですが、関連業界でのインターンシップ以外では事前に取得することはできません。

私もデータサイエンスの岐路に立っており、現在、次世代のデータサイエンティストがこの分野に参入することへの需要が形になりつつあるのを目の当たりにしています。この業界は日々変化しており、それに追いつくためには常に自分自身を調整する必要があります。

この記事はWeChatの公開アカウント「Reading the Core」から転載したもので、以下のQRコードからフォローできます。この記事を転載する場合は、Duxinshu の公開アカウントにご連絡ください。

<<:  スマートシティ: 統合管理プラットフォーム

>>:  モノのインターネット向けのデータストリーミング、AI、機械学習プラットフォームを構築する方法

ブログ    

推薦する

...

メタバースは過大評価されてきたが、2050年までにAIによって現実のものとなる

メタバースの概念が誇張され、まるでそれが本当に存在するかのように人々が話していることは間違いありませ...

プログラマーが知っておくべき10の基本的な実用的なアルゴリズムとその説明

アルゴリズム1: クイックソートアルゴリズムクイックソートは、Tony Hall によって開発された...

LeCun の最新インタビュー: 物理世界が最終的に LLM の「アキレス腱」となるのはなぜでしょうか?

人工知能の分野では、65歳になってもソーシャルメディアで活発に活動しているヤン・ルカンのような学者は...

科学者たちは、脳波を3%という低いエラー率で直接テキストに変換する「心を読む」方法を開発した。

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

Apple、新しいGPUアクセラレーションツールCreate MLをリリース

Appleは本日、カリフォルニア州サンノゼで2018年ワールドワイド開発者会議を開催し、4つの主要な...

MITのコンピューターの先駆者ジョエル・モーゼス氏が死去! 50年前にコンピューターに微積分を教えた

コンピューターの専門家がまた一人亡くなりました! 著名なコンピューター科学者で、MITのコンピュータ...

...

ニューラルネットワークの過剰適合を避ける 5 つのテクニック

この記事では、ニューラル ネットワークをトレーニングするときに過剰適合を回避する 5 つの手法を紹介...

FacebookはVRキーボードを使ってデータを入力する方法を開発中

海外メディアの報道によると、仮想現実(VR)でオフィスワークを遂行するのは容易ではないという。本当に...

企業にとって重要なAI技術のトレンド

[[428061]]マッキンゼー・アンド・カンパニーが2020年に実施した人工知能に関する世界的な調...

...

NetEase Cloud Musicのリアルタイムデータウェアハウスガバナンス最適化の実践

1. 現状と問題点1. 現状と問題点Cloud Music データ ウェアハウス プラットフォームは...

...

GPT-4 の王冠は落ちていません!クロード3アリーナの人間投票結果が発表されました: 3位のみ

クロード 3 のアリーナ ランクがついに登場:わずか 3 日間で 20,000 票が集まり、リストの...