OpenAIを去った偉人カパシ氏は「教え始めた」。おなじみのミニコードスタイルのまま、新しいプロジェクトが日々増えている。

偉大なカルパシー氏はOpenAIを辞任し、当初は1週間の休暇を取ると脅していた。

写真

しかし、瞬く間に、新しいプロジェクトが GitHub で公開され、毎日何千ものスターを獲得しました。

写真

相変わらずおなじみのカードの方式:

大規模モデルのトークン化で一般的に使用される BPE (バイトペアエンコーディング) アルゴリズムを処理し、アルゴリズムの最小かつ最もクリーンなコードバージョンを実装するための 74 行の Python コード。

平：

写真

約 30,000 個の星がある nanoGPT に少し似ているように感じますか?

この波はネットユーザーに本当に推測させました:

調理の時間です。

結局のところ、カルパシー氏は、テスラ社の元AIディレクターやOpenAIの創設メンバーという肩書きに加え、ネットユーザーの間では「AI分野の偉大な慈善家」や「複雑な問題を単純化するのが得意なカルパシー先生」（犬の頭）として最もよく知られている。

BPE コードの最小化バージョン

今回カルパティ先生がどんなご飯を作ったのか、詳しく見てみましょう。

写真

プロジェクト名 minbpe がすべてを物語っています。つまり、BPE アルゴリズムの最小かつ最もクリーンなコードバージョンです。

BPE (Byte Pair Encoding) は、GPT-2 で普及したトークン化アルゴリズムです。現在、GPT シリーズ、Llama シリーズ、Mistral を含む多くの大規模モデルがこのアルゴリズムを使用して単語セグメンテーションをトレーニングしています。

BPE の主な利点は次のとおりです。

効率的: 頻繁に発生するバイトペアをマージして語彙を徐々に構築することで、モデルが処理する必要がある語彙のサイズを効果的に削減できます。
柔軟性: 語彙にない単語は、処理のために既知のサブワードに分解できるため、モデルがトレーニングで出現しなかった単語を理解して生成するのに役立ちます。

minbpe プロジェクトでは、Karpathy は 2 つのトークナイザーを提供しており、どちらもトークナイザーの 3 つの主な機能を実行できます。

特定のテキストに基づいた語彙のトレーニングとマージ操作
テキストをトークンにエンコードする
トークンをテキストにデコードする

具体的には、basic.py では、minbpe は 74 行の Python コードを使用して、テキスト上で直接実行される BPE アルゴリズムの最も単純な実装を完了します。

写真

regex.py では、minbpe は正規表現を使用して入力テキストをさらに分割する正規表現トークナイザーを実装します。

さらに、正規表現トークナイザーに基づいて、minbpe は gpt4.py で GPT4Tokenizer も提供しており、オンライン tiktoken ライブラリの GPT-4 を正確にトークン化できます。

注: Tiktoken は高速な BPE トークナイザーです。

写真

base.py は、トレーニング、エンコード、デコード用のスタブが含まれ、保存および読み込み機能を提供し、いくつかの一般的な補助ツール機能を統合する基本クラスです。実際のアプリケーションでは、開発者はこの基本クラスを継承して特定の単語分割機能を実装する必要があります。

カルパシー氏は、テイラー・スウィフトのWikipediaテキストで2つの主要なトークナイザーのトレーニングを試みたと述べました。 train.py を M1 MacBook で実行すると約 25 秒かかります。

まだ質問がある場合は心配しないでください。Ka先生がビデオを公開する予定です。

写真

Karpathy 氏は OpenAI を去りましたが、彼の「次の章」は Large Language Model System (LLM OS) になるだろうと多くの人が推測しています。

写真

彼の正式な職業はまだ明らかにされていないが、カルパシーはすでに「人々を教え、教育する」という副業を始めているようなので、皆さんも始めることができるだろう。

参考リンク: https://github.com/karpathy/minbpe/

<<: GitHub ホットリスト 1 位: 数百万のトークンコンテキスト、動画も生成可能、カリフォルニア大学バークレー校制作

>>: AIを使ってアニメーションを作成する方法と、さまざまなツールがあなたを待っています

OpenAIを去った偉人カパシ氏は「教え始めた」。おなじみのミニコードスタイルのまま、新しいプロジェクトが日々増えている。

BPE コードの最小化バージョン

ヘルスケアにおける機械学習の悪影響

欧州宇宙機関が初のAI衛星を打ち上げ、AIチップ＋アルゴリズムで雲画像をフィルタリング

AIのために知っておくべき10のディープラーニング手法

近年、軍事用人工知能スタートアップが人気を集めている理由

オンライン学習の次の波: 現代の学習システムにおける人工知能

AI エージェントに協力と競争を教えましょう。最初の大規模マルチエージェントフレームワークであるCAMELは3.6kのスターを獲得しました

Analysys OLAP アルゴリズムコンペティションの結果が発表され、オープンソースグループのダークホースがその腕前を披露しました。

データベース向けに設計: DB-GPTはプライベートLLMテクノロジーを使用して、次世代のデータベースインタラクションを定義します。

推薦する

地球全体をシミュレート: Nvidia の Earth-2 スーパーコンピューターが間もなくオンラインになります

効率が1200倍にアップ！ MIT、医薬品製造向けの新たなAIモデルを開発

GTA6のトレーラーは1億回以上再生されており、3人のAI巨人も数秒でGTAギャングに変身できる

Nvidiaの次世代GPUが発表、H100を超える！最初の3nmマルチチップモジュール設計は2024年にデビュー予定

AI を活用した検索と推奨はどれほど強力でしょうか?

Google DeepMindの中核責任者が、AIエージェントを目指して自身のビジネスを立ち上げるために辞職したことが明らかになりました。ジェミニの元責任者

テスラ、マイクロソフト、グーグル、アップルなどを含む1,000件以上の「AIロールオーバー」事件が発生しています。

新しい機械学習の考え方を使用して、自然な異常と人間の誤解を区別する

人工知能2.0の時代、機械にスマートな脳を搭載する方法

2018年、ブロックチェーンは監査人の仕事を破壊するでしょうか?

新しい報告書が確認：慎重に扱わなければ、人工知能は現実版「ブラックミラー」になる

自動運転車のソフトウェアアップグレードに関する技術管理と規制戦略の分析